首页 >  新闻中心 > 媒体报道

Share - WeChat

据阿根廷布宜诺斯艾利斯经济新闻网8月18日文章,一项研究表明,人工智能仍然无法自主进行原创科学研究。据科技探索网站指出,尽管智能体已经能够编写代码、运行实验和检索学术文献,但仍然无法在无需人类干预的情况下进行开放式研究。

这是一项要求严苛的测试,结果不尽如人意。这些智能体拥有完全的互联网访问权限、专用计算能力以及近3000美元的模型使用额度,经过连续6天的自主工作之后,这些智能体生成的文章在人类审稿人的总体评估中均被明确给予拒稿评分,分别只有2/6和1/6的评分。

这项发表在预印本文献库(arXiv)上的研究评估了人工智能进行开放式研究的能力。

开放式研究不同于回答封闭式问题或总结现有信息。根据arXiv的介绍,这类研究需要提出假设、根据不利结果重新设计实验,并保持连贯的科学推理。

参与这项研究的机构包括普林斯顿大学、英国人工智能安全研究所、多伦多大学、加利福尼亚大学伯克利分校、乔治敦大学、约翰斯·霍普金斯大学和斯坦福大学等。

该研究的作者测试了一些目前最前沿的工具,这些工具被描述为旨在自主执行复杂多步骤任务的系统。为此,他们给这些工具输入了两篇提交给人工智能会议、当时尚未公开发表的论文。此举旨在防止模型在互联网上找到已有的答案。

分配的主题有两个:语言模型角色结构和可控性,以及设计一种用于识别表格基础模型中分布变化的检测器。

提交结果之后,研究人员使用与提交给顶级人工智能会议的论文相同的评审标准,对人工智能生成的文章进行了评审。

结果显而易见:智能体理解了所研究的问题,并提出了一些与原研究人员类似的探究方向,但它们的科学推理能力不足。实验设计能力薄弱,面对负面反馈时,它们倾向于对之前的研究结果加以补充说明,而不是重新思考研究。

人类审稿人的评价尤为严厉。英国人工智能安全研究所的研究员、该研究的专家审稿人戴维·阿非利加指出:“实验设计和方法论上的决策既奇怪又难以理解。结果明显是事后做出决策的产物。”

在另一项评估中,多伦多大学的研究员对其中一个结论的逻辑提出了质疑:“在利用PFN的内部元素测试了一些失效信号之后,就得出‘没有我们可以利用模型内部元素的信号’的结论,这是一种‘以例为证’式的谬误,是非常不科学的。”

主要局限不仅在于技术层面,也在于方法论层面。研究还揭示了一个流程管理问题。尽管有足够的空间进行更深入的探索和测试,但智能体未能合理利用时间,仅使用了不到一半的应用程序编程接口(API)调用额度。

急于求成、资源利用率低下以及方法论上的缺陷,导致最终呈现的文章远不能达到可发表的标准。即使时间充裕,系统却急于完成任务,而没有对正在研究的问题进行更深入的探究。

这项发现直接回应了关于人工智能未来最常被提及的承诺之一:目前,模型尚无法在原创性研究方面取代科学家。研究人员认为,这些工具在短期内最可能扮演的角色并非自主发现者,而是实验室中执行常规任务的助手。(编译/王萌)

2022年7月12日,世界互联网大会国际组织正式成立,从互联网领域的国际盛会发展为国际组织,总部设于中国北京。我们将致力于搭建全球互联网共商共建共享平台,推动国际社会顺应信息时代数字化、网络化、智能化趋势,共迎安全挑战,共谋发展福祉,携手构建网络空间命运共同体。