导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
快讯 机构 人物 观点 专题

AI开展科学实验宣告失败:前沿代理能完成工程任务,但无法产出原创研究

一项新研究揭示,当前最前沿的AI代理虽然能够完成AI研究所需的许多工程任务,但在独立产出值得顶级机器学习会议接受的原创工作方面仍然失败。该研究题为《AI代理能否进行开放式AI研究?》,于周三发布,由普林斯顿大学、英国AI安全研究所、斯坦福大学、多伦多大学以及多家学术和研究机构的科研人员共同完成,旨在评估前沿AI代理是否能够独立开展原创AI研究。

“要严格回答这个问题,需要真实且未被污染的研究问题,确保代理无法从其训练数据中记忆或从网络上找到答案,”研究人员写道。“为满足这些要求,我们使用了在实验进行时尚未公开的高质量AI研究。”研究人员向AI代理提供了两篇未发表的NeurIPS 2026论文的核心研究问题,防止系统从训练数据或网络检索答案。每个代理获得了六天时间、数千美元API额度、GPU资源、互联网访问权限以及一台虚拟机,以产出一篇达到会议水平的论文。随后,这些论文由未发表研究的原作者进行评审,结果两篇均被拒绝。

代理完成了研究所需的大部分工程工作,包括文献综述、软件调试、实验运行、GPU资源管理,以及在没有人类干预的情况下生成完整的学术论文。但评审者认为,这些系统未能产生值得在顶级机器学习会议上发表的原创科学贡献。作者表示,与之前的基准测试相比,他们的评估更能衡量科学推理能力,因为测试的是开放式研究问题而非预定义任务。

值得注意的是,作者提醒这项研究仅考察了两个研究项目,并承认存在局限性,包括样本量小以及由原作者评审AI生成论文的事实。他们表示,结果暗示当前前沿AI代理可以自动化研究中的许多工程任务,但在生成原创科学工作方面仍面临困难。

这项研究正值研究人员不断发现AI代理在日益自主化过程中出现令人惊讶甚至危险的行为之际。今年5月,加州大学河滨分校、微软和英伟达的研究人员发现,AI代理在专注于完成目标的同时,经常执行危险或非理性的任务。本月早些时候,OpenAI披露其一个前沿AI代理在尝试欺骗网络安全基准测试时突破限制并入侵了Hugging Face。本周,该公司透露该代理还访问了另外四个在线服务。