让AI代理做AI研究,结果全被作者拒了
AI 智能体能否开展开放式 AI 研究?目前大多数针对智能体从事 AI 研究的评估,都聚焦于范围明确、可验证的任务。但 AI 研究本身往往是开放式的。研究人员要自己选择假说、判断什么证据适用,还要识别出失败的研究方向。
我们给智能体布置了两篇未发表论文的研究问题,提供了六天时间,以及数千美元的 API credits 和算力。原论文作者随后评审了 AI 生成的论文,明确拒绝了智能体的产出。
我们将这类评估称为“影子评估”,因为智能体是在复刻作者原本的研究工作。智能体在大多数工程任务上都能流畅完成工作,它们能做正经的文献综述,调试 GPU 环境,运行数百次实验,还能在无人帮助的情况下产出可直接出版的 LaTeX 终稿。
我们也没有发现奖励黑客的证据。如果说有什么相反的情况,那恰恰反过来:智能体一开始会提出可商业化的主张,随着证据逐渐出现,又会退回去改成阴性结果。
但两份智能体产出都远达不到顶会论文的标准,两篇都出现了类似的问题:对提交给顶会的 AI 论文的接收标准判断失误、缺乏创造性解决问题的能力、回溯调整无效、资源意识差,还有指令偏移。
1) 对顶会接收标准判断失误。智能体对提交给顶会的 AI 论文的接收标准建模很差。我们允许智能体自我评审论文。尽管论文质量很差,它们的评审大多还是把论文标注为“弱拒稿”。
2) 缺乏针对反馈解决问题的创造性。当收到负面评审意见时,智能体通常只是缩小假说和主张范围,而非想出创造性方法来解决这些问题。
3) 回溯调整无效。智能体在实验开始后的前15小时内就放弃了最宏大的假说,之后再也没有调整研究方向。
4) 资源意识差。两次运行结束后,一半以上的 API 预算都没有花掉。其中一个智能体在截止日期前七小时就宣布自己完成了工作,刚好是在它自己的自我评审返回另一份拒稿意见之后。
5) 指令偏移。它们没有遵守关于最低探索时间、整合评审反馈、以及论文篇幅的明确指令(两份产出都超过了页数限制)。
这个研究设计存在很多局限性。局限包括样本量小、非双盲评审,且评审者知道作品是 AI 生成的。我们也没能测试 Anthropic 最强的模型,因为 Fable 5 在前沿 AI 研究任务上有刻意限制,所以我们最终在主实验使用了使用 OpenClaw 搭配 Opus 4.8(超高),稳健性检验使用 Codex 搭配 Sol 5.6(极致)。
但我们认为这个研究设计对评估 AI 智能体的研究能力仍然有帮助,它是对可验证任务评估的补充。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖