AI Pulse

AI智能体未看论文结果,自主重现62.7%的原始发现

摘要:最近的AI系统在给定明确定义的指标时,已在科学发现方面取得快速进展,但它们能否自主开展开放式科学发现仍不清楚。我们研究了AI在Station中处理开放式任务的能力。Station是一个开放世界环境,多个智能体在其中模拟科学生态系统。为了应对开放式任务特有的挑战,我们提出为Station增设两种机制:监督机制和周期性元反思,这两种机制即使在缺乏中间指标的情况下也能鼓励持续探索。我们从ICLR上展示的三篇近期口头报告中构建了开放式任务。我们向智能体提供每篇论文研究的主要问题,但不提供论文的结果,并禁用网络访问。然后,我们衡量智能体重新发现了多少原始发现——这些发现被划分为逐条标准。我们发现,Station平均重新发现了62.7%的标准,而Codex Multiagent-v2为15.4%,AI Scientist-v2为14.4%–20.6%。消融和行为分析表明,同时添加这两种机制可提高研究覆盖面和连续性。我们进一步在两项没有参照论文的开放式任务上评估了Station,发现智能体做出的一些发现与研究人员在知识截止日期之后报告的发现高度吻合。综上所述,这些结果表明,合适的环境能使智能体在开放式科学发现中自主取得有意义的进展。

阅读原文
📚 相关主题 科学研究研究

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新