发布AutoResearchExam基准测试,测AI研究Agent
我们推出了 AutoResearchExam,这是一个针对开放式机器学习和工程任务的基准测试。
我们的基准测试覆盖七个研究领域,包括模型训练、数据整理、AI 安全和可解释性。
在每个任务中,我们给智能体 24 小时时间,提供一台带 CPU 或 GPU 的机器,让它们通过实验和反馈开发并改进自己的解决方案。我们通过综合分数同时衡量速度和质量。
我们的基准测试有一个独特特点:测试智能体创造的改进在它们从未见过的数据上是否依然成立。我们发现,AI 研究智能体在尝试改进时经常会过拟合。
我们在前沿领域看到了有趣的正面比较:Astra 起步最强,领先优势保持了长达 19 小时,但 Fable 5.1 在最后几小时迎头赶上,拿到了第一名的位置。
Qwen3.8 Max、Gemini 3.8 Flash 和 Grok 4.6 都落在性价比帕累托前沿上,在较低 API 预算下提供了强大的选择。
Anthropic 的 Opus 和 Fable 在隐藏测试上保留了几乎全部验证性能,差距仅为 1.1% 和 2.9%。Astra 对 Sol 的改进也延伸到了泛化能力上,差距从 6.9% 降到了 1.7%。
(1/n)
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖