AI Pulse
📡 X 信号

AI agent拼长期任务,赢的居然不是点子最好的

强大的AI智能体仍然难以胜任长期研究工作,因为它们经常无法坚持测试和改进。

这篇论文表明,如今最强的研究智能体获胜,更多靠的是拒绝停止测试,而非自身卓越能力。

论文提出了AutoLab,一个包含36项任务的基准测试,每个智能体从可运行但孱弱的代码起步,必须在固定时间限制内对其进行优化。

任务涵盖系统加速、谜题、模型开发和CUDA内核工作,因此这项测试不只是要求一次性写出代码,而是要管理一整个长工作周期。

作者测试了17个强大模型,发现最优结果主要不是来自初始创意足够优秀,而是来自模型保持活跃、频繁测试,以及善用反馈。

最好的初始创意并不是成功的最强预测因素;坚持才是。Claude Opus 4.6在基准测试中领先,不是因为它总能立刻猜中正确方向,而是因为它持续进行基准测试,并将经验反馈整合到下一次尝试中。

其他多个前沿模型的失败方式更具启示意义:它们要么还有剩余时间就提前退出,要么思考太久,以至于还没提交任何有用成果就耗尽了时间。

---- arxiv.org/abs/2606.05080
标题:《AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?》

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部