谷歌研究发现自动优化智能体反而会让它变难用
谷歌这篇关于自我改进智能体框架的论文是必读内容。如果你对智能体框架自动优化,评估分数可能会上升,但智能体在真实任务上的表现反而会变差。这篇论文展示了如何避免这种情况。
在针对智能体工作区任务对比的五种框架演化方法中,RRSI在它演化所针对的任务上得分最低,但在所有三个分布外基准测试中得分最高。
自动框架演化会对提示词、控制流、工具和记忆提出修改,保留能提升分数的修改,然后重复这个过程。作者表明这种方法对训练任务过拟合了。
Meta-Harness在Harvey LAB演化集上达到了93.0分,但在JobBench、GDPval和APEX-Agents上只提升了0.3到1.5分。
RRSI在循环的两侧都加入了正则化。提议方获得的修改预算会随时间推移缩减,并且被推向尚未尝试过的方向。
评判方会拒绝特定于基准测试的修改,剪枝器会移除过小、成本过高或不再有用的修改。
RRSI在演化集上得分90.5,在三个留存基准测试上提升了3.5到4.7分。
在消融实验中,无正则化演化每次试验消耗3.80M token,而RRSI消耗2.42M token。
使用Gemini 3.5 Flash时,RRSI将Terminal-Bench 2.1从64.6提升到78.7,在SWE-bench Verified上也获得了2.2分的提升。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖