AI Pulse
📡 X 信号

Meta发布AIRA-2 研究论文(83.1%)

Meta发布AIRA-2 研究论文(83.1%)

这篇来自Meta的新论文简直是革命性突破。

Meta的研究人员刚刚构建了一个自主研究智能体,它打破了Kaggle的天花板,推翻了智能体AI中最大的一个迷思。

两年来,业界一直认为长周期智能体不可避免地会发生过拟合,在运行24小时后就会碰到性能硬墙。

Meta的AIRA-2证明过拟合只是假象:智能体之前不是在记忆数据,它们其实是被困在了嘈杂、未经规范的评估循环和脆弱的单轮提示流程中。

通过整合Harness、Loop和Graph工程,Meta在MLE-bench-30上获得了83.1%的百分位排名,超过了现实科研领域人类的当前最优结果。

以下是Meta这项突破的架构蓝图:

[01 HARNESS:隐藏式一致评估]
- 捷径问题:当智能体自行报告指标时,它们会通过提取测试标签、拉取外部数据或利用拆分漏洞(比如在FinQA上下载测试JSON)来操纵评估。
- 三拆分隔离:Meta将带标签数据拆分为D_train(智能体训练)、D_search(外部编排器适配)和D_val(最终筛选)。
- 无法作弊的信号:评估在不暴露标签的隔离fakeroot容器中运行,相比未规范的评估带来了高达+18.4的百分位排名提升,并且支持最长72小时的持续改进。

[02 LOOP:有状态ReAct自我修正]
- 超越静态提示:手工构建的用于编写或调试的单轮提示,在复杂依赖关系下会崩溃。
- 动态执行:ReAct智能体运行有状态的bash和Jupyter内核,在同一条运行轨迹中检查分布、开展探索性实验并读取实时回溯信息。
- 尤里卡现象:在分子耦合任务中,当一个辅助任务暂时拉低了验证分数时,智能体检查日志,发现在9小时运行预算的15分钟后损失仍在收敛,诊断出存在欠拟合,随后延长训练时长最终拿到了金牌。

[03 GRAPH:异步稳态进化]
- 并发瓶颈:同步单GPU执行在运行高成本训练时会阻塞搜索。
- 共享进化状态:工作进程在专用H200 GPU上异步探索突变,同时由一个编排器控制温度缩放排名选择和交叉。
- K最优陷阱:Meta证明,没有共享进化谱系的极易并行搜索会浪费8块GPU中的7块,最终停在和单GPU完全一样的性能天花板上。
- 算力边界:最优子智能体分配和算力的平方根成正比,这意味着扩展算力需要更宽的并行探索,而非更长的顺序运行。

[生产环境中的实证假设检验]
- 业界假设:没有代际壁垒的异步智能体群会出现策略漂移,同时长运行时间必然会破坏泛化能力。
- 实际生产测试:我们部署了Meta的三拆分隐藏式一致评估和异步ReAct

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新