AI Pulse
📡 X 信号

TEMPO方法提升ARC-AGI-3平均分超三成

TEMPO方法提升ARC-AGI-3平均分超三成

如果单次推演就要花数十小时,该如何训练智能体?在开放源代码发布 dots3-note Preview 的同时,我们分享更多关于 TEMPO 的细节:测试时间缩放价值估计结合宏观步策略优化。

长周期智能体强化学习面临两个根本问题:
• 只有当极长的轨迹走完,才能获得训练信号
• 最终奖励很难分辨到底是哪些中间决策起到了关键作用

TEMPO 将一整条长轨迹拆分为多个宏观步。在每个分段边界,同一个模型会从行动者切换为生成式评论家:它回顾交互历史,检查智能体的假设,推理可能的未来,然后估计剩余回报。因此,智能体不仅能学习如何行动,还能学习如何评估自身。

有一个结果让我们惊讶:两个分支可以获得完全相同的环境奖励,但其中一个被对任务的错误理解困住了,另一个已经找到了可行方向。推理评论家可以在任务结束前就区分出这些状态。

在公开的 ARC-AGI-3 测试集上,TEMPO 相比基础检查点将平均分提升了 31.6%,相比 GRPO 提升了 20.7%,同时只用更少的环境交互就达到了可比的进度。

TEMPO 目前仍然是早期工作,但我们认为,测试时间缩放的自评估可能是训练能完成耗时数小时、数天、乃至更久任务的智能体的重要一环。

技术博客:
开放源代码 dots3-note Preview:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新