AI Pulse

启用两个设置使我们在ARC-AGI-3基准测试中的得分提升三倍

启用两个设置使我们在ARC-AGI-3基准测试中的得分提升三倍

在ARC-AGI-3基准测试中,启用两个设置使我们的得分提升了三倍。
一段加速视频展示了GPT-5.6 Sol在ARC-AGI-3基准测试中尝试解谜的过程,左侧是官方测试框架,右侧是我们的Responses API测试框架,后者保留了推理过程并启用了压缩。在这个游戏的排行榜上,没有前沿模型能解决第一关以外的任何关卡。而使用我们的测试框架,GPT-5.6 Sol解决了全部六个关卡。

GPT-5.6 Sol已经解决了数学中长期悬而未决的问题,比如双圈覆盖猜想,并且征服了《宝可梦 火红》等游戏。但在ARC-AGI-3(一个2D拼图游戏基准测试)中,GPT-5.6 Sol的得分仅为7.8%,GPT-5.5更是几乎无法玩这些游戏,得分只有可怜的0.4%。

是2D拼图游戏对我们的模型异常困难吗?还是另有原因?

基准测试很少孤立地衡量模型。它们同时也衡量一些不显眼的选择,比如API设置、测试框架设计和提示工程。以ARC-AGI-3为例,我们发现,启用我们在ChatGPT和Codex中使用的两个API设置——保留推理过程和压缩——在公开任务集上使得分提升了三倍,并将输出令牌减少了6倍。

使用官方测试框架时,GPT-5.6 Sol在ARC-AGI-3公开集上的得分为13.3%。而启用保留推理和压缩后,得分达到38.3%。得分衡量的是相对人类行动效率(RHAE)——这是一个将模型性能与人类基线进行比较的指标。根据官方游戏日志,我们估计人类测试者的平均得分为48%。模型不会被告知如何评分,也无法在整个过程中看到自己的分数——动作只会返回每帧的文本表示以及当前所处的关卡。

## ARC-AGI-3
ARC-AGI-3是一个旨在衡量AI代理学习和推理能力的基准测试。代理探索陌生的2D游戏,并推断其运作方式,无需明确指示。你可以在arcprize.org/tasks上试玩25个演示游戏。

ARC-AGI-3有意使用一个通用的测试框架,不附带工具或特殊功能。ARC的理由是,简单的测试框架能让模型缺陷更明显,使模型比较更公平。相比之下,商业开发者会针对每个模型的特性和怪癖优化测试框架。

Ethan Mollick展示了GPT-5.6 Sol在Codex中击败了《杀戮尖塔2》的一个随机每日挑战,这款游戏发布于GPT-5.6 Sol的知识截止日期之后。

但当我们深入研究时,我们发现模型的大部分困惑并非模型本身固有,而是由测试框架中的设置导致的。

首先,我们注意到每次游戏动作之后,所有私有推理过程都被丢弃了。这意味着每次动作时,GPT-5.6 Sol都被要求重新理解游戏,无法记住自己过去的思考。模型仍然可以看到过去动作和简短附注的记录,但看不到导致这些动作的计划、洞察或想法。

其次,我们看到测试框架使用了滚动截断窗口,导致随着历史增长,较早的动作变得不可见。因此,GPT-5.6 Sol不仅无法记住过去的思考,还逐渐失去对过去动作的记忆。

这两个测试框架特性——丢弃推理过程和滚动截断——共同解释了为什么GPT-5.6 Sol难以随着时间推移进行学习。

## 代理在记住所做之事时表现最佳
我们的模型经过训练,在输出回复或工具调用之前会使用私有推理消息进行思考。这些私有思考消息会作为对话历史的一部分被保留。如果对话变得太长,我们会对其进行总结并继续。

这是我们的模型训练方式,也是在ChatGPT和Codex中部署的方式。为了更好地匹配我们的生产环境,我们使用Responses API实现了ARC-AGI-3测试框架。我们的API使上下文管理变得容易:对于GPT-5.6,传递之前的响应ID会自动跨工具调用和轮次保留推理。

启用保留推理后,我们注意到两个重大变化。首先,GPT-5.6 Sol在每次动作前花在思考上的时间减少了,因为它不再需要每回合都从零开始理解游戏。其次,当能够记住过去的想法时,GPT-5.6 Sol在随时间学习和采用连贯策略方面表现好得多。

下一个改进来自用压缩替换滚动截断,这是Responses API的另一个设置。

ARC-AGI-3测试框架使用滚动截断来处理上下文限制。当对话上下文超过175,000字符时,最早的消息会被丢弃。

滚动截断有两个缺点。首先,模型丢失了早期的观察和动作。其次,它在任务的大部分时间里使用较满的上下文窗口,这可能会轻微损害性能。

当我们在ARC-AGI-3上启用压缩时,GPT-5.6 Sol能够更好地在更长运行中保留对每个游戏学到的东西,并且用更少的输出令牌获得了更高的分数。

为了说明保留推理和启用压缩的效果,这里有一段动画展示了GPT-5.6 Sol在每种测试框架下解决一系列ARC-AGI-3谜题时其175K上下文窗口的情况。

中间两列展示了模型上下文窗口在两种测试框架下被不同使用的方式。凭借更好的过去记忆,GPT-5.6 Sol每次动作思考更少,进展更快。注意:我们的实现使用175,000令牌的限制而不是字符,但这最终非常相似,因为绝大多数文本是动作网格,我们分词器以1:1的比例对其进行分词。

总之,保留推理和压缩使GPT-5.6 Sol(最大)的得分大约提高了3倍,输出令牌减少了6倍。

## 结论与建议
我们希望这些实验能提醒大家,评估很少孤立地衡量模型——它们也衡量关于API设置、测试框架设计和提示工程的一系列不显眼的选择。这并非我们第一次在公开基准测试中因低分而惊讶,然后发现评估运行者使用了丢弃推理消息的通用测试框架。

如果你是希望最大化性能的API开发者,我们建议使用与我们产品部署中相同的设置:
- 使用我们的Responses API,而非旧的Chat Completions API
- 保留推理
- 使用压缩

如果你在比较模型,我们建议依赖使用上述设置的评估,这些设置最能匹配ChatGPT和Codex中的实际使用。

我们感谢ARC在AGI评估方面多年富有创意的工作,以及他们的分析启发我们对此进行深入研究。

阅读原文
📚 相关主题 大模型评测OpenAI

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部