原来AI排名,测的不只是模型本身
在 ARC‑AGI‑3 上,GPT‑5.6 Sol 现在比 Opus 5 表现更好吗?
简短回答:官方排行榜上没有,但这个对比比第一眼看上去要复杂得多。
我来解释一下,因为这里现在有点混淆。我们都知道,ARC‑AGI‑3 测试的是模型能否通过试错学习陌生的二维游戏。
“测试 harness”是运行这项测试的软件。它会向模型展示当前游戏状态,接收模型的答案,提取并执行选中的操作,返回下一状态,还要管理模型能记住的所有内容。
ARC 使用一个特意设计的通用 harness,名为 benchmark_agent。所有提供商都通过相同的补全风格设置接受测试。之前可见的答案和操作会保留在对话中,但模型的私有推理不会被传入下一个请求。
一旦历史长度超过大约 175000 字符,ARC 就会采用滚动截断:直接删除最早的交互。在这个标准 harness 下:
Opus 5:30.2%
GPT‑5.6 Sol:7.8%
OpenAI 认为这个设置对 Sol 特别不友好。它的推理每走一步就会消失,最终它最早的观察结果也会消失。
因此 OpenAI 使用自己的 Responses API 测试了 Sol,保留了推理并启用了 Compaction。Compaction 会把长交互中较早的部分压缩成更短的表示,而不是直接彻底删除它们。模型可以在多个上下文窗口之间保留学到的规则、之前的发现和自己的策略。
在公开游戏中,Sol 的分数从 13.3% 提升到了 38.3%,同时使用的输出 token 减少了 6 倍。
这并不能证明 Sol 击败了 Opus 5:38.3% 是用 OpenAI 自定义 harness 在公开集上得到的结果;而 Opus 5 的 30.2% 是使用 ARC 标准 harness 得到的官方半私有结果。Opus 5 仍然是官方排行榜的第一名。
但这个实验表明,ARC‑AGI‑3 测量的是完整的智能体系统:模型、内存、上下文管理和 harness,而不仅仅是底层模型本身。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖