OpenAI调整API设置后GPT-5.6 Sol得分提升188%
GPT-5.6 Sol 已被用于解决数学领域的开放问题。那它为什么会在 ARC-AGI-3 这个 2D 解谜基准测试上表现吃力?我们对此展开了调查。
原来测试框架不让它记住已经学到的内容。我们发现,开启两个 API 设置后,我们的得分翻了三倍,输出 token 量还减少了 6 倍。
ARC-AGI-3 测试的是模型在没有指令的情况下学习陌生 2D 游戏的能力。标准测试框架会在每一步操作后丢弃 GPT-5.6 Sol 的推理过程,还会随着上下文填满把更早的操作删掉。模型只能不断重新开始。
我们用 Responses API 重新实现了测试框架,并开启了:→ 保留推理 → 上下文压缩。在公开测试集上,GPT-5.6 Sol 的得分提升了 188%,同时输出 token 量减少了 6 倍。
基准测试分数反映的不只是模型本身,也反映运行测试所用的框架和设置。对于长时间运行的智能体来说,保留推理并压缩上下文能让模型在已有学习成果的基础上继续构建。
我们希望这些实验能提醒大家:评测很少孤立地测量模型——它们同时也在测量一堆关于 API 设置、框架设计和提示词的不那么显眼的选择。
如果你是想要最大化性能的 API 开发者,我们推荐使用我们在自身产品中部署的同款设置:
- 使用 Responses API,而非旧版 Chat Completions API
- 保留推理
- 使用上下文压缩
如果你想要亲自挑战前沿模型,可以点击链接自行试玩公开游戏:
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖