GPT-6.1 Sol发布:五分之一成本,性能逼近Astra
它是 GPT-6 Sol 的升级版。标准 API 价格:输入每百万 token 2 美元,输出 10 美元。缓存输入只要 0.10 美元,比标准输入低 95%,也比 GPT-6 Sol 的缓存价低一半。经常复用上下文的开发者,这笔账能差出不少。
便宜不等于缩水。DeepSWE v1.1 编码基准上,GPT-6.1 Sol 以约五分之一成本匹配 Astra 的分数。它还比 GPT-6 Sol 的最佳成绩高 6.4 个百分点,用的推理努力更低。文档处理看 GDP.pdf:它超过 Opus 5.5,每任务成本不到后者一半。同时逼近 Astra 的水平,成本约为其五分之一。
自动化任务也是同样的路数。AutomationBench 上,中等推理设置下,它比 Opus 5.5 高 2.2 个百分点,成本约为三分之一。OSWorld 2.0 离线集上,它比 GPT-6 Sol 高 7 个百分点,成本不到一半。离 Astra 只差 2.1 个百分点,每任务成本约为 Astra 的七分之一。
科学任务这块,成本优势拉得更大。Terminal-Bench Science 0.1 上,GPT-6.1 Sol 的得分是 GPT-6 Sol 的两倍多,成本不到一半。每任务平均成本 5.47 美元。对比之下,Opus 5.5 要 23.21 美元,Astra 要 23.80 美元,成本降了超过 75%。不过在最难的科研任务上,Astra 仍以 68.1% 保持最高分。OpenAI 建议这类任务继续用 Astra。
可靠性也在改善。低推理设置下,包含事实错误的响应比例从 11.4% 降到 7.7%,降幅约 32%。各个推理设置下,错误率都控制在 Astra 的 1.9 个百分点以内。安全上同样有改进:更透明,更尊重用户意图和安全约束,失败率更低。没有出现绕过自动安全审查员的尝试。
即日起,ChatGPT Work 和 Codex 用户都能用上 GPT-6.1 Sol。Plus、Pro、Business、Enterprise、Edu 五个档位都包含在内。Chat 里还没有。开发者可以通过 API 调用,模型标识 gpt-6.1-sol。
未来几天会推出 GPT-6.1 Sol Ultrafast。在 Codex 里,它的 token 生成速度比标准版最多快 8 倍。Chat 版本何时上线,OpenAI 没有说明。Ultrafast 的定价和性能细节也还没公布。