GPT-6 Astra 实测:幻觉减半但涨价2.5倍
GPT-6 Astra 在Artificial Analysis编码智能体指数中取得显著进步,成本更低的情况下得分与Fable 5持平。
在智力指数中,它在性能相近的情况下比GPT-5.6 Sol使用更少的token,但这一优势被涨价抵消。
定价方面,全面上涨至当前GPT-5.6 Sol价格的2.5倍,每百万输入/输出token从4美元/20美元涨到10美元/50美元,缓存读取仍保持90%折扣,缓存写入仍收取25%溢价。
我们的两大旗舰指数呈现出截然不同的结果。在Artificial Analysis编码智能体指数中,得益于token效率的显著提升,GPT-6 Astra 成本不到一半就取得了与Fable 5持平的得分。
在Artificial Analysis智力指数中,性能相近的情况下GPT-6 Astra比前代更具token效率,但这一优势被涨价抵消。
---
Artificial Analysis编码智能体指数——核心结论:
➤ 对标顶级模型:在Codex中,GPT-6 Astra的指数得分为67分——大致等于Claude Code中的Claude Opus 5和Fable 5,以及Muse Code中的Muse Spark 1.3。Claude Code中的Fable 5.1以70分位居指数榜首。
➤ token效率比GPT-5.6 Sol高70%:GPT-6 Astra的token效率大幅提升,在Codex测试环境中,它使用的token量是GPT-5.6 Sol(最大努力水平)的三分之一,是Claude Opus 5(极高努力水平)的五分之一。该模型不同努力水平都处于token效率的帕累托前沿。
➤ 领跑编码智能体指数成本效率前沿:在最大努力水平下,GPT-6 Astra成本与GPT-5.6 Sol(最大努力水平)大致相当,指数得分却高出2分。单任务来看,得分相同的情况下,该模型成本不到Claude Fable 5的一半。
---
Artificial Analysis智力指数——核心结论:
➤ 与GPT-5.6 Sol智力水平相当:GPT-6 Astra在该指数中得分与GPT-5.6 Sol持平,为61分。比Claude Fable 5.1(带 fallback 的最大努力水平)低5分,也落后于Meta新发布的Muse Spark 1.3(最大努力水平)。
➤ 输出token减少约10%,优势被涨价抵消:GPT-6 Astra在「智力指数 vs 单任务输出token」上定义了新的帕累托前沿——与GPT-5.6 Sol相比,最大努力水平下token使用量减少约10%。但由于价格上涨2.5倍,最大努力水平下单任务成本比前代高出75%。
➤ 幻觉率是GPT-5.6 Sol的一半:GPT-6 Astra在我们的知识与幻觉基准AA-Omniscience上取得大幅提升,最大努力水平下幻觉率从92%大幅降至51%。和部分模型不同,这一提升没有以准确性为代价——Astra同时将准确性提升了4个百分点。
➤ AA-Briefcase Elo提升约80分:GPT-6 Astra在我们的前沿长周期知识工作评估AA-Briefcase中提升了约80分。测试中模型需要完成多周项目,包含多个关联任务和数千个源文件。Astra在评分标准得分和分析质量上都有显著提升。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖