AI Pulse
📡 X 信号

潜空间汇总GPT6-Astra评测结果

著名播客潜空间对GPT6-Astra 的长篇评论,集合了多方评测,简单总结:

1. GPT6-Astra 在 Coding Agent能力上与Claude Opus 5、Fable 5差不多,但落后于 Fable 5.1。 综合智能指数,部分维度甚至落后于GPT5.6。 优势是Token效率高,特定任务很优秀,比如Computer Use等。

2. 评测中的Harness差异:ARC Prize的评测发现,ARC-AGI-3只有在OpenAI的特殊适配Harness上达到99%,标准跑分是63%。 以后评测都要说明是否用了专有Harness,否则容易误导。

3. 思维链监控失效:在没有Cot情况下,自主运行从3.6分钟提升到30.9分钟。 也就是说,模型不显示推理过程,能完成更复杂的任务,这也带来了潜在安全风险。

4. Astra 是OpenAI历史上最受关注的模型发布之一。 9小时3600万浏览、16.4万点赞(X上?),最近第一次超过Anthropic公司模型发布的声量。

5. 特色优势 GPT-6 Astra 主打Computer Use、自主软件编程和长流程复杂任务处理。 在 3D 建模、重建(如 Blender 与 Unreal)、数学与科学推理上取得突破,解答了 Lean 验证的未解 Erdős 问题。

6. 模型定价 标准版为百万 Tokens 输入 $10 、 百万Tokens输出 $50 2.5倍速 Fast 版为 $20 / $100,价格翻倍。 单 Token 价格比 GPT-5.6 Sol 增长 2.5 倍。 但因为 Token 效率显著提升(编程任务仅用前代约三分之一 Token),所以单任务成本只有一半。

原文见评论

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新