AI Pulse

Luna Max与Sol High同分,成本仅其三分之一

OpenAI 发布了 GPT-6 Sol 和 Luna 两个系列。Luna Max 在 DeepSWE 基准上的得分和 Sol High、Astra Low 一样,成本只有 Sol 的三分之一。

发布后,有人贴出基准测试截图,还有人补了一张 Astra 的基准测试截图。一位用户上传了质量截图,评价是“看起来不错”。另一个评论说,这次发布比预想中出色,OpenAI 做到了。还有人直接表达震惊。

接着是两条使用反馈,走向完全不同。有位用户说,从 5.6 版本开始,他就在 High 设置下把 Luna 当主力。提示词给得准确,或者给模型配一个规划足够详细的技能模块,输出就几乎完美。另一个人记录的是 Luna Max 的一次任务。模型花了 20 分钟,最后只返回两行 pom.xml 内容,建议把单元测试拆成两个并行分叉。两条反馈差距很明显,目前说不清是提示的问题还是任务的问题。

新一代阵容的名称也引起注意。有用户发现 Terra 已从“6”系列里消失,直接问它是不是退场了。有人根据基准判断,GPT-6 Sol 更像是 5.6 Terra 的继任者。还有人在测试后认为,GPT-6 Sol 像被削弱的 Astra,甚至达不到 5.6 Sol。

成本数据是这次发布里最扎实的部分。同样的预算,能跑的 Luna Max 请求量是 Sol 的 3 倍,是 Astra 的 7.3 倍。如果这个优势能延伸到基准之外,开发者的推理支出会明显降下来。更多产品能负担得起 AI 的开销,普通用户也会在更多地方遇到这类模型。DeepSWE 到底覆盖哪些任务、和真实场景差多远,目前没有足够信息可以判断。

同分加上大价差,价格会变成开发者选 Luna Max 的强理由。它能走多远,要由真实任务的反馈决定——这些反馈已经开始出现。

阅读原文
📚 相关主题 大语言模型OpenAI

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新