研究者实测四款大模型 结果和AAII差异很大
我们在 100 个开放式编码和工程环境中,全面测试了 Opus 5.5、GPT-6-Sol 和 GPT-6-Luna。我们的结果和 AAII 差异很大。
一些结论:
• GPT-6-Astra 仍然是大幅领先的前沿模型。
• Opus 5.5 在编码类别中排名第 2 到第 7 位,在单次生成代码能力上排名第二(这是我们和流体智力相关性最高的衡量指标)。
我们不测试「可用性」,但据经验来看,Anthropic 似乎改进了它的沟通风格。更低的定价是个受欢迎的变化——这可能要归功于 @thsottiaux。它并不便宜,但它是第一个价格合理的 Anthropic 模型。
不过,Opus 5.5 在我们的自定义测试工具中表现不佳,这对 Claude 模型来说很不寻常,这种趋势从 Fable 5.1 就开始了(单次生成的流体智力得分优于智能体结果)。
我们观察到一个现象:当它认为结果已经足够好时,它经常会自行停止:比如在一次评估中,Opus 5.5 结束了会话,理由是:「最近一次评估平均得分为 867703,在 31 个抽样对手中排名第二」……所以我想这确实能省钱,但它确实倾向于做出这种有问题的单方面判断。在我们的测试工具中,几乎所有其他前沿模型都会一直工作,直到代码不再改进或者用完调用额度。我很好奇这在多大程度上是因为 Anthropic 重新调整了「High」努力模式(我们测试用的就是这个模式)*。
• GPT-6-Sol 的结果误差范围和 Opus 5.5 接近,并且是帕累托最优*。它比所有 Anthropic 模型都快,即使在 Flex 端点上也是如此。在智力和成本方面都能和前沿模型竞争。
• GPT-6-Luna 比 GPT 5.6 Luna 更聪明一点,并且打折降价了。旧版 Luna 在它的价格区间已经有很多应用了,所以这个模型最终可能会在非工程工作中成为这一批里影响力最大的。
关于来自 @GertLabs 的 GBENCH:我们的环境是开放式的,没有唯一正确答案,但结果是可验证的。它们涉及创造力、设计,并且通常被组织为多智能体编码游戏或工程设计挑战。
我们基准池中所有环境都是不饱和的,我们会移除任何在多个版本中出现饱和/停滞迹象的评估。它的设计目的就是专门衡量和区分前沿模型未被干扰的原始智力。
这些结果很有意思,我们对其进行了全面审查。我不喜欢看到 Opus 5 在排行榜上排名还这么高,但我最终认为这更多是 Anthropic 最新发布版本的问题,这也可能解释了为什么自从 Astra 发布后,他们降价并且连续发布新版本。他们并没有在 Opus 5 的智力基础上显著提升,只是改进了它的风格(老实说,这已经是很大的进步了)。
*我们不追逐 xhigh、max 这类营销术语。我们在自适应模式下测试所有模型。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖