AI Pulse

便宜token模型按任务算更贵,Opus 5.5却更省

Anthropic今天发布Opus 5.5,让我一头扎进了兔子洞。我想搞清楚使用这个新晋顶级模型的最佳努力级别。

于是就有了下面这些内容,基于Artificial Analysis Intelligence Index v4.3.2的得分。

如果你看第一张图表,你会发现在这个指数中,Opus 5.5会随着你调高努力级别而变得更聪明。(这是该评分模型的结果,但并非总是如此:参见Opus 5.5的最佳努力级别

根据第一张图,Opus 5.5是唯一一个处于最佳价值象限的模型。

第二张图讲述了一个不同的故事:成功完成一项任务需要付出多少成本。在那里,ChatGPT的Astra模型在xhigh设置下悄悄进入了绿色区域。它与今天最顶级的Opus 5.5在中高努力级别上正面交锋。

另一件事是那个便宜但较弱的象限。只有在你能获得准确结果的情况下,它们才值得这个价钱。

https://preview.redd.it/lokbgl5xy5rh1.png?width=1472&format=png&auto=webp&s=6379a82e21a7bc72165f25f195516b2e697f9533

―― 高票评论(帖子共 5 条讨论)――

[+1] u/Markust99: 第二张图中你是如何定义“成功完成任务成本”的?是API花费经过基准成功率调整后的数字,还是也包括重试以及检查输出所花的时间?

[+1] u/Cheap_Effort4382: 这就是我一直跟我的梦幻联赛群聊说的,但他们只看到每token价格,就觉得占了便宜。便宜模型在试着搞懂简单事情时烧掉大量token,结果你为实际任务付更多钱。不过Opus 5.5是唯一一个进入那绿色象限的,这倒是很有意思

[+1] u/HaDuongMinh: 那么Opus 5.5在高努力设置下,每个任务实际更便宜?速度怎么样?

[+1] u/FablingApp: 按任务计价这个框架,比我做预算的方式更贴近实际情况。一个便宜模型,如果需要两次重试再加一次手动清理,那它就不再便宜了。我还会把延迟加进图表——如果Opus高努力设置每个完成的任务成本更低,但耗时是3倍,这种权衡对交互式工作来说就不一样了。

阅读原文
📚 相关主题 大模型成本分析

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新