便宜token模型按任务算更贵,Opus 5.5却更省
Anthropic今天发布Opus 5.5,让我一头扎进了兔子洞。我想搞清楚使用这个新晋顶级模型的最佳努力级别。
于是就有了下面这些内容,基于Artificial Analysis Intelligence Index v4.3.2的得分。
如果你看第一张图表,你会发现在这个指数中,Opus 5.5会随着你调高努力级别而变得更聪明。(这是该评分模型的结果,但并非总是如此:参见Opus 5.5的最佳努力级别)
根据第一张图,Opus 5.5是唯一一个处于最佳价值象限的模型。
第二张图讲述了一个不同的故事:成功完成一项任务需要付出多少成本。在那里,ChatGPT的Astra模型在xhigh设置下悄悄进入了绿色区域。它与今天最顶级的Opus 5.5在中高努力级别上正面交锋。
另一件事是那个便宜但较弱的象限。只有在你能获得准确结果的情况下,它们才值得这个价钱。
―― 高票评论(帖子共 5 条讨论)――
[+1] u/Markust99: 第二张图中你是如何定义“成功完成任务成本”的?是API花费经过基准成功率调整后的数字,还是也包括重试以及检查输出所花的时间?
[+1] u/Cheap_Effort4382: 这就是我一直跟我的梦幻联赛群聊说的,但他们只看到每token价格,就觉得占了便宜。便宜模型在试着搞懂简单事情时烧掉大量token,结果你为实际任务付更多钱。不过Opus 5.5是唯一一个进入那绿色象限的,这倒是很有意思
[+1] u/HaDuongMinh: 那么Opus 5.5在高努力设置下,每个任务实际更便宜?速度怎么样?
[+1] u/FablingApp: 按任务计价这个框架,比我做预算的方式更贴近实际情况。一个便宜模型,如果需要两次重试再加一次手动清理,那它就不再便宜了。我还会把延迟加进图表——如果Opus高努力设置每个完成的任务成本更低,但耗时是3倍,这种权衡对交互式工作来说就不一样了。