@gosrum 实测不同大模型的性价比对比
GPT-6.1 Sol 已经评测完成,我在此分享期待已久的最近一直在运行的 Terminal Bench 4.0 评测结果。
【笔记】
- 性能:Opus 5.5(medium)和 GPT-6.1 Sol(high)分数相同,Opus 5.5(xhigh)性能高出一档 → 只看性能的话,推荐 Opus 5.5 medium 或 high。
- 成本:GPT-6.1 Sol(high)执行任务相当便宜,成本大概是 Opus 5.5(medium)的1/4。Opus 5.5(xhigh)分数更高,但成本是 Opus 5.5(medium)的2.6倍,是 GPT-6.1 Sol(high)的10倍以上。
- 时间:Opus 5.5(medium)和 GPT-6.1 Sol(high)耗时差不多,Opus 5.5(xhigh)耗时大约是它们的两倍。
【注意事项】
- Sonnet 5.5 medium 分数看起来很低,所以我中途停测了。max 版本往往成本极高,还一直触发5小时速率限制,所以我放弃测试了。
根据 Anthropic 的报告,Sonnet 5.5(max)性能比 Opus 5.5 更好,所以 token 无限多的人可以试试。
【结论】
- 性价比优先(更低成本)→ GPT-6.1 Sol(high)
- 性价比优先 → 推荐 Opus 5.5 medium 或 high
- 性能优先 → Sonnet 5.5(max)?