AI Pulse
📡 X 信号

@gosrum 实测不同大模型的性价比对比

@gosrum 实测不同大模型的性价比对比

GPT-6.1 Sol 已经评测完成,我在此分享期待已久的最近一直在运行的 Terminal Bench 4.0 评测结果。

【笔记】
- 性能:Opus 5.5(medium)和 GPT-6.1 Sol(high)分数相同,Opus 5.5(xhigh)性能高出一档 → 只看性能的话,推荐 Opus 5.5 medium 或 high。
- 成本:GPT-6.1 Sol(high)执行任务相当便宜,成本大概是 Opus 5.5(medium)的1/4。Opus 5.5(xhigh)分数更高,但成本是 Opus 5.5(medium)的2.6倍,是 GPT-6.1 Sol(high)的10倍以上。
- 时间:Opus 5.5(medium)和 GPT-6.1 Sol(high)耗时差不多,Opus 5.5(xhigh)耗时大约是它们的两倍。

【注意事项】
- Sonnet 5.5 medium 分数看起来很低,所以我中途停测了。max 版本往往成本极高,还一直触发5小时速率限制,所以我放弃测试了。
根据 Anthropic 的报告,Sonnet 5.5(max)性能比 Opus 5.5 更好,所以 token 无限多的人可以试试。

【结论】
- 性价比优先(更低成本)→ GPT-6.1 Sol(high)
- 性价比优先 → 推荐 Opus 5.5 medium 或 high
- 性能优先 → Sonnet 5.5(max)?

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新