Vercel工程师发布2026年8月LLM模型分级榜单
我是 Vercel 的 GTM 工程师,这是我截至目前做的 AI 模型分级列表。这份排名不只是看纯基准测试性能,而是结合了我对成本、延迟、可靠性、可用性等维度的综合感受。当然还有每轮交互给我的纯粹愉悦感。🤩
🤩 S 级——「顶级中的顶级」🤩
- 5.6 sol pro 太能打了。Pro 版本的思考质量无可匹敌。它不算很好用,但部署之后效果真的绝了。
- 0x-Alpha 免费token配额真的太疯狂了。这周末我一直在用它处理各种任务。我平时很讨厌用免费端点,因为模型一般,限制还烂。但这个用起来非常舒服。
- 5.6 luna intelligence 便宜到近乎免费!当你就是需要用大量 token 处理问题的时候就用它。生产代理、子代理都能用。快速模式免费。成本降低80%真的改变了游戏规则。
⭐ A 级——「我的质量门槛」⭐
- 5.6 sol 这个模型是我的主力工作马。当我就想事情能顺顺当当做完,我就会切回 5.6 sol。我称这为「拉满信任」。没错,它会把你的代码过度设计,但它也不会漏掉任何东西,表达清晰简洁。它就是能干活。
- fable 5 依旧是纯智力方面的王者。当我遇到棘手问题,需要 AI 帮我建立联系、制定更高层级的计划时,fable 5 无可匹敌。要不是它太贵,肯定能进 S 级。
- deepseek v4 flash 另一个便宜到近乎免费的智力选项。单位token的智力价格低得离谱,但 luna 在代理能力上还是胜过它。如果 Vercel 内部 AI 网关开放了更快的 tok/s 端点(也就是 400+ tok/s),它就能升到 S 级。
💪 B 级——「日常主力」💪
- gemini 3.7 flash deepmind 做得真不错。虽然我过去几周一直对 Gemini 持看空态度,但这个模型真的圈粉了。在它的价格点能做到约 400 tok/s,意味着你可以随便用,不用担心用量,也不会打断思路。
它的写作语气非常好,而且和 OpenAI/Anthropic 的模型相比,Gemini 的训练多样性非常出色。
- grok 4.6 说实话,grok 4.5 那么好用,我本来对这个版本期待更高。它确实更聪明,但这个提升是有延迟代价的——似乎因为它思考得更全面?用下来感觉就是更慢,让我忍不住想念 5.6 sol。不过它还是用得很多,因为太便宜了。
🤔 C 级——「不错,但有更好的选择」🤔
5.6 terra 是个很棒的模型,但我通常更愿意用低思考等级的 5.6 sol,或者 grok 4.6/gemini 3.7 flash。我有时候在 codex 里想省点 token 才会用它。
deepseek v4 pro 是个很棒的模型,但不同新云中它的性价比远不如 flash 版本。
glm 5.2 我放在这里是因为我以前经常用它的「快速」端点当便宜日常主力。我很期待 5.3 上线新云。
😬 D 级——「不值得」😬
opus 4.8 在这里显然是因为它已经显老了,它在自己的时代是很棒的模型,但现在就性能来说太贵了。不过我还是把它排在 kimi k3 和 qwen 3.8 max 前面,因为它的使用体验更好。
我一直不太喜欢 kimi k3,它的 token 效率极低,价格优势完全不够,根本不值得换它替代其他选项。qwen 3.8 max 发布那天就被全方位淘汰了。
💀 F 级——「这都什么鬼」💀
- opus 5 基准测试里它确实是个好模型,但这是我从早期 GPT 5/5.1 时代之后见过最晃瞎眼的模型输出。太烂了。可读性差得可怕。而且我发现它当子代理用慢得离谱。不管任务多简单,最少都要跑 20 分钟。我真的认认真真试了 3-4 天,之后再也没用过。
- sonnet 5 这个模型发布的时候根本说不通。巨吃 token,只比最低推理等级的 opus 4.8 便宜一点。同任务下 opus 4.8 性能更好还更便宜。对我来说它直接进垃圾桶。我只在 Claude Code 里当子代理勉强用过(我不可能用 haiku)。
- gemini 3.5 flash lite 好吧,这个可能有点针对性……它确实快,但 flash lite 系列在 2.5 之后就已经废掉了自己的卖点。比 5.6 luna/deepseek v4 flash 这类模型更贵还更笨。在代理任务上也没有更快。
我觉得,在它能用上的场景里,它提升的智力完全没必要,还被 2.5 flash lite 在价格上完胜。
这就是我 2026 年 8 月的 LLM 模型分级列表。你同意这些排名吗?有不同意见?在评论里告诉我。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖