博主说现在选AI,比的早就不是谁更聪明了
「哪个 AI 模型最好用」本身就是个错误的问题。放在一年前,这个问题其实还有意义。当时每家公司都在拼了命做最聪明的模型,谁在 Chatbot Arena、MMLU 或者 SWE-bench 登顶,谁就能赢下舆论。
但放到今天呢?前沿模型的能力已经非常接近,原生智能几乎决定不了任何事了。Claude Fable 5、GPT-5.6 Sol、Gemini 3.1 Pro、Grok 4.5 和 Kimi K3 之间的差距,比人们以为的小得多。
现在真正重要的,是你要用它做什么。如果你是写东西,我依然会选 Claude。不是因为它聪明得多,而是它需要你修改的地方最少。它能在几千字的篇幅里保持统一语调,观点之间过渡自然,很少会陷入其他模型依然会出现的重复套话。
如果我每天都要交付代码,我的答案会完全不同。GPT-5.6 Sol 在结构化推理、调试和工具使用方面表现格外出色,但真正改变格局的甚至都不是这个模型本身,而是 Codex。
人们觉得 Codex 只是另一个聊天机器人,其实不是。你给它派一个任务,它会自己启动环境、克隆仓库、编辑文件、运行测试、修复错误,最后给你交付完成的工作。这就是软件工程未来方向的一个缩影。
现在的竞争早就不只是 Openai 对 Anthropic 了。现在是 Codex 对 Claude Code 对 Cursor 对 Devin 的竞争,这场比赛有意思得多。
再说说 KIMI K3。几年前,没人相信开放权重模型能真的跟前沿实验室的产品正面竞争,今天这已经不是事实了。它虽然没能在所有任务上击败 Claude 或 GPT,但它的能力已经足够好,让所有闭源实验室都必须解释清楚,为什么人们要为他们的产品付溢价。这是一个巨大的转变。
而且我依然觉得 Grok 4.5 没有得到足够的认可。大家因为它的 X branding 嘲笑它,但从技术角度来看,它是目前性价比最高的模型之一。速度快、价格便宜,效率高得超出预期。当你需要处理数百万 token 时,定价和延迟的重要性就跟基准测试分数一样高了。
这就是为什么我认为讨论方向已经变了。我们现在不是在选最聪明的 AI,我们是在选适合这份工作的 AI。这才是正确的问题。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖