AI Pulse

GLM-5.3 与 Fable 5 同一水平,价格只要十分之一

Terminal Bench 4.0 刚发布,用来比较各模型在编码任务上的表现。它迭代得很快,目的是跟上新模型发布的节奏,防止基准测试饱和。GLM-5.3 来自 Z.ai。

价格差距是讨论的焦点。一条高赞评论说,平均而言 Fable 仍然更好,但 GLM-5.3 的表现令人印象深刻,而这一切只要 Fable 十分之一的钱。按性能和价格一起算,GLM-5.3 已经不能忽略。

便宜不等于总开销一定更低。Terminal Bench 4.0 上,GLM-5.3 的运行成本是 2,700 美元。GPT-5.6 Sol 是 2,500 美元,反而更低。它表现略好,但消耗的 token 几乎是后者的两倍。上一版 3.0 则相反:两个模型消耗的 token 大致相同,GPT-5.6 Sol 的成本是 GLM 的两倍多。token 效率和价格一起波动,实际账单取决于版本和任务。

榜单成绩和真实体验并不总是一回事。一个开发者用本地部署的 DeepSeek Flash 写代码,但把 GLM 5.3 当作代码审查的首选。理由是它能发现 GPT Sol 漏掉的问题。也有人试过包括 GLM 5.2 在内的好几个模型,结论是表现好坏取决于具体任务。Opus 排第一,这本身就让一些人怀疑基准:它用起来像一个需要不断监督的小孩,Fable 恰恰相反,更擅长把实际工作做完。

怀疑不是孤例。有评论觉得新模型的得分高得不正常,说这不仅仅是基准饱和的问题。不同基准之间也互相矛盾:Livebench 把 GLM-5.3 排在 Qwen 3.8 Flash Next 之下。

大型基准测试本身有门槛:每次要消耗 50 亿到 100 亿个 token。对大多数个人开发者和小团队来说,这不现实。有评论建议别依赖公共排行榜,改用自己的失败案例:从混乱的编码会话里挑 20 到 30 个任务,固定仓库、工具和预算,组成私有测试集。最后比较成功率、token 数量、用时和人工干预频率。原发帖者想要的也差不多——客观衡量自己的技能和工具如何影响 token 使用与成功率。

细节还没聊完。GLM-5.3 可以本地跑在单台 Mac Studio M5 Ultra(512GB 内存)上,4 比特精度,几乎无损失;也可以由四台 DGX Spark 组成集群跑。有评论说,用 Zcode harness 跑这个基准,GLM-5.3 的得分应该更高。但这套 harness 还没有 CLI 版本。评论区的关注点也不全在性能上,有人提出的另一套标准是:模型适不适合当“网络老婆”。

有人已经在期待 Terminal Bench 5.0:“我现有的模型会越来越差。”

阅读原文
📚 相关主题 大模型基准测试

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新