AI Pulse
📡 X 信号

大模型评测为何异于基准?分享真实评测方法

很多人问我,为什么我的模型评测结果经常和基准测试或其他人的评测不一样,所以这里我来讲讲我实际是怎么做的。

第一个错误就是主要靠编码来评判模型。编码现在可能是AI领域优化程度最高的方向,各大实验室都在这方面投入大量训练,基准测试也重点关注它,而且几乎所有主流前沿模型现在都能把大概90%的日常编码工作处理得足够好。所以问“这个模型会不会写代码”给我的信息非常少。真正的差距出现在其他地方。

常识、规划、判断、写作、理解模糊指令、知道自己的方法错了、长任务中保持上下文、配合你工作而不是一头扎进第一个想到的路径里。举个例子,GLM 5.3和Kimi K3。在纯编码任务中,我经常发现GLM表现极强,代码干净、速度快、纸面成本低,而且在很多编码场景中它的表现都比Kimi好。

但如果你让两个模型从头理解一个大型项目,决定项目该怎么架构,质疑你最初的方法是否合理,并且在动手写代码之前先拿出一个合理的规划,这时候差距就出来了。Kimi给我的感觉就是多了一层理解深度,这是编码基准测试无法捕捉的。

我觉得这也是为什么就算Fable这类模型价格昂贵、限制很多,人们还是一直在用的部分原因。魔力往往不在代码本身。魔力在写代码之前发生的事情:规划、判断、深度,以及发现你遗漏之处的能力。

所以我的测试方式不一样。我把模型放到我自己实际的工作流里,连续好几天几乎所有事情都用它来做:编码、数据库、界面、调研、报告、翻译、写作、规划、浏览器操作、电脑操作、调试、分析,还有一整天里的日常对话。

我最喜欢的一个例子是把一本长篇中文小说翻译成阿拉伯语。篇幅很长,充满专业术语,需要模型能够保持上下文、保持一致性,在巨量文本中都维持翻译质量。有哪个基准测试能测这种东西?大概率没有。但恰恰就是这类任务,能暴露一个模型能不能胜任真实工作。而且这一次,所有测试还产出了一个我真的很喜欢的成果。

可靠性同样重要。基准测试通常测试的是模型能不能在它专门优化过的任务上成功。我关心的是,当我丢给它一个完全不同的问题时,会发生什么?它能一直稳定成功,还是需要我盯着它?

它能不能理解简短的自然指令,正确补全缺失的上下文?任务进行三个小时后它还能保持敏锐,还是我会慢慢发现,我其实是在监管一个用矩阵乘法做出来的迷糊实习生?

判断能力是另一半。如果我提出需求,模型有没有足够的判断力告诉我还有更好的选择?它能不能探索其他选项,识别出我建议的路径不好?还是说它只会朝着一个方向猛冲,就因为那是它收到的第一条指令?在真实工作中,这种差异天差地别。

我也从来不只看token定价。大家会说某个模型便宜,因为它每百万token收费更低,这完全可能误导人。在我的一些测试里,GLM 5.3在得到相似结果之前,生成的token数量最多比另一个模型多30倍。想象一下,模型A每个token贵3倍,但完成任务只用了十分之一的token。哪个实际上更便宜?真实成本是得到结果所需的成本。

速度也是一样,一个跑得很快但永远在探索错误路径的模型并不快。我还会把模型本身和它的适配框架分开来看,这件事的重要性比大多数人以为的要高。同一个模型在Cursor、Grok Build、Hermes、Devin或Codex里表现差异很大,因为上下文管理、提示词、工具、压缩和智能体架构都会塑造它的行为。

所以只要条件允许,我都会在多个适配框架中测试同一个模型,再给出我的结论。

我的评测覆盖视觉、调研、文学翻译、UI工作、规划、数据库、工具使用、长上下文、写作和日常任务。因为我实际上不是在测试一个模型能不能解决任务。我是在测试它能不能够格,成为我一整天都能安心共事的工作伙伴。到目前为止,很少有模型通过测试。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新