AI Pulse
📡 X 信号

GLM-5.3测试分数翻6倍,涨幅超出行业认知

GLM-5.3测试分数翻6倍,涨幅超出行业认知

啊?GLM-5.3的测试分数是怎么翻6倍的?

有一说一这个分数飞升有点猛了, 按我对 Terminal Bench 3.0 的理解, 里面的任务是实打实的难的。

比如这个 exam-pdf-eval, 就是个给考试试卷(PDF格式)评分的任务, 模型并不是自己直接解析PDF然后阅卷评分的, 而是要调用一个VLM, 然后自己写prompt, 让 VLM 抽取试卷内容, 然后再评分。

这是个最近特别火的概念, 叫【clarify model-specific prompt formatting】澄清特定模型的提示词格式, 也就是说, 模型要构建一个基于第三方黑盒的闭环验证系统。 这个VLM就是最大的变数。

以往来看, Terminal Bench 3.0 中的问题 Anthropic 系列的模型能打高分, 是因为有部分题目就是他们的研究员出的。 基本是御用测试题了。

但这次的跑分图,GLM-5.3 直接翻了六倍!所以估计 GLM-5.3 这次在复杂真实环境下做架构规划的能力会非常强。

尤其是面对黑盒 API, 不可预知的命令行报错和自己写 Prompt 的套娃任务,都会有不错的表现。

稍后我会给大家带来实测! #glm53 #glm #terminalbench

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新