智谱发布GLM-5:能自主完成长周期任务,权重开源
从聊天到干活
智谱 AI 发布新一代语言模型 GLM-5,目标不是把聊天做得更好,而是接手复杂系统工程和长周期智能体任务。这类任务的共同点是步骤多、耗时长、中间需要自己拿主意。
技术报告标题是《GLM-5: from Vibe Coding to Agentic Engineering》。Vibe Coding 的意思是描述个大概,AI 负责生成代码片段。Agentic Engineering 是另一个层面:AI 在一个长周期任务里自己规划、自己执行。GLM-5 要处理的是后者。
分数:在具体任务上变强了多少
智谱称,在推理、编码和智能体任务上,GLM-5 的成绩是开源模型里最好的。
相比 GLM-4.7,有几项基准提升明显。Terminal-Bench 2.0(Terminus 2)从 41.0 涨到 56.2,另一种配置下为 60.7;CyberGym 从 23.5 涨到 43.2;MCP-Atlas 从 52.0 涨到 67.8。
BrowseComp 从 52.0 涨到 62.0。中文版 BrowseComp-Zh 从 66.6 涨到 72.7。带上下文管理的版本从 67.5 涨到 75.9。τ²-Bench 从 87.4 涨到 89.7,Tool-Decathlon 从 23.8 涨到 38.0。
还有一个基准叫 Vending Bench 2,计分单位是美元。GLM-5 得 4,432.12,GLM-4.7 得 2,376.82。这是基准得分,不是实际经营收益。
模型变大,成本没有跟着失控
更大的能力通常伴随更大的模型。GLM-5 的总参数为 7440 亿,GLM-4.5 是 3550 亿。每次推理“激活”的参数(真正参与计算的那部分)从 320 亿增加到 400 亿。预训练数据从 23T token 增加到 28.5T token。
参数变大,部署成本通常会跟着涨。GLM-5 集成了 DeepSeek 的稀疏注意力技术 DSA。读取上下文时,模型不必把整段历史从头到尾重新算一遍,只处理相关的部分。DSA 大幅降低了部署成本,同时保住了长上下文的能力。
训练侧,智谱开发了一套叫 slime 的异步强化学习基础设施。强化学习是模型通过试错改进输出质量的环节。异步意味着多个训练任务可以同时进行,不必排队等待。智谱说,slime 大幅提高了训练吞吐量和效率。
开源,谁都可以拿去跑
GLM-5 权重开放,支持本地部署。vLLM、SGLang、KTransformers、Transformers、xLLM 五个框架都做了适配。版本方面,分别要求不低于 v0.19.0、v0.5.10、v0.5.3、v0.5.4、v0.8.0。有 GPU 的团队可以拉下来自己跑,也可以接进已有的产品。
智谱没有公布 API 价格、上下文窗口长度、推理速度,也没有提到图像或视频的多模态能力。长任务里能用多深、真实产品里跑多快、对闭源模型有没有价格优势,全看这些数字最后怎么定。
与最强的模型差多少
在 HLE 上,GLM-5 得 30.5,GLM-4.7 得 24.8,GPT-5.2 得 35.4。带工具的 HLE 上,GLM-5 得 50.4,GLM-4.7 得 42.8,Kimi K2.5 得 51.8。软件工程基准 SWE-bench Verified 上,GLM-5 得 77.8,GLM-4.7 得 73.8,Claude Opus 4.5 得 80.9。
上一代 GLM-4.7 在 HLE 上落后 GPT-5.2 10.6 分,这一代 GLM-5 落后 4.9 分。SWE-bench Verified 上,落后 Claude Opus 4.5 的分数从 7.1 分缩小到 3.1 分。一次发布,差距大约缩小一半。