智谱新旗舰GLM-5.2开源,100万token下算力开销压到三分之一
新旗舰模型GLM-5.2把目标定在长时程任务上:一个任务要连续做很久、跨很多步骤,不是一两句话能答完的。GLM-5.2能接下一整件事,自己从头跑到尾。
100万token:一次装进一整件事
这次的关键是上下文长度。GLM-5.2第一次在100万token的上下文长度上稳定支撑长时程任务。上下文够长,模型才能在任务后半段继续引用早期产生的信息。这是长时程任务能连续跑下去的基础。
长上下文推理的算力开销是个现实约束。智谱在GLM-5.2里提出了IndexShare架构。这个架构在每四个稀疏注意力层之间复用同一个索引器。在100万token长度下,每个token的算力开销被压到原来的约三分之一。MTP层也改了,用在投机解码上。这是一种通过预判后续token来加速生成的技巧。单次接受的token数量最多提升20%。
GLM-5.2还提供多种思考努力级别。性能与延迟之间的取舍,调用方可以自己选。
分数:追上了一些,还有差距
数学基准AIME 2026上,GLM-5.2拿到99.2。Claude Opus 4.8是95.7,GPT-5.5是98.3,GLM比两者都高。HLE上得40.5,高于上一代GLM-5.1的31。但低于Claude Opus 4.8的49.8,也低于GPT-5.5的41.4。
更值得看的是编码长任务。SWE-bench Pro上,GLM-5.2得62.1。GPT-5.5是58.6,Claude Opus 4.8是69.2。Terminal-Bench 2.1上得81.0。Claude是85,GPT-5.5是84。DeepSWE从18跳到46.2,GPT-5.5是70。SWE-Marathon从1.0跳到13.0,高于GPT-5.5的12.0。FrontierSWE从30.5跳到74.4。Claude是75.1,GPT-5.5是72.6。
和上一代比,提升相当明显。不过和头部闭源模型比,差距还在。NL2Repo上,Claude Opus 4.8拿69.7,GLM-5.2只有48.9。DeepSWE上Claude是58,GLM是46.2。SWE-Marathon上Claude是26,GLM只有13。三个独立评估方是Proximal、PostTrainBench和Abundant AI。它们都在1M上下文和最大努力级别下评估。结果走向一致:追上了不少,还没对齐。
这些分数不能直接横着比。HLE用163,840 token的最大生成长度。HLE-with-tools把上下文限制在300,000 token。SWE-Bench Pro跑400K窗口。Terminal-Bench 2.1限制在256K和4个CPU、8GB内存。DeepSWE在无互联网的隔离容器里跑。设置不同,分数只反映各自条件下的表现。
开源和本地部署
GLM-5.2以MIT许可证开源,没有区域限制。部署框架覆盖SGLang、vLLM、Transformers、KTransformers和Unsloth。昇腾NPU上也能用vLLM-Ascend、xLLM和SGLang。模型装在自己的硬件上,数据不出本地。
社区已经动起来了。上个月下载量1,452,214次。Hugging Face上有100个Spaces在跑它。智谱把技术报告标题定为“GLM-5: from Vibe Coding to Agentic Engineering”。这个标题点出的方向是:从氛围编程转向智能体工程。
模型页面已经标注了一个更新版本GLM-5.3-BF16。