AI Pulse

GLM-5.2一口气跑完百万token长任务,数学超GPT-5.5

GLM-5.2一口气跑完百万token长任务,数学超GPT-5.5

一口气跑完长时程任务

GLM-5.2是智谱AI最新的旗舰模型,定位是长时程任务。这类任务的特点就是耗时。比如修一个大型软件项目的bug,或者从零搭一个代码仓库。过去需要人把步骤拆开,分段喂给AI。GLM-5.2能一口气自己跑完,中途不用反复输入。

支撑这个能力的是上下文长度。GLM-5.2首次在100万token的上下文上稳定支持长时程任务。100万token约等于好几本厚书的量。上下文越长,模型越能记住任务中途产生的代码、报错、改动记录。不用靠人帮它总结重述。

上下文变长的代价

上下文变长不是免费的。注意力机制的计算量随长度上升,百万token级别的开销尤其大。GLM-5.2为此提出IndexShare架构。每四个稀疏注意力层复用同一个索引器。在100万上下文下,每token的计算量降低2.9倍。

投机解码也做了优化。改进后的MTP层把接受长度提升最多20%,用来压低生成延迟。模型还提供多种思考努力级别,在性能和延迟之间做取舍。

数学领先,编程未登顶

基准分数里,数学是GLM-5.2最突出的领域。AIME 2026数学基准得分99.2,超过所有对比模型。GPT-5.5是98.3,Gemini 3.1 Pro是98.2。HLE(人类最后的考试)基准上得分40.5,高于前代GLM-5.1的31。落后于GPT-5.5的41.4和Claude Opus 4.8的49.8。

软件工程是长时程任务最典型的场景。对比自家前代,GLM-5.2的进步幅度很大。SWE-Marathon从1.0升到13.0,DeepSWE从18升到46.2。FrontierSWE从30.5升到74.4。

和头部模型并列时,差距还在。SWE-bench Pro上62.1对Claude Opus 4.8的69.2。NL2Repo上48.9对Claude的69.7。DeepSWE上46.2对GPT-5.5的70。也有追上的地方。FrontierSWE的74.4超过GPT-5.5的72.6,逼近Claude的75.1。SWE-Marathon的13.0也高于GPT-5.5的12.0。

工具调用类测试里,MCP-Atlas的76.8接近Claude的77.8。Tool-Decathlon的48.2离Claude的59.9和GPT-5.5的55.6都有一段距离。

分数背后的设定

这些分数只在各自的评估条件下成立。HLE的裁判是GPT-5.5(medium),MCP-Atlas的裁判是Gemini-3.0-Pro。DeepSWE的每道任务跑在隔离容器里,只给2个CPU、8GB内存、没有互联网。Terminal Bench 2.1的Claude Code评估,通过透明代理把输出上限从64k覆盖到128k。分数取5次运行的平均值。

FrontierSWE、SWE-Marathon、PostTrainBench的评估方是第三方机构。Proximal、Abundant AI、PostTrainBench各负责一项。各家测试的上下文长度、超时时间、资源配额不同。分数跨模型对比时只能当参考。

MIT开源,本地可跑

分发方式上,GLM-5.2采用MIT开源许可证。没有区域限制,允许使用、修改和商用。本地部署支持SGLang、vLLM、Transformers、KTransformers、Unsloth等框架。昇腾NPU平台也有对应的推理支持。模型可以拉到自己的服务器上跑,代码库不用经过云端接口。

Hugging Face上,FP8版本的GLM-5.2过去一个月被下载146.7万次。4个Spaces在用它。下载量不直接等于使用效果,但至少说明开源社区对它的接受度很高。API定价没有公布,FP8版本与完整版的实际差别也不明确。

技术报告挂在arXiv上,标题是"GLM-5: from Vibe Coding to Agentic Engineering"。模型页面上已经出现提示:更新版本GLM-5.3可用。

阅读原文
📚 相关主题 开源大模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新