GLM-5.3开放权重:漏洞利用翻倍,编码提升50%
智谱AI发布开放权重模型GLM-5.3。它和GLM-5.2共用同一个base model。能力提升全部来自post-training(后训练阶段)。编码能力比上一代提升50%,评测来自智谱自建的Z.ai Code Bench。技术报告标题是《GLM-5: from Vibe Coding to Agentic Engineering》。发布于2026年,arXiv编号2602.15763。团队在报告里写得很直白:后训练规模扩大,网络(cyber)能力成长速度超出预期。
几个关键基准的跃升幅度摆出来就能看清。Terminal Bench 3.0上,5.3得分28.3,5.2只有4.6,大约6倍。SWE-Marathon (v1.1)那边,42.5对19.4。AutomationBench (v1.0.6)则是48.2对26.2。这三个基准考的是同一件事:AI能不能在终端环境里自己把任务从头跑到尾。
放到真实编码任务里,GLM-5.3能接手的活儿变完整了。FrontierSWE拿到78.1,5.2是67.5。NL2Repo那边58.0,5.2是48.9。前者测真实软件仓库的问题修复,后者测从自然语言直接生成整个代码库。AI助手正从“回答碎片问题”转向接手更完整的任务。输出能不能直接信,哪部分要人工过一遍,得自己分辨。
网络能力是这次发布里最值得看的。CyberGym漏洞发现上,5.3拿到开放权重模型的最佳成绩:84.5,5.2是77.2。ExploitBench上54.4,5.2是24.4,翻了一倍多。ExploitGym的2小时和6小时评估里,5.3拿到105和130,5.2只有29和39。技术报告里的表述是:越往漏洞利用链路的上游走,提升越大。在exploitation基准上,比5.2翻了一倍以上。
一个能发现漏洞的模型,同时也更会利用漏洞。发布信息里没有提到安全约束机制。模型权重开放下载,有没有约束、怎么约束,直接决定它的使用边界。
部署层面,GLM-5.3支持SGLang、vLLM、TokenSpeed等框架本地部署。Transformers、KTransformers、Unsloth也支持。华为昇腾NPU平台同样适配,vLLM-Ascend、xLLM、SGLang都能跑。企业和个人可以完全在自己的硬件上运行,不依赖云端API。本地部署有技术门槛,但路径是通的。
模型有两个参数控制行为。reasoning_effort设置思考预算,分low、high、max三档,默认max。默认档位消耗更多计算资源,换更深入的推理。聊天场景要显式传clear_thinking=true,默认是false。
HLE with tools上,5.3得62.5,5.2是54.7。横向比较没有全面领先。对手包括Kimi K3、DeepSeek-V4 Pro-0813、Qwen3.8-Max等。
信息缺口还有几个。发布信息里没有上下文长度和参数量的数据,本地部署的硬件门槛也不明确。许可证细节没有披露。它有开放权重,但能不能商用、允许什么样的商用,要等具体条款。打算把它接进自己产品的团队,在许可证明确前还得再等等。