原生多模态新模型性能超越前代,价格降至十分之一
GLM-5.3-Flash 是 GLM-5 系列中第一个原生多模态模型。所谓原生多模态,是指模型在训练阶段就同时处理文本和图像,不是后期拼接出来的能力。
总参数 320B,每次推理只激活 18B。打个比方,一个团队有 320 人,每项任务只让 18 个最相关的人上场。模型因此保留了大模型的知识储备,也把计算开销压了下来。
最直接的结果是价格。它在基准测试和真实工作负载上都优于 GLM-5.2,价格只有后者的十分之一。
能做到又强又便宜,关键在于架构重新设计。它基于一个新训练的基座模型,架构和训练方案围绕能力与效率两个目标从头设计。
GLM 系列第一次用上混合架构,把稀疏注意力和线性注意力结合在一起。这种组合在不牺牲精确长上下文能力的前提下,大幅削减了长文本服务成本。
模型还用了 Manifold-Constrained Hyper-Connections(mHC),一种提升扩展效率的连接方式。训练数据是新的 30T-token 多模态预训练语料,也就是 30 万亿个 token 的文本和图像数据。
在能力层面,它在编码和智能体基准上接近 Claude Opus 4.8。编程辅助和自动化任务,它已经摸到顶级模型的门槛;价格则只有 GLM-5.2 的十分之一。
评估细节在技术报告里。HLE w/ tools 评估使用温度 1.0、top_p 0.95。最大生成长度 163,840 tokens,最大上下文长度 300,000 tokens。评判模型是 GPT-5.6-luna (medium)。NL2Repo 在 100 万 token 上下文下运行。DeepSWE 用 mini-swe-agent 框架,超时 6 小时,上下文 400K。Terminal-Bench 2.1 在 Claude Code 2.1.207 里评估,同样超时 6 小时。Toolathlon Verified 结果通过官方评估服务获得。pass@1 取 3 次独立运行的平均值。AutomationBench 用 v1.0.6。GDPval-AA v2 由 Artificial Analysis 评估。BabyVision 要求输入图像短边至少 1.5K 像素。
许可证是 MIT。MIT 允许自由使用、修改、商用,没有附加条款限制。企业可以把它集成进自己的产品,包括做商业用途。
部署方式也灵活。API 服务已经在 Z.ai API 平台开放,模型 ID 是 zai-org/GLM-5.3-Flash。模型更新于约 2 小时前,下载量 429 次。本地部署可以选 SGLang、vLLM、TokenSpeed、KTransformers 四个推理框架。模型支持英语和中文,pipeline_tag 是 text-generation,社区渠道有微信和 Discord。
技术报告已发布在 arXiv 上,编号 2602.15763。标题是《GLM-5: from Vibe Coding to Agentic Engineering》。作者是 GLM-5-Team。博客和技术报告都已公开。标题里的两个词概括了模型定位:从“随性编码”到“智能体工程”。也就是从辅助写代码,转向构建能自主完成复杂任务的智能体。
目前还有几处没写明。推理速度没有具体延迟数据;API 定价没有公布,只知道和 GLM-5.2 的比值;微调是否支持没提。最大上下文窗口也没有明确说明,评估里用的 300K 和 1M 只是测试条件。