智谱开源GLM-5.3-Flash 首个原生多模态模型
🚨让我们欢迎新王GLM-5.3-Flash登基!
智谱 @Zai_org 刚刚正式发布并开源 GLM-5.3-Flash! 同时确认此前在 OpenCode、OpenRouter 上爆火的匿名模型 Ox-Alpha,就是它。
GLM-5.3-Flash拥有320B 总参数,仅激活 18B,是 GLM-5 系列首个原生多模态模型。
官方称,GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 拿到 57 分,与 Claude Opus 4.8 持平;在 Code Bench 中,Coding 表现也达到 Opus 4.8 水平。 但价格只有 Opus 4.8 的约 1/40。
而且相比上一代 GLM-5.2,它总参数更小、激活参数更低、层数几乎砍半,性能反而更强,API 定价只有 GLM-5.3 的 1/10。
背后是一套新的低成本架构: 线性注意力 + 稀疏注意力混合架构,加入 mHC,并针对 1M 长上下文优化 KV Cache 和注意力计算。
官方数据显示,相比 GLM-5.3,注意力计算量降低 3.01 倍,KV Cache 降低 4.44 倍。
但这次还有一个更重要的信息: 过去一周 Ox-Alpha 在全球产生的大规模真实调用流量,全部跑在国产芯片上。
智谱称,他们基于 @sgl_project 针对国产芯片重做推理引擎,通过 EPD 分离、W8A8、混合缓存量化、Layer Split 等技术,把端到端性能提升了 3 倍,单 Token 成本已经做到接近主流 NVIDIA GPU。
也就是说,这次不只是国产模型追上了前沿能力。
连前沿模型的大规模线上推理,也开始真的跑在国产芯片上了。