AI Pulse
📡 X 信号

智谱开源GLM-5.3-Flash 首个原生多模态模型

智谱开源GLM-5.3-Flash 首个原生多模态模型

🚨让我们欢迎新王GLM-5.3-Flash登基!

智谱 @Zai_org 刚刚正式发布并开源 GLM-5.3-Flash! 同时确认此前在 OpenCode、OpenRouter 上爆火的匿名模型 Ox-Alpha,就是它。

GLM-5.3-Flash拥有320B 总参数,仅激活 18B,是 GLM-5 系列首个原生多模态模型。

官方称,GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 拿到 57 分,与 Claude Opus 4.8 持平;在 Code Bench 中,Coding 表现也达到 Opus 4.8 水平。 但价格只有 Opus 4.8 的约 1/40。

而且相比上一代 GLM-5.2,它总参数更小、激活参数更低、层数几乎砍半,性能反而更强,API 定价只有 GLM-5.3 的 1/10。

背后是一套新的低成本架构: 线性注意力 + 稀疏注意力混合架构,加入 mHC,并针对 1M 长上下文优化 KV Cache 和注意力计算。

官方数据显示,相比 GLM-5.3,注意力计算量降低 3.01 倍,KV Cache 降低 4.44 倍。

但这次还有一个更重要的信息: 过去一周 Ox-Alpha 在全球产生的大规模真实调用流量,全部跑在国产芯片上。

智谱称,他们基于 @sgl_project 针对国产芯片重做推理引擎,通过 EPD 分离、W8A8、混合缓存量化、Layer Split 等技术,把端到端性能提升了 3 倍,单 Token 成本已经做到接近主流 NVIDIA GPU。

也就是说,这次不只是国产模型追上了前沿能力。

连前沿模型的大规模线上推理,也开始真的跑在国产芯片上了。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新