AI Pulse
📡 X 信号

中国开源GLM-5.3-Flash跑分赢了付费Claude Opus

中国开源GLM-5.3-Flash跑分赢了付费Claude Opus

The mystery is over. Ox Alpha is GLM 5.3 Flash and it just dropped. 63.4 on DeepSWE. It beats Claude Opus 4.8. A free open source model from a Chinese lab is outscoring a $200/month Anthropic flagship on one of the hardest coding benchmarks in AI.

This is the model that went viral on OpenRouter last week and nobody knew who built it. Now you can run it yourself. Open source is not the future. It is already here.

🚨让我们欢迎新王GLM-5.3-Flash登基! 智谱 @Zai_org 刚刚正式发布并开源 GLM-5.3-Flash! 同时确认此前在 OpenCode、OpenRouter 上爆火的匿名模型 Ox-Alpha,就是它。

GLM-5.3-Flash拥有320B 总参数,仅激活 18B,是 GLM-5 系列首个原生多模态模型。 官方称,GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 拿到 57 分,与 Claude Opus 4.8 持平;在 Code Bench 中,Coding 表现也达到 Opus 4.8 水平。 但价格只有 Opus 4.8 的约 1/40。

而且相比上一代 GLM-5.2,它总参数更小、激活参数更低、层数几乎砍半,性能反而更强,API 定价只有 GLM-5.3 的 1/10。 背后是一套新的低成本架构: 线性注意力 + 稀疏注意力混合架构,加入 mHC,并针对 1M 长上下文优化 KV Cache 和注意力计算。

官方数据显示,相比 GLM-5.3,注意力计算量降低 3.01 倍,KV Cache 降低 4.44 倍。 但这次还有一个更重要的信息: 过去一周 Ox-Alpha 在全球产生的大规模真实调用流量,全部跑在国产芯片上。

智谱称,他们基于 @sgl_project 针对国产芯片重做推理引擎,通过 EPD 分离、W8A8、混合缓存量化、Layer Split 等技术,把端到端性能提升了 3 倍,单 Token 成本已经做到接近主流 NVIDIA GPU。

也就是说,这次不只是国产模型追上了前沿能力。 连前沿模型的大规模线上推理,也开始真的跑在国产芯片上了。

🚨实锤:Ox Alpha 身份正式揭晓!系为GLM5.3-Flash!权重今晚开源! Bloomberg 今日报道,智谱 zAI 已官方确认:神秘免费模型 Ox Alpha = GLM-5.3 Flash。 拆解关键细节:

🔹身份坐实:不再是“stealth 匿名模型”,就是智谱自家 GLM 新版本,社区此前 tokenizer / 错误码指纹指向 GLM 的猜测全部对上。

🔹权重今晚开源:zAI 回应 Bloomberg 称,将于今晚释放模型权重。

🔹规格拉满:104.8万 token 超长上下文,支持文本 + 图片 + 视频输入,主打编程、推理和长周期 Agent 任务。

🔹用量炸裂:免费期间直接登顶 OpenRouter / OpenCode 用量榜,6天狂吞约 42T tokens,一度把 DeepSeek 挤下第一。

🔹打脸全场:之前传 Gemini、小米 MiMo、微软等猜测全部落空,谷歌员工含糊发言也成了烟雾弹。

中国开源模型又一次用“先免费狂飙、再官宣开源”的节奏把全球开发者整不会了。今晚权重落地,值得蹲。

#OxAlpha #GLM5.3 #zAI #智谱AI #开源大模型 #LLM #中国AI #OpenRouter

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新