AI Pulse

新多模态模型价格仅为前代十分之一,性能反超

新多模态模型价格仅为前代十分之一,性能反超

GLM-5.3-Flash 发布了。它是 GLM-5 系列第一个原生多模态模型。总参数 320B,活跃参数 18B,每次推理只激活其中一小部分。它在基准测试和真实负载上都优于上一代 GLM-5.2,价格是后者的十分之一。

低价来自架构改动。模型把稀疏注意力和线性注意力结合起来。稀疏注意力只让一部分内容互相比较,线性注意力用数学变换压低计算量。长上下文场景的服务成本被明显压低,同时保留了精确理解长文档的能力。30T token 的多模态预训练语料、新的 mHC 连接结构,让扩展效率比前代更高。落到使用上,处理几十万字的长文档或大型代码库,费用压力小了很多。

在编码和智能体任务上,它接近 Claude Opus 4.8。报告没给具体分数。

实际使用中有两个参数值得留意。reasoning_effort 控制思考预算,分 low、high、max 三档。默认 max,也就是最费算力的档位。不传参数或传了无效值,都按 max 算。聊天场景下有个 clear_thinking 参数,默认 false。思考过程会一并输出。想要简洁回复,就得显式传 true。两个默认值凑一起,等于什么都不调就以最贵的方式思考,顺带把思考过程展示出来。

开发者可以把模型部署到本地,官方列出了六个框架:SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth。评测覆盖的场景很广。上下文长度从 300K 到 1M,自动化软件工程任务最长超时六小时。视觉理解测试要求图片短边至少 1.5K 像素。推理评测由 GPT-5.6-luna 担任裁判。

还有几件事没有公布。API 价格只给了相对数——前代的十分之一,绝对数字没说。上下文窗口上限没有说明,评测用到的 300K、400K、1M 只是测试长度。权重是否开放也没确认,列出部署框架不等于开源。

技术报告标题是《GLM-5: from Vibe Coding to Agentic Engineering》。arXiv 编号 2602.15763。从“随手写代码”到“智能体自主做工程”,标题方向和它在智能体基准上的表现一致。

阅读原文
📚 相关主题 开源大模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新