AI Pulse
📡 X 信号

Meta 时隔许久再发开源大模型,KV缓存效率惊人

Meta 时隔许久再发开源大模型,KV缓存效率惊人

哇哦,Meta 昨天发布了一个新的开放权重大语言模型,这还是从当年 Llama 那阵过后头一回有这种动作。

这个模型叫 Meta Muse Glimmer,是一个 30B 参数的多模态推理模型,采用类 Gemma 的架构设计。(“Glimmer”应该是玩“Spark”的文字游戏,Glimmer 是从能力更强的 Muse Spark 蒸馏出来的;不过 Muse Spark 目前只能通过 Meta 的模型 API 使用。)

架构方面,几个核心要点如下:
1. 上下文窗口“只有”131k,相比原生支持两倍长度的 Qwen3.6 和 Gemma 4 来说,这个长度合理,但在智能体编排的时代偏短。
2. 它是密集模型,不是混合专家模型。(因此把它和 Qwen3.6 27B 对比,比和 Qwen3.6 30B-A3B 对比更公平。)
3. 混合注意力,结合分组查询注意力(GQA)和滑动窗口注意力(SWA);SWA:GQA 的局部:全局比例为 3:1。作为对比,同样用了类似组件的 Gemma 4 比例是 5:1。
4. GQA 和 SWA 都采用门控注意力;门控注意力最近几个月已经相当常见,它本质是给注意力输出加一个 sigmoid 门,来决定有多少注意力信息进入残差连接。有意思的点是它只用了相对标准的 GQA 和 SWA,没有用 Nemotron 或 Qwen3.6 这类的混合注意力机制。
5. GQA 比例非常极端:32 个查询头,只有 2 个KV头;作为对比,Gemma 4 31B 的局部头是 32 Q / 16 KV,全局头是 32 Q / 4 KV。这意味着 Meta Glimmer 的 KV 缓存非常小。

整体来看,和它架构最接近的是 Gemma 3 27B(包括类 Gemma 的预/后RMSNorm位置设计)和 Gemma 4 31B,但做了一些调整,比如用 SwiGLU 而非 GeGLU 激活、加入门控注意力,还有前面提到的更极端的 GQA:SWA 比例。

它最突出的特点就是极端的 KV 缓存效率。即每个 token 对应的 KV 缓存大小(BF16 格式)分别是:
- Muse Glimmer:52 KiB(数值越低越好)
- Qwen3.6 27B:64 KiB
- Gemma 4 31B:840 KiB

模型性能方面,Meta 自己的基准测试显示它大多时候领先 Qwen3.6。而根据 Artificial Analysis Intelligence Index 的独立综合基准,它略微落后于 Qwen3.6(见下图)。所以它的真实排名还得用上几天才能知道。

整体来看,它是一个扎实的模型,尤其适合智能体工作流。最突出的优点就是内存占用非常低,预填充和解码速度也相当快。能看到 Meta 再次开放模型权重就已经很棒了:)。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新