AI Pulse
📡 X 信号

MiMo-V3新核心HySparse2性能大提升

MiMo-V3新核心HySparse2性能大提升

MiMo-V3 采用了全新架构。其核心部分 HySparse2 今日发布。

更少预填充,更小 KV 缓存,更好的长上下文检索——我们一次性实现了这三点。

对比 MiMo-V2.6 的 Hybrid SWA 架构:
• 在 1M 标记下预填充 FLOPs 降低 5.02 倍
• 在 1M 标记下 KV 缓存缩小 4.5 倍
• MRCRv2 和 RULER-v2 分数更高,同时 AgentPPL 和 LongPPL 更低

为什么要构建新架构?智能体推理的工作负载非常不同。每一轮中,一个短动作可以返回一个长观察结果,这个结果需要预填充,同时上下文还在不断增长。

这就把预填充成本、KV 缓存大小和检索精度同时推到了关键路径上。HySparse2 通过两级 KV 共享解决了这三个问题:

• KV 桥接:继 YOCO 之后,交叉解码器中的全注意力层从自解码器隐藏状态构建自己的 K/V。
• KV 复用:在每个混合块内,稀疏层复用前一个全注意力层的 KV 缓存和选择索引。

另外还有两处改动:标记级选择替换了块级选择,强制最近标记窗口替换了独立的 SWA 分支,因此本地和全局标记共享一个 KV 缓存。

由于现在所有交叉解码器 KV 缓存都来自自解码器,预填充可以在自解码器完成后立刻停止。

论文:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新