MiMo-V3新核心HySparse2性能大提升
MiMo-V3 采用了全新架构。其核心部分 HySparse2 今日发布。
更少预填充,更小 KV 缓存,更好的长上下文检索——我们一次性实现了这三点。
对比 MiMo-V2.6 的 Hybrid SWA 架构:
• 在 1M 标记下预填充 FLOPs 降低 5.02 倍
• 在 1M 标记下 KV 缓存缩小 4.5 倍
• MRCRv2 和 RULER-v2 分数更高,同时 AgentPPL 和 LongPPL 更低
为什么要构建新架构?智能体推理的工作负载非常不同。每一轮中,一个短动作可以返回一个长观察结果,这个结果需要预填充,同时上下文还在不断增长。
这就把预填充成本、KV 缓存大小和检索精度同时推到了关键路径上。HySparse2 通过两级 KV 共享解决了这三个问题:
• KV 桥接:继 YOCO 之后,交叉解码器中的全注意力层从自解码器隐藏状态构建自己的 K/V。
• KV 复用:在每个混合块内,稀疏层复用前一个全注意力层的 KV 缓存和选择索引。
另外还有两处改动:标记级选择替换了块级选择,强制最近标记窗口替换了独立的 SWA 分支,因此本地和全局标记共享一个 KV 缓存。
由于现在所有交叉解码器 KV 缓存都来自自解码器,预填充可以在自解码器完成后立刻停止。
论文:
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖