小米跳过一代迭代,AI智能体架构获新突破
有人平时用AI聊天、写方案,经常要处理很长的历史对话,却会遇到卡顿、回答跑题的问题。这一次小米的新架构,刚好瞄准了这个痛点。
小米近期推出的MiMo-V3大模型,采用了全新的架构,核心是刚发布的稀疏注意力架构HySparse2。
和上一代MiMo-V2.6使用的Hybrid SWA架构相比,在1百万token(约相当于75万字文本)的长上下文场景下,预填计算量降低5.02倍,KV缓存(存储历史注意力计算结果的内存空间)缩小4.5倍,同时多项性能测试得分也更优秀。
原来大模型用的标准全自注意力机制,会随着上下文长度增加,出现计算量和内存成本暴涨的问题,最核心的瓶颈就是KV缓存的存储压力。HySparse架构就是为了缓解这个瓶颈设计的。
@_LuoFuli 认为:新架构同时实现了预填计算更少、KV缓存更小、长上下文检索效果更好三个目标,这是因为智能体推理(AI智能体边运行边获取信息)的工作模式和普通大模型不同,需要适配新架构。
@ItsmeAjayKV 认为:小米已经在推进下一代MiMo-V3架构,MiMo-v2.6可能就是最后一个V2版本了,他们做新架构的动机很有意思。
@teortaxesTex 认为:小米这次直接跳过一代迭代,HySparse2走的是已经公开的研究方向,是比较稳妥的升级路线。
这款MiMo模型本身是小米用MIT许可证开源的,任何人都可以免费使用、修改,专门适配需要长时间运行的AI智能体。
也就是说,普通开发者想要做一个能记住很长对话历史的AI智能体应用,不用再花费高昂成本适配旧架构,现在有了更高效的免费开源选项。
做AI应用创业,或者想要自己折腾AI工具的人,可以直接基于这套优化后的架构做开发,不用再纠结长上下文带来的卡顿和成本问题。
已经有公开研究路线验证过方向,小米又做了工程优化还开源出来,接下来会不会有更多低成本的长上下文AI智能体出现?