AI Pulse
📡 X 信号

Moonshot AI发布Kimi Linear,速度提6倍降75%显存

Moonshot AI发布Kimi Linear,速度提6倍降75%显存

中国研究人员又做到了!Kimi 发布了一种注意力架构,运行大语言模型的速度是全注意力的 6 倍,GPU 内存占用比全注意力少 75%。

多年来,整个 AI 行业都被困在同一个瓶颈里。标准 Transformer 使用「全注意力」,每个词都必须和其他所有词做注意力计算。随着上下文长度增长,计算成本会爆炸式上升。运行长文档或大型代码库会慢得难以忍受,成本也高到离谱。

长期以来,一直有替代方案「线性注意力」模型试图解决这个问题。它们速度更快,但都有一个致命缺陷:效果不行。和标准 Transformer 相比,它们的性能总会崩盘。

直到今天。Moonshot AI 刚刚发布论文介绍了 Kimi Linear。这是一种混合线性注意力架构,它不只是能匹配标准全注意力,这是 AI 史上第一次,它的表现超过了全注意力,而且在所有基准测试中都赢了。

它的核心是 Kimi Delta Attention (KDA),这是一个全新设计的模块,能优化模型对内部内存的使用方式。他们用 KDA 和 Multi-Head Latent Attention 混合预训练了一个总参数 480 亿(激活参数 30 亿)的大模型。

得到的结果完全打破了硬件效率的原有规律:
• 在 100 万 token 上下文下,解码吞吐量提升 6 倍。
• KV 缓存占用减少 75%,大幅降低内存需求。
• 性能没有任何下降,实际上在短上下文、长上下文和 RL 扩展任务中,它的表现都优于传统全注意力模型。

它可以直接替换全注意力架构,能扩展到极长上下文,也不会给硬件造成负担。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新