AI Pulse
📡 X 信号

研究者指出这些新架构能大幅降低大模型推理内存消耗

第5天:推理工程

老实说,今天研究的内容更多是机器学习而非推理。我一整天都在读Gated Delta Net和Kimi Delta Net注意力论文。

我认为这就是未来模型的方向(OAI和Anthropic不可能不采用这些线性记忆架构),所以从第一性原理去理解它非常重要。

GDN和KDA(分别被Qwen和Kimi使用)先使用3个线性层,再接一个MLA层;所以技术上来说你仍然有KV缓存,但它被MLA压缩了,而且最终大小只有常规大小的1/4——因为只有每四层才会保留缓存。

这种改进给推理带来的影响怎么强调都不为过。模型服务很大一部分工作就是内存/KV管理,如果KV计算的复杂度不再是平方级,你就能服务大得多的批量,因为内存墙的限制变小了。

在线性层中,你会得到一个dim(k) × dim(v)的单矩阵,每一步都会对它进行衰减(GDA用标量衰减整个矩阵,KDA用学习得到的向量按特征维度衰减),然后再加上vk^T外积。

真的很荒谬,很少有人讨论这些架构更新有多重要,尤其是它们还是开源的。作为工程师很重要的一点就是不断更新知识,跟上前沿(我其实在3月就第一次读到了GDA,但当时天真地没当回事)。

我还读了很多关于Looped Transformers的内容。有传言说,未来很多开源和闭源模型都会基于这个架构。

它的基本思路是,你不用让模型完整过一遍32层、每一层都有独立注意力和FFN权重,而是让它对8层注意力和FFN权重做4次“循环”前向。

所以计算量不变,但权重内存节省了4倍(这个参数是可调的)。把它和线性注意力结合,你用的内存就比原生Transformer少得多(比如带完整KV缓存的GQA),这还是在 quantization 之前。

模型多次重复通过同一组权重,意味着每一轮循环每层都会得到更新后的残差向量,因此残差可以被修正、调整到嵌入空间更准确的区域。

这种重复前向非常类似于训练的epoch——你想想训练只跑一个epoch就完事是什么效果。

它还能让每个循环线性记忆状态接收到新的残差输入,从而从对应的W_K和W_V矩阵得到新的k和v投影。

这两篇论文都非常有深度,我上面说的也只是皮毛,所以你应该能理解,为什么通读这两篇花了我几乎一整天。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新