AI Pulse
📡 X 信号

研究者指出现有注意力研究结论存在误导

从实用模型架构研究的角度来看,这篇内容具有误导性。有几个明显缺陷削弱了它的结论:

- 虽然SWA可以继承全注意力学到的权重,但你没有对线性注意力做同样的假设,你是在全注意力学到的QKV投影矩阵之上训练它,完全没有验证这种做法是否接近最优——实际上这种训练方法远非最优。

- 除了训练方式之外,文中测试的线性注意力变体也落后当前最优水平多年。没有前沿模型使用纯线性注意力。研究已经反复证明,最优配置是线性与全注意力的混合,这种混合的表现优于纯线性和纯全注意力。

例如,Kimi Linear的架构是每1层全注意力搭配3层kimi delta注意力,到目前为止,它仍是我试过的所有架构中性能最好的。而且我们确实在对比中加入了SWA混合模型。

- “训练线性注意力模型成本很高,大多数软件/硬件都是为Softmax注意力设计的”——这个说法不对。有很多快速开源内核是为线性注意力模型编写的,在上下文长度公平的情况下,它们的训练速度甚至比全注意力模型更快。说到这点,我在论文里没看到它指定训练序列长度。

- 我理解算力有限。你不一定非得做从零开始或大规模的训练,但即使是在这种基于切换的设置下,一项符合原则的工作仍然需要对各个变体做恰当的对比。

总的来说,我认为在宣称方法X被错误认定为劣势之前,全面了解该方法的当前发展状况很重要。如果一个人缺少算力/基础设施/数据等,开放研究仍然非常值得赞赏,但过于绝对且不符合原则的论断可能会产生误导。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新