AI Pulse
📡 X 信号

Google新方法可能终结Transformer AI架构时代

Google 悄然发布了一种可能终结整个 Transformer 时代的方法。

十年来,全球所有主流 AI 模型——ChatGPT、Claude、Gemini——都绑定在同一个架构上:Transformer。它让模型可以同时处理完整序列,彻底改变了这个领域。但它有一个致命缺陷:内存消耗是二次方增长的,复杂度为 $O(L^2)$。

随着上下文窗口扩展到数百万 token,计算成本会呈爆炸式增长。它需要巨型数据中心、数千块 GPU,还要消耗天价电费。

多年来,研究人员一直尝试用传统循环神经网络(RNN)替代 Transformer,以此获得线性闪电速度。但问题在于:RNN 的内存是固定大小的,文本变长后就会遗忘,在复杂推理和回忆任务上完全拉胯。所以所有人都又用回了 Transformer。

直到 Google 扔出了一篇重磅新论文。他们提出了 Memory Caching(MC,内存缓存)。Google 的这套方法不再强迫 RNN 依赖固定的静态内存,而是让模型的有效内存容量随序列长度动态增长。它就相当于神经网络的虚拟内存。

通过缓存隐藏状态的检查点,结合稀疏选择性检索这类智能机制,模型可以动态回溯它需要的信息,同时不会产生 Transformer 那样沉重的数学开销。

实验结果完全打破了序列建模的旧规则:
• 在复杂上下文内回忆任务上,精度达到了 Transformer 水平。
• 彻底补上了这些年来让 RNN 无法上场的性能差距。
• 始终保持线性复杂度,让长上下文处理的成本大幅降低、速度大幅提升。

这么多年来我们一直相信,庞大笨重的注意力机制是构建智能系统的唯一路径。Google 刚刚证明,你完全可以在拥有 Transformer 无限内存的同时,获得 RNN 惊人的速度和效率。

靠二次方注意力暴力堆规模的时代,已经撞到墙了。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新