AI Pulse
📡 X 信号

长运行AI代理,定期整理内存会更好用

长运行AI代理,定期整理内存会更好用

长时间运行的智能体如果能定期停下来整合记忆,或许会表现得更好。

问题在于,如今基于 transformer 的智能体随着上下文长度增长,速度会越来越慢,成本也越来越高,因为注意力机制必须不断检查更多的过往 token。

针对长上下文的常规解决方案是把更多 token 保留在附近,但这会让每一次下一个 token 预测都需要在过往内容中进行更大范围的搜索。

这里有一个更巧妙的思路:记忆不只是存储。有时候最难的部分是把一段杂乱的经历转换为一种之后实际能用的状态。

所以这篇论文的思路是增加一个睡眠阶段:模型会暂停运行,多次重读近期的上下文,把有用信息写入固定大小的记忆层,之后清空短期注意力缓存。

在睡眠阶段,模型会对近期上下文进行多次离线遍历,把结果写入其状态空间模块内部的快速权重,随后清空注意力缓存。

这意味着模型只会在睡眠时消耗额外算力,回答过程不会,因此正常预测依然可以通过1次前向传播完成。

作者在元胞自动机、图查找和 GSM-Infinite 数学问题上测试了这个方法,这些任务中模型必须使用已经不在注意力缓存中的旧信息。

主要结果是,更长的睡眠能提升性能,在需要深度推理(而非仅仅记住一个事实)的更难任务上提升尤其明显。

这项工作的重要意义在于,长周期智能体未必需要永远承载越来越大的原始上下文,因为它们可以整合重要部分,然后安全地遗忘原始 token。

—— arxiv.org/abs/2605.26099 标题:"Language Models Need Sleep"

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新