字节Seed联合普林斯顿、清华团队发布关于Falcon/Fast Weight Attention的研究论文(130M)
🚨大模型开始学会“边推理,边学习”了。字节 Seed 联合 Princeton、清华等团队刚发了一篇很有意思的论文,提出 Falcon / Fast Weight Attention,研究的核心就是 Continual Learning。现在绝大多数大模型训练结束之后,到了推理阶段,模型本身基本就固定了。
你给它再多新信息,它可以放进 Context,可以调用 Memory,但模型并没有真的在这个过程中持续“学习”。Falcon 想往前走一步。它给模型增加了一套 Fast Weight Memory。
模型每读到新的 Token,都可以根据当前信息实时更新这套 Fast Weight。作者直接把整个更新过程解释成一种 Online Learning。所以它有点像给模型加了一块临时的、可以不断学习的“短期权重”。
主模型参数没变,但模型内部的状态会随着它看到的信息持续变化。这件事也会顺带影响长上下文。传统 Transformer 要保留越来越大的 KV Cache,而 Falcon 可以不断把历史信息压缩进固定大小的状态里。
模型不用把所有 Token 原封不动留着,而是在读取过程中持续学习、更新和遗忘。目前实验规模还很小,只有 130M 左右参数。但在长度外推的数字加法测试中,Transformer 平均准确率只有 65.8%,Falcon-3A 做到了 87.2%;到了 48 位数字,Transformer 只剩 49%,Falcon 还有 69%。
我觉得这篇最值得关注的,其实是一个越来越明显的趋势:训练和推理之间的边界正在变模糊。以前是先训练一个模型,然后让这个固定的模型处理世界。现在 Test-Time Learning、Fast Weight、Continual Learning 这些方向,都在尝试让模型运行��来以后,还能继续根据遇到的信息改变自己。
如果这条路线继续跑下去,未来的 AI 可能不会每次都以同一个“自己”开始下一次推理。它会真的在使用过程中,持续学东西。不会 @ilyasut 的SSI也是这个路子?