英伟达新论文说大模型能互相蹭缓存省算力
Nvidia 的最新论文显示,一个大语言模型可以重复使用另一个模型的提示词记忆,无需再次处理整个提示词。
一个简单的线性转换器就能让相关的大语言模型重复使用已缓存的提示词记忆,跳过对长对话的重新处理。
正常情况下,当系统切换模型时,新模型会重新读取整个对话来构建自己的键值缓存——这是生成过程中使用的存储记录。
该研究的映射器会学习每个目标注意力头对应数个有用源层的关系,然后在转换前移除位置信息,转换后再恢复位置信息。
它从 500 个校准序列中学习,不需要反向传播,且仅在缓存形状匹配的相关模型上进行了测试。
在来自 Qwen3、Llama 3.1 和 Ministral 3 的 6 组模型对测试中,有 4 组保留了目标模型正常基准准确率的 73% 到 98%。
在所有测试的转换中,转换速度提升了 2.7 到 25 倍,而 Qwen3 之间的切换在 10 轮对话中保持了稳定。
测试中的失败案例表明,转换成功与否更少取决于总转换误差,而更多取决于误差是否出现在注意力实际读取的位置。
– arxiv.org/abs/2608.03893
标题:"Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse"
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖