对话一长 AI 就忘事?原因和解决办法
AI 的“记忆”是上下文窗口这张工作台;对话太长会滚动丢弃,也越用越糊涂,附实用防忘技巧。
先给结论
AI 不是“忘了你”,而是它的工作记忆有上限。这个工作记忆叫上下文窗口(context window),相当于一张摆在它面前的桌子:桌面上放得下的东西它才能引用,放不下的部分,它连看都看不到。训练时学到的海量知识是它的长期记忆,单独放在“仓库”里,不占这张桌子。
对话一长,桌面就满了
每轮对话里,你说的话、它回的每一句、你粘贴的文档,都会原样累积在这张桌面上。截至 2026 年 8 月,以 Claude 为例,窗口上限根据模型不同可达 100 万 tokens(token 是模型读写文字的基本单位),但再大的桌面也扛不住无限累积。更麻烦的是,聊天软件为了让对话能持续进行,普遍采用“先来先出”的滚动策略:超过容量后,最早的消息会被悄悄挤出去,只留最近的一段。你开头交代的背景,到后半程它确实“看不到”了。
就算塞得下,也会越用越糊涂
还有一个更隐蔽的现象:当上下文里的 token 数量越来越多,模型对早期内容的准确回忆能力会下降,这个现象被称为“上下文腐烂”(context rot)。也就是说,即使所有内容都还在窗口里,它也可能从中间挑错细节。长对话里你感觉它“状态下滑”,很多时候不是错觉,而是长上下文本身带来的退化。
为什么不能把桌子无限加大
因为这张桌子有真实的物理成本。对话内容在模型运行时需要存在一种叫 KV 缓存(KV cache)的中间结构里,占的是 GPU 显存。自 2017 年以来,单个 token 的 KV cache 存储成本下降了约 100 倍,同时数据中心顶配 GPU 显存从 16GB 增至 288GB,这才有了今天几万到百万级的窗口。但显存再涨也追不上无限对话,所以产品只能设定上限。
防忘实操:把“必须记住的”放在最前面
既然它像人一样更依赖眼前的材料,你就把关键信息放到对话最顶部。很多产品支持自定义指令、系统提示(名称各异,通常叫“自定义指令”“项目说明”),这些内容会计入上下文窗口,但也不一定被永远完整保留。聊天界面按“先来先出”滚动时,早期内容仍可能被挤出去。更稳的做法是:把关键背景写在新对话开头或摘要里,而不是依赖它一直保留。这是性价比最高的一招。
长对话收尾时,让它先写摘要
一件事聊得差不多时,先让它把“我们已经确认的结论、接下来要做的动作、关键参数”整理成一段摘要,复制保存。之后新建一个对话,把摘要作为开场白贴进去。新对话等于给了它一张干净的桌子,而摘要是一张浓缩的便签。比你硬着头皮在旧对话里追着问有效得多。
一段对话只做一件事
把“查资料、写初稿、改格式、润色语气”拆成多个短对话,每个对话只守住一个小目标。短对话不容易触发滚动丢弃,上下文更精炼,回答质量也更高。如果它明显忘了之前的内容,别继续追问,直接把关键信息原样重发一次,通常比“你忘了吗?”管用。