AI Pulse
📡 X 信号

大模型长对话掉链子,问题出在你堆错了上下文

到第20条消息时,你的模型并没有变笨,是你把RAM塞满了。

karpathy、Shopify的Tobi和gartner都把它叫做上下文工程,不是又一条提示词大师技巧。

claude/gpt就像脏窗户一样衰减,架构优先。

翻转一下:提示词工程 = 你说一次的内容,上下文工程 = 模型每一轮都能看到的内容。

系统提示词、RAG、记忆、工具、历史、查询。

karpathy的框架:LLM = CPU,上下文窗口 = RAM,你就是操作系统,要么载入黄金数据,要么把机器搞崩。

数据(来自chroma和斯坦福):chroma 2025年7月测试了18个前沿模型,每一个都会性能衰减,测试集里包括gpt-4.1、claude 4、gemini 2.5、qwen3。

在超过3.2万个token后,准确率能从95%骤降到~60%,信息丢失在上下文中间。

斯坦福的数据显示,窗口中间的事实准确率下降约30%,宣传的是20万/100万token,实际有效窗口要小得多。

为什么长对话会搞砸?注意力稀释:token越多,注意力分布越分散。位置编码衰减:远距离位置会丢失线索,到第200步时,提示词已经变成噪声了。

优秀的上下文工程才是cursor、claude code、perplexity取胜的原因,不是模型品牌。

anthropic砍掉了claude约80%的系统提示词,基准测试性能零损失,更少的上下文通常能带来更锐利的输出,这不叫缺资源。

杀死智能体的4个bug:投毒——幻觉被反复引用成事实,必须验证;分心——被历史信息淹没,需要压缩;混乱——明明只需要3个工具却给了46个,最小可用工具就够;冲突——过期文档和最新文档打架,必须坚决裁剪过期日期。

今晚就能做什么(不需要生产级技术栈):大约发20条消息后开新对话,新任务 = 干净窗口。

claude projects/GPTs只保留一次系统提示,粘贴3段话,不要塞200页PDF。把指令放在上下文边缘,问题放在最后。检查日期,过期上下文是第一大错误来源。

核心观点:2023年是咒语赢,2025年是上下文工程赢,2026年是循环,再然后是图。基于脏上下文的智能体图,就是一堆好看的垃圾箭头。

赢家不是最聪明的模型,是最好的信号装配者。填满窗口 → 性能下降,给窗口做预算 → 保持锐利。收藏这条吧,拿走这张5分钟思维图。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新