AI Pulse
📡 X 信号

大语言模型标称百万上下文长度,实际训练仅支持四分之一

很多大语言模型标称支持1M(约100万字)上下文窗口,但实际训练过程中只接触过最多25.6万字的文本长度,超出部分是推理阶段通过外推实现的。

长上下文模型通常采用分阶段训练方式。预训练的大部分阶段只用4096到8192个token(约3000到6000字)的短序列训练,只在训练后期单独增加一段长文本训练,把上下文窗口拓展到12.8万字或25.6万字,这才是模型真正在训练中见过的输入长度。

超出训练长度的部分,一般靠YaRN这类位置编码插值方法实现,在推理时压缩位置信息,让模型能够处理比训练阶段更长的输入。

开源模型可以直接从配置文件看到真实的原生上下文长度,比如Qwen3的80亿到270亿参数模型,原生支持262144个token(约20万字),官方标注可扩展到1M。闭源模型不公开训练长度,只能通过第三方评测判断真实能力。

能容纳长输入和能在长输入上正常工作是完全不同的两件事。Google发布Gemini 4 Argon时,公开了GraphWalks任务的测试结果,该任务要求模型在长文本中遍历图结构。在12.8万字以内的输入,Gemini 4 Argon准确率为99.7%,输入长度拓展到25.6万字到1M后,准确率降到84.2%,下降了15个百分点。

其他模型的表现也类似:GPT-6 Astra从98.7%降到71.8%,下降了27个百分点;Claude Opus 5.5从90.6%降到66.8%,下降了近24个百分点;Claude Fable 5.1从91.4%降到65.0%,下降了26个百分点。所有模型在输入长度超过25.6万字后,准确率都出现明显下滑。

OpenAI的MRCR v2 8-needle任务要求模型在长文本中找到指定内容,测试结果也呈现类似趋势。GPT-6 Astra在51.2万字到1M输入长度上准确率还有96.3%,而上一代GPT-5.6 Sol只有73.8%。

更早的模型表现更差,GPT-5.4在51.2万字到1M输入长度上准确率只剩36.6%;Gemini 3.1 Pro在12.8万字时准确率为84.9%,到1M直接降到26.3%;DeepSeek V4在25.6万字以内还有82%以上的准确率,到1M掉到59%。

同一个GPT-6 Astra模型,在1M输入长度上,MRCR找物任务准确率有96.3%,GraphWalks推理任务准确率只有71.8%。这说明,在长文本里检索信息和在长文本里做推理是两种不同能力,模型标称1M上下文,只能说明它能塞进去这么长的输入,不代表能很好地处理。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新