AI Pulse
📡 X 信号

研究者称大模型故意在用知识换推理能力

研究者称大模型故意在用知识换推理能力

模型是故意变笨的吗?这不是你的错觉。AI领域正在发生一件怪事。推理分数一直在攀升,但模型本身对世界的认知却似乎越来越少。

我们来看看开源本地模型。举个最新数学成绩的例子:GLM-5.2在AIME 2026上得分99.2%,每个token大约激活400亿参数。Qwen3.5激活170亿参数,得分91.3%。DeepSeek V4-Flash激活130亿参数。

相比之下,2023年的原始GPT-4据传激活约2800亿参数,仍在AIME难度的题目上表现吃力。就连小模型端的成绩也十分惊人:量化后的Qwen3.5 9B仅需约6GB显存,在Artificial Analysis的智能指数上,分数几乎是之前最佳100亿参数以内模型的两倍。

如果你只衡量数学和代码能力,你会得出结论:单位参数的模型智能正在大幅提升。在这些基准测试上,情况确实如此。但如果你向这些模型问一个简单的事实性问题,情况就会反转,而且这是刻意设计的。情况已经发生了转变。

在SimpleQA这个不允许使用工具、测试短文事实回忆能力的干净基准测试上,目前的榜首(2026年中期数据中的Gemini 2.5 Pro)得分约为53%。即便花钱能买到的最强参数记忆,仍然会答错近一半问题。

Artificial Analysis测试了更小模型在其知识基准上的幻觉率:Qwen3.5 4B和9B达到了80%到82%。让一个9B模型告诉你一位19世纪二流数学家的出生年份,你得到的回答往往自信、看起来合理,却完全错误。

这不是意外。AI实验室正在故意用世界知识换取推理能力。

参数到底买来了什么?事实需要占用空间。《语言模型物理学》系列研究(Allen-Zhu & Li)用受控的合成事实元组测量了知识容量,发现了一个一致的限制:即便是量化为int8,语言模型每个参数大约存储2比特的事实知识。

一个7B模型大概能存储140亿比特——理论上来说,如果用干净数据训练足够长时间,容量足够覆盖英文维基百科加上标准教科书。后续研究将估算修正为每个参数2-3.6比特,具体取决于架构和精度。

这是非常昂贵的空间。存储全面的细节:出生年份、人口数据、API特性、历史注释、产品规格,正是过去推动前沿模型走向万亿参数规模的原因。

推理则完全不同。它由一套紧凑的可复用流程组成:问题分解、状态跟踪、自我检查、回溯、矛盾检测。这些流程的压缩效果比原始事实好得多。在可验证任务上的蒸馏和强化学习,可以高效地把这些能力转移到更小模型中。

大量使用合成教科书数据训练的Phi风格模型就是这种模式的例证:数学能力强,知识问答弱。留存下来的知识也故意做得很浅。模型只保留足够用来重(原文此处截断)

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新