Apple 测试发现大模型根本不会做小学数学
Apple 认为 AI 模型做不了数学……连小学水平的数学都做不了。多年来,OpenAI 和 Google 这类实验室一直吹嘘自己的模型在 GSM8K 这类基准测试上拿到了近乎完美的分数。他们声称 AI 已经掌握了逻辑问题解决能力。
Apple 决定验证这是不是真的。他们搭建了一个名为 GSM-Symbolic 的全新基准测试。和静态问题不同,它使用模板动态生成不同的名称、数字和变量。测试结果揭露了一个毁灭性的真相。
当 Apple 修改一道基础应用题里的简单数字后,模型准确率暴跌。AI 根本没有在解数学题,它只是依赖训练数据里的模式匹配。它靠熟悉度猜测,而非靠推理解题。
之后他们做了一项测试,彻底戳破了这个假象。他们在一道数学题里加入了单独一句不相关的分句。只是一句看起来重要、但对实际计算完全没有影响的背景文本。从 ChatGPT 到 Claude,所有前沿模型的性能都出现了大幅下滑。部分模型准确率暴跌最多 65%。而加入的只是一段七岁小孩都能轻松忽略的干扰信息。
结论非常直白:当前的 AI 模型不具备真正的逻辑推理能力。它们不懂数学。它们只是复杂的模仿引擎,复制了人类逻辑的外形,却没有真正思考。
当模式干净规整的时候,它们看起来像天才。只要你加入一点微小的改动,一个变量变化,或是一个干扰,假象就会立刻破碎。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖