OpenAI新模型Astra:虽令人惊叹,但被严重高估
Astra,一个 OpenAI 正在内部测试的新模型,令人惊叹。不可否认:
Noam Brown @polynoamial Lijie Chen @wjmzbmr110 来自我们下一个主要模型 Astra 的证明,解决了数学和理论计算机科学中长期存在的开放问题(还包括计算永久的新的电路下界!)
GPT-5.6 已经在数学和科学领域促成了许多激动人心的工作。迫不及待……
2026年8月1日上午8:17 · 840万次查看 · 664条回复 · 2110次转发 · 1.49万次点赞
但与此同时,一大批人——其中一些相当有名——四处奔走,就此事的影响发表着一个有严重缺陷的论点。看看你能不能找出其中的谬误。以下只是众多例子中的三个。
Dean W. Ball @deanwball 世界上每个人很快就能使用这个取得这些突破的模型来解决他们生活中遇到的每一个问题,无论多么平凡,而且成本将在几个月内大幅下降。我仍然难以理解这个事实。
Greg Brockman @gdbten 数学和理论计算机科学的重大进展。
使用我们下一个主要模型 Astra 的内部版本,以 Sol API 价格总计约 2000 美元的成本解决了:
2026年8月1日下午1:29 · 89.9万次查看 · 79条回复 · 102次转发 · 1480次点赞
Matt Shumer @mattshumer_ 解决其中任何一个问题都将是难以置信的惊人。
下一个 OpenAI 模型解决了十个。
看起来 GPT-next 会让 Fable 看起来像个玩具,并开创科学的黄金时代。
Noam Brown @polynoamial Astra 的一个内部版本,@OpenAI 的下一个主要模型系列,解决了数学、量子复杂性和理论计算机科学中的 10 个重大开放问题。
我们相信这将是科学推理的一大步。 https://t.co/iP6cyheZ7i https://t.co/jHuulDwV46
2026年8月1日下午4:45 · 5.9万次查看 · 77条回复 · 27次转发 · 404次点赞
还有一条推文甚至声称“人类刚刚跨越了一个单向门槛”;Elon Musk 将其视为我们已达到奇点的证据。他们都在犯本质上相同的错误。
这种谬误有一个名字;它被称为组合谬误
关于它的维基页面上满是很好的例子;这里只举前几个。在当前案例中,这种谬误的表现是什么?认为一个擅长某种数学问题的系统就擅长所有数学、擅长科学,甚至很可能擅长一切。“AGI 临近”群体一遍又一遍地犯着同样的逻辑谬误。每次有进展,我都看到同样的错误。
谬误是这样运作的。
1. 有人假装所有认知都是同等的。(完全错误。)
2. 每当人工智能在某种(高级的)认知形式上取得成功,他们就想让你相信所有形式的人工智能成功都即将到来。
你不需要是认知心理学家也能意识到这个推论根本不成立。比如,我们都知道,精通数学并不保证在所有领域都有天才。一个擅长数学、物理或编程的人可能不擅长写作或理解人际关系(反之,一个伟大的作家可能数学很弱,等等)。某一领域的专长完全不保证在所有或大多数领域都有专长。这正是 Howard Gardner 和 Robert Sternberg 等人提出多元智能理论的原因,也是 SAT 将数学和语言分开考试的原因。
Astra 似乎——我们还没有看到方法论——擅长数学,或者至少擅长某些形式的数学,但这并不意味着它会避免幻觉或解决其他生成式 AI 系统存在的可靠性问题。这甚至不意味着它能可靠地读取 PDF。也不意味着它将成为第一个能够遵守硬性规则的生成式 AI。(这应该让你感到恐惧。)
特别是,Astra 显然擅长某些问题;但这并不意味着它在难以形式化的问题上会出色甚至胜任。这并不意味着它会很神奇。这并不意味着它是 AGI 或 ASI 或任何那些。它非常令人印象深刻。但我看不出任何理由认为 Astra 是 AGI,更不用说 ASI 了。如果它能在 2024 年我与 Miles Brundage 的打赌中得 5/10 分,我会感到惊讶。
我不会如此长篇大论地讨论这个谬误,如果 (a) 它不是极其普遍,并且 (b) 我认为没有很好的理由认为这个谬误适用于这里。数学成为这些模型的闪光点并非偶然。数学有利于两件事:验证(使用符号工具)和大量廉价生产的合成数据,你可以保证答案是正确的。编程也是如此——但一般来说并非如此。你可以生成任意多的数学事实;你无法模拟开放的世界。你可以验证数学;你不能用同样的方式验证军事战略。
这不是新闻。至少从 2025 年 1 月起我一直在指出这一点 [第一行本应说是编码和数学],呼应了 Ernie Davis 和我在 2019 年关于围棋(以及为什么 AlphaGo 不会成为万能药)所说的话:OpenAI 能像 Astra 在数学上那样做,是因为数学允许外部工具进行验证和创建合成数据。这并没有让 Astra 不那么令人印象深刻,但正如我们十年前从 IBM 那次把赢得《危险边缘》的 Watson 变成抗癌机器的狼狈而最终失败的尝试中学到的,在一个领域的成功并不能保证在所有领域的成功。OpenAI 在这里处理的数学与许多(也许是大多数)现实世界问题截然不同,在那些问题中,验证既不能保证解决方案,也不能让人们实际上免费地产生无限训练数据。期望它成为万能溶剂,说明你不理解这个基本事实。
昨天的推文和博客是营销,而不是科学。那些推文和博客,以及随附的 249 页数学文章,都没有提供任何关于这是如何实现的信息:
Gary Marcus @GaryMarcus “Open”AI 发布了一篇 249 页的论文,关于新的数学成果,但没有任何一页是关于模型如何运作、证明如何验证、人类是否发挥了任何作用、任何提出的证明是否有错误等等。
科学怎么了?
2026年8月1日下午2:59 · 12.3万次查看 · 108条回复 · 67次转发 · 694次点赞
在评论这篇文章初稿的一封电子邮件中,Ernie Davis 相当正确地补充道:
要恰当地评估这些发现的重要性,我们需要一些关键信息。
第一:尝试了多少猜想?如果 OpenAI 团队从所有悬而未决的重要数学猜想空间中随机挑选了这 10 个猜想,而 Astra 全部解决,那将令人惊叹;但这似乎完全不可能。如果他们挑选了 50 个他们认为 Astra 能成功的猜想,而它成功了 10 个,那仍然令人惊叹,但程度要低得多。如果他们让 Astra 运行了所有大约 1000 个开放的 Erdos 猜想以及 10,000 个其他开放的猜想,那么它未能解决这些猜想,就是其作为数学推理者局限性的大量信息。
第二:OpenAI 大声吹嘘这总共只花了 2000 美元的计算成本。可以肯定的是,这只包括 Astra 成功的猜想,而不包括失败的。但参与这个项目的高薪数学家和计算机科学家的工资成本是多少?如果少于 20,000 美元,我会感到惊讶;如果超过 200,000 美元,我也不会感到意外。
我们不知道这些,而且按照目前的情况,我们可能永远不会知道。对于在 2025 年国际数学奥林匹克竞赛中获得金牌的 OpenAI 系统,我们仍然一无所知,对 Google 系统的信息也极少。
Astra 擅长一些数学,但数学“已被解决”(正如 X 上很多人似乎相信的那样)是非常值得怀疑的。它似乎擅长某些类型的数学,但很可能不是全部。以下是 Eric Weinstein 在 X 上关于它可能不太擅长的某些数学类型的一些例子。
Ernie Davis 还补充说:“自动形式化的问题——将人类数学家写的数学转化为严格逻辑形式——似乎还没有接近解决,尽管肯定取得了进展。例如:过去两年,数学家 Kevin Buzzard 一直在领导一个项目,用 Lean 形式化 Andrew Wiles 对费马大定理的证明。可以肯定地说,没有哪个 AI 系统能够完成这项艰巨的任务。如果他们能在无人协助的情况下做到,他们肯定会抢先他一步;如果他们能把他几年的工作缩短到几周,他一定会使用他们。”
这与我的普遍预测一致,即数学能力并不保证通用性。看来 Astra 的证明写作水平与证明本身并不相称(呼应了 Ernie Davis 和我一年前在这里观察到的情况)”[点击查看完整推文]
Henry Yuen @henryquantum 4. 我对这个证明的撰写感到失望(抱歉 Lijie -- 我应该早点看一下!)。它的写作方式具有许多 ChatGPT 生成证明的特征,长篇大论地阐述“样板”设置,然后漫不经心地引入……
2026年8月1日下午6:39 · 6.32万次查看 · 11条回复 · 13次转发 · 382次点赞
我严重怀疑 Astra 会神奇地解决当前模型中所有不能可靠工作的问题。它能可靠地从任意 PDF 中提取数字吗?怀疑。它能满足 Sabine Hossenfelder 希望 AI 为她的 YouTube 系列撰写脚本 [点击推文了解更多详情] 的愿望吗?怀疑。
Sabine Hossenfelder @skdh 我曾多次尝试让 ChatGPT、Claude、Grok 或 Gemini 为我的 YouTube 视频写脚本。仍然是彻底失败。
首先,他们无法想出有趣的主题。他们总是会建议那些已经被广泛报道的主题……
2026年8月1日下午12:34 · 12.7万次查看 · 490条回复 · 144次转发 · 2170次点赞
Astra 不是(正如 Musk 暗示的)奇点。话已至此。(但请看我最近关于这个主题的文章;一切都没有真正改变。)
声称 Astra 首次亮相“可能是数学史上最重要的一天”是荒谬的,正如一群人四处宣扬的那样,基于 Fable 一次运行中的一句话(如果被问两次,可能会给出不同的答案)。没有新理论,没有新技术,尽管它令人印象深刻,但远不能与微积分、代数、对数、概率、十进制系统、信息论、零的概念的发展相提并论。Davis 说:“Fable 引用的那句话——“其中几个单独拿出来都将是十年一遇的成果”——是荒谬的……作为现实检验,David Hilbert 的 23 个问题中有 14 个自 1900 年以来已被解决——也就是每九年一个——而这些结果远达不到那个级别。你很容易就能列出一份自 1926 年以来被证明的 100 个重要得多的成果的清单。”
我怀疑它会直接导致治愈癌症,或者如一些兴奋的 AI“影响者”所设想的那样,在“材料研究、能源生产、药物发现,以及一切”方面取得巨大进步。这也不意味着我们刚刚进入“自动化科学发现的时代”。针对这些过度激动的说法……
Derya Unutmaz, MD @DeryaTR_ 在 AI 时代,@OpenAI 的下一个模型系列 Astra 又实现了一个重大的历史里程碑!我们现在正在进入自动化科学发现的时代!
从根本上说,数学和理论计算机科学已经进入了后人类瓶颈的时代……
Noam Brown @polynoamial Astra 的一个内部版本,@OpenAI 的下一个主要模型系列,解决了数学、量子复杂性和理论计算机科学中的 10 个重大开放问题。
我们相信这将是科学推理的一大步。 https://t.co/iP6cyheZ7i https://t.co/jHuulDwV46
2026年8月1日下午12:47 · 2.57万次查看 · 29条回复 · 45次转发 · 463次点赞
……这个刚刚发布,呼应了 Arvind Narayanan 和其他人几天前发表的文章,我之前链接过。
How To Prompt @HowToPrompt__ 麻省理工学院和哈佛大学认为 LLM 距离真正的科学发现还差得很远。
他们发表了一篇论文,题为“评估大型语言模型在科学发现中的表现”。
每周,科技实验室都声称某个 LLM 在生物学、物理学或化学方面取得了突破。
但这证明了……
2026年8月2日凌晨4:54 · 2.69万次查看 · 33条回复 · 61次转发 · 241次点赞
尽管昨天在 X 上遭到了巨大反对(其中大部分是人身攻击,有些甚至涉及捏造,很多涉及彻头彻尾的谎言),我对 Astra 的总体即时看法仍然是我最初发布的内容:
可悲的是,Ernie Davis 和我在一年前就如何恰当地审视新系统提出了许多相同的观点:
我明白人们为 Astra 感到兴奋,但任何希望奇迹的人都很可能会失望。
没有帖子。