AI推翻两大数学猜想,顶尖数学家:这是里程碑
摘要
数学世界目前正在蓬勃发展,因为部分数学领域正被各种AI生成的结果席卷,特别是大量针对各种开放猜想的反例。(人类数学家正在被反例超越 | Xena, Open Math Problems Claimed to Be Solved with AI, VibeMathed - Math Problems Solved by AI, AI Uncovers Counterexample to 87-Year-Old Jacobian Conjecture / X, Ten advances in mathematics and theoretical computer science | OpenAI)
X/Twitter上满是声称自己找到了各种猜想反例的人。其中很多是合法的,也有很多不是。(Robert Joseph on X: Searchable index of 200+ AI-assisted results in math.)
我将关注两个最大的亮点:Erdős单位距离猜想和雅可比猜想,这两个都是长期未解的著名猜想,最近被LLM找到了反例。(An OpenAI model has disproved a central conjecture in discrete geometry | OpenAI, A digestion of the Jacobian conjecture counterexample | What“s new)
OpenAI还发布了一个纳维-斯托克斯存在性与光滑性千禧年大奖问题的解法(On the Navier–Stokes Millennium Prize Problem | OpenAI, Has a Millennium Prize Problem been solved by AI? - YouTube, Navier–Stokes existence and smoothness - Wikipedia),但伴随着归属争议(drama summary for those confused, Tristan + Levent: 3d incompressible Euler with forcing, OpenAI: 3d incompressible Euler without forcing, OpenAI: Navier-Stokes with forcing, No one: Navier-Stokes without forcing, but that isn”t needed for the Millennium Prize),还有另外10个问题的10项结果(Ten advances in mathematics and theoretical computer science | OpenAI),以及100多个问题的100多项未发布结果(Internal model has now resolved more than 100 long-standing open problems across most areas of mathematics | OpenAI),但本文暂不深入讨论这些结果的细节。
之后,我将探讨各位数学家的看法,思考这对AI数学的现状意味着什么,并从宏观角度推测AI数学的未来。
我还描述了当前AI数学系统的类型、如何做AI生成的数学,以及AI数学面临的挑战。
我认为数学实践将在短期、中期和长期内发生巨大变革。变革即将到来,而且已经正在发生,伴随着其自身的积极面和消极面,但我个人非常乐观!
我强调下一个目标:人工格罗滕迪克智能(Artificial Grothendieck Intelligence):发明新颖且有价值的数学结构、语言、整个数学分支,来解决最难的数学问题。目前还没有任何AI系统在本文所描述的那种变革性创造力层面上做到这一点。还没有。
雅可比猜想
雅可比猜想是代数几何中一个著名的猜想,最近对所有n≥3的情况被反驳了,而二维情形仍然开放。
定义
它相对容易陈述。
它说的是:对于一个从n维复空间到自身的多项式映射F,更一般地,在特征为零的域上,雅可比猜想断言:非零常数雅可比行列式蕴含F具有多项式逆。
如果你对这个没什么印象,可以看看这个YouTube视频解释的结尾部分。我觉得它讲得很好,他从零开始解释,前置知识要求最少,还解释了一个具体例子。(Unsolved Math Problems in Calculus That Sound Easy - YouTube)
更多细节,见陶哲轩的博客文章(A digestion of the Jacobian conjecture counterexample | What“s new)或维基百科(Jacobian conjecture - Wikipedia)。
反例
UTC时间7月20日,一名Anthropic员工——同时也是哈佛大学的数学家——发推说Claude LLM找到了雅可比猜想的一个反例。它否证了n=3的情形,因此也就否证了所有n≥3的情形;n=2的情形仍然开放,n=1时成立。(levent on X: ”hello there the jacobian conjecture is false thanx to my close friend akhil for asking about it and my other close friend fable for working during the world cup final ((1+xy)^3 z + y^2 (1+xy) (4+3xy), y + 3 x (1+xy)^2 z + 3 x y^2 (4+3xy), 2 x - 3 x^2 y - x^3 z): \C^3\to \C^3, has jacobian determinant -2, and sends (0, 0, -1/4), (1, -3/2, 13/2), and (-1, 3/2, 13/2) to (-1/4, 0, 0)“ / X)
目前还不太清楚人类在环路中扮演了多大角色——他是提供了非常具体的提示或指导,还是提示仅仅是”解决这个“,就像最近其他几个反例结果那样。或者失败率是多少,等等。Anthropic对此并不透明。
这条推文获得了数百万次浏览,很多人感到惊讶。
验证
验证起来也相对容易。只需精确验证雅可比行列式是非零常数,以及两个不同的定义域点有相同的像。
作者在同一条推文中用WolframAlpha做计算,给出了他的反例的证明:他计算了雅可比矩阵的偏导数,计算了雅可比的行列式以确认它是非零常数,在两个不同的点上评估了映射,并表明它们有相同的像。这就足够了。(levent on X: ”https://t.co/MFBwtvSMKB jacobian determinant in wolfram alpha" / X),(levent on X: "https://t.co/8AwYLH0Xbf https://t.co/PYlkO3VhNt evaluating at two of those points in wolfram alpha“ / X)
我稍后会评论这意味着什么。让我们先也覆盖一下单位距离猜想,这样我就有更多背景可以评论了。
Erdős单位距离猜想
Erdős平面单位距离问题是离散组合几何中一个著名的核心问题。Erdős单位距离猜想是关于这个问题的一个著名猜想,最近被反驳了。
定义
Erdős平面单位距离问题也相对容易陈述。它问一个简单的问题:
如果你在平面上放置n个不同的点,有多少对点可以恰好相距1?
更多细节,你可以查看维基百科(Unit distance graph - Wikipedia)。
换句话说,它问的是由欧几里得平面中的n个点确定的最大可能单位距离对数;等价地,它问的是n个顶点上的单位距离图的最大可能边数。
Erdős平面单位距离猜想是Erdős提出的答案。
OpenAI在他们的文章中描述道:”自从Erdős的原始工作以来,主流观点一直认为下文中描绘的“方格”构造在最大化单位距离对数方面基本上是优化的。“(An OpenAI model has disproved a central conjecture in discrete geometry | OpenAI)
图片来自 An OpenAI model has disproved a central conjecture in discrete geometry | OpenAI
反例
一个OpenAI内部推理模型反驳了这个猜想,提供了一个无限族例子,产生了多项式级别的改进。这个反例反驳了猜想,使之成为错误的。(An OpenAI model has disproved a central conjecture in discrete geometry | OpenAI)
要更详细地理解这一点,你可以查看各位数学家在他们的评论论文中的消化和评论。([2605.20695] Remarks on the disproof of the unit distance conjecture)
之后,人类专家重新组织并编辑了结果,添加了参考文献,简化了部分证明,并创建了更强版本的证明。所以人类专家在这里发挥了作用。
重要的背景是,更一般的单位距离问题——对一般n的精确值或渐近增长——尚未解决。
LLM找到的反例比雅可比猜想反例复杂得多。
它用抽象数学的语言表达,使用了代数数论的工具,涉及数域、类群、无限非分歧或类域塔,以及Golod–Shafarevich理论。
OpenAI说他们使用的LLM系统”只是“对其通用脚手架中的一个自回归通用推理者LLM的一次零样本调用,没有针对这个特定问题的专门化脚手架和专门化训练。(Sebastien Bubeck on X: ”We now know that with an appropriate harness both Mythos and GPT-5.5 can reproduce what our internal model did in one-shot for the unit distance problem. Clearly there is an insane overhang of capabilities with this generation of models, and no ceiling in sight for what scientific advances they can bring. You can go and try to discover new things with 5.5 right now!" / X),(Noam Brown on X: "This is a general-purpose LLM. It wasn’t targeted at this problem or even at mathematics. Also, it’s not a scaffold. We have not pushed this model to the limit on open problems. Our focus is to get it out quickly so that everyone can use it for themselves. https://t.co/J8N8epiafV" / X)如果OpenAI在这方面可以信任的话。错误率仍然是非零的。
他们的文章还包含了当你运行模型解决这个问题时的成功率,它随着测试时计算的增加而增加。在某个测试时计算水平上,据说当你随机采样模型时,成功率增加到了50%。(An OpenAI model has disproved a central conjecture in discrete geometry | OpenAI)
思维链的摘要精简版对所有人公开可读。(Unit Distance Chain of Thought)。
验证
这个结果不像雅可比猜想那样可以通过计算简单检查。数学家必须用他们的大脑通读整个证明来验证它、审查它、消化它并缩短它。
当时,证明机制尚未在Lean中形式化,所以那时无法用Lean验证该证明。但过了一段时间,它被形式化到Lean中,有超过一百万行代码用于更适当的验证。(Alex Kontorovich on X: “Impressive! Boris Alexeev (@OpenAI) has a 1M line of code formal solution for the Erdos unit distance counterexample (with exponential rate) that passed eval! https://t.co/GepzIp4EZ1 h/t @Leonard41111588 https://t.co/cfEnG2QkfM" / X)但我稍后会谈到一些Lean的注意事项。
哪些类型的问题对AI来说更容易,为什么?
让我们先给出一些我将作为分析基础的背景。
一般来说,神经网络AI目前主要在以下领域取得成功:有足够好的数据,和/或有足够容易的验证信号用于强化学习,或者解的空间足够小。架构、学习算法等也很重要,但让我们现在主要关注其他方面。
数学提供了很多这些条件,但你并不总是有足够的这类好的数据和验证信号。数学与许多其他领域的不同之处在于,很多数学是可验证的,但有些部分比其他部分更难验证。我稍后会提到更多注意事项。
验证数学
目前,X信息流中有大量飞来的猜想反例没有经过适当验证,很可能是错误的。一些关键的反例被证明是错误的。(Przemek Chojecki | PC on X: ”UPDATE: There is an error in Theorem 7.1 identified by Tony Feng below. It seems to kill the argument for N^† not having a motivic lift (it looks like it does now), though it still might be non-algebraizable. Back to seeing what can be salvaged!“ / X)
所以,为提供更多背景,就数学结果的验证和有效性而言:
随机X用户的大脑本身往往有很高的错误率。完全信任LLM神经网络权重本身也不是真正最优的。专业数学家验证结果要好得多,但他们仍然会在一定程度上犯错误和忽略某些东西。
幸运的是,在数学中,我们有各种方法可以用机器自动或半自动地验证某个数学结果是否(或不是)为真,以相对客观和可重现的方式。即使有注意事项。
要证明某个全称命题不成立,有时只需将特定的反例代入猜想,并通过WolframAlpha或Python等机械地计算结果,然后你就会看到该全称命题是否成立,这在各种反例的情况下就足够了,比如上面的雅可比猜想。精确符号计算是完全可靠的(带有诸如实现中的bug之类的注意事项),而近似数值输出可能有小的浮点误差等,但仍然可以是严格的。(Jacobian conjecture is false /r/math)
或者,你可以借助Curry–Howard对应——它将证明与类型联系起来(Lambek扩展甚至将范畴论的范畴也联系起来了!)——在某个定理证明器编程语言中将给定的定理和证明形式化。(Curry–Howard correspondence - Wikipedia)
例如,在Lean中(Lean community),正如我上面提到的单位距离猜想,Lean通过其依赖类型理论的核心,验证给定的证明项是否栖居在代表该定理的类型中。
但你还必须同意给定猜想和证明的形式化是正确的形式化,你必须同意给定的定义、公理、基础框架等是好的和正确的。(Joel David Hamkins on X: ”No it doesn't, for several reasons. First, formalization is difficult, and current AI systems cannot do it reliably, even when they have a correct proof. But second, it just pushes off the work into the formalization---one still needs to check that the formalization expres…“ / X)但大多数数学家在大多数情境下大体同意这些。(Mathematics in mathlib)
所以在Lean中对猜想和证明本身的形式化进行验证也是困难的,是一个瓶颈,因为基于AI的自动形式化还不足够可靠(尚)。
或者你可以组合使用这些方法。
很多LLM生成的反例和证明,迟早会经过这个验证过程:在WolframAlpha或Python中代入,或者在Lean中形式化和验证证明。
确实,验证反例通常比验证全称证明更容易。但LLM也在证明一些猜想,而不只是否证它们!
而且,大多数前沿数学还没有在Lean中形式化。目前仍有大量关于自动形式化(autoformalization)的研究,即通过LLM和其他方法在Lean中自动形式化数学,以便更好地自动化数学。([2505.23486] Autoformalization in the Era of Large Language Models: A Survey)
验证验证者(verifying the verifier)通常是一个复杂的问题。验证常常是瓶颈。
有时即使你有像Lean这样强大的验证工具,Lean中仍然可能有bug,显示为已验证的证明实际上并不正确。最近Lean内核中的一个bug就发生了这种情况,产生了一个AI辅助的、错误的Collatz猜想”反证"。(Postmortem for Kernel Soundness Bug #14576 — Leonardo de Moura, Machine Learning Street Talk on X: "An apparently AI-generated formal proof, in Lean, purporting to be a disproof to the Collatz conjecture, was actually exploiting a bug in the Lean kernel! EXCLUSIVE from Lean Creator Leo de Moura: > "This is going to keep happening. AIs are really good at explo…" / X, Gro-Tsen on X: "So, someone came up with an AI-generated formal proof, in Lean, of a solution to the Collatz problem, and it turned out that the “proof” was merely exploiting a bug in the Lean kernel (allowing you to prove anything).“ / X)
AI解决的开放数学问题目录
Robert Joseph正在维护一个网站,上面有一个不错的AI解决的开放数学问题列表。(Open Math Problems Claimed to Be Solved with AI, Robert Joseph on X: ”The use of AI to solve open math problems is moving almost too fast to follow, while the proofs, code, evidence, and discussions remain scattered across the internet. So, in under an hour using @ChatGPT Sites, I built a searchable index of 200+ AI-assisted results in math. You can filter by mathematical field or model and explore the sources, proofs, discussions, and verification status behind each claim:) I’ll keep updating it as new results appear (everyday)! let me know if you all have questions or features that would like to be added.“ / X)还有VibeMathed。(VibeMathed - Math Problems Solved by AI)DeepMind有一个很好的已证明/否证和开放的形式化猜想列表,包括LLM证明的那些。(DeepMind Formal Conjectures)
AI数学系统的类型,如何做AI生成的数学
老式AI或计算机在你可以暴力搜索所有可能值,或机械化地暴力搜索所有可能逻辑规则的领域取得成功,但有很多方法可以剪枝可能值的空间,除了暴力搜索之外还有其他方法。(Brute-force search - Wikipedia)还有SAT求解器,旨在解决布尔可满足性问题,输出公式是否可满足,并可以使用各种启发式方法来实现这一点。(SAT solver - Wikipedia)
LLM系统可以使用上述所有工具,或者纯粹在其思维链中用自然语言做数学推理,或者用Lean。
当你在推理时使用LLM系统,你可以不断采样新的解决方案,看看它们是否被Python或WolframAlpha或Lean验证为真,并丢弃那些不行的。
你可以直接在ChatGPT或Codex中提示OpenAI模型的默认脚手架。或者你可以使用像AlphaEvolve这样的东西,在那里你演化一个解决方案库,使用LLM或其他系统迭代地变异和完善它们。([2506.13131] AlphaEvolve: A coding agent for scientific and algorithmic discovery)或者你可以使用更专门的神经符号系统,比如AlphaGeometry(AlphaGeometry: An Olympiad-level AI system for geometry — Google DeepMind),或Aristotle,它整合了三个主要组件:一个Lean证明搜索系统,一个生成和形式化引理的非形式推理系统,以及一个专门的几何求解器。([2510.01346v1] Aristotle: IMO-level Automated Theorem Proving)
你可以使用像ChatGPT这样的通用脚手架,或像Aristotle这样更专门的数学脚手架。这是一个光谱。
数学AI架构的多样性令人着迷!
你可以不做任何人类引导,不费什么智力劳动,只告诉ChatGPT”找个猜想并解决它“,完全自主,但你仍然要处理我之前提到的所有验证困难。或者你可以给它非常详细的指示,告诉它解决什么猜想、看什么方法,并微观管理模型做的每一个推理步骤。这是一个光谱,从完全的vibe研究到其反面——在极限情况下,你完全自己写证明,没有任何机器辅助。
我主要讨论的两个猜想,根据公开信息,分别被一个OpenAI模型和Claude否证了。
AI数学如何训练
在训练时,一些LLM也经常通过基于可验证奖励的强化学习,在上述来自计算器和Lean的验证信号上进行爬山。([2504.21801] DeepSeek-Prover-V2: Advancing Formal Mathematical Reasoning via Reinforcement Learning for Subgoal Decomposition, AI achieves silver-medal standard solving International Mathematical Olympiad problems — Google DeepMind)
我怀疑AI最近在数学上的成功,很大部分是因为在各种一般数学问题上进行了大量强化学习,Lean证明正确性和数值验证贡献了奖励,然后泛化到其他猜想。
但大量来自数学家的好训练数据也肯定起了作用,比如:预训练中的好数学资源,如数学教科书([2402.06196v3] Large Language Models: A Survey),数学家们在RLHF中选择更好的答案(Reinforcement learning from human feedback - Wikipedia),数学家们为RLVR和RLAIF创建更好的评分标准(Rubric-Based Rewards for RL - Deep (Learning) Focus),([2507.04136] A Technical Survey of Reinforcement Learning Techniques for Large Language Models),或者用数学家写的推理轨迹来微调智能体。(Agent Harness for Large Language Model Agents: A Survey)
有些AI以更专门的方式训练成数学AI。有些是更通用的AI,比如ChatGPT。在AI世界中,专门系统和通用系统之间从AI领域一开始就存在永无止境的竞赛。
AI数学的挑战
LLM有一定的成功率,可能会出错。人脑可能会出错。证明的形式化可能会出错。所有这些都必须记住。
随着问题难度的增长,失败率通常也会增长,你会得到大量过度自信的错误解决方案,一切都需要验证。
如果你的问题有自动验证,那可以让你做大规模采样和自动验证,而无需手动验证。但正如我之前所说,大多数数学并不以容易检查的数值解形式出现,大多数数学也没有在Lean中形式化,所以这必须被考虑进去。或者LLM作为评判者有时更有效,有时不那么有效,因为它可能很草率。
所以即使有人只是提示ChatGPT,提示者必须知道:什么是猜想,什么是反例,LLM可能是错的,结果必须被验证,根据不同的猜想什么是有效的验证形式,以免被LLM愚弄,等等。
提示者必须确保解决方案通过计算、或通过Lean、或通过专家的头脑等方式得到验证,取决于问题。或者有时需要的是该子领域专家对结果的验证和后处理,如果提示者本人不是专家的话。除非提示者运气特别好。
有时提示者还应该知道这个猜想存在,并且由于其性质更容易被LLM攻击,如果LLM搜索本身不能正确找到它的话。
目前,大多数合法的LLM生成的猜想反例是由数学家或至少对数学和LLM如何工作有些了解的人提示/发现的,太多人反而淹没在垃圾(错误的、未验证的解决方案)中,不知道该怎么办。
结果,外面有大量垃圾(错误的、未验证的解决方案),所有合法的结果混杂其中。
它确实能够并确实合法地解决了开放数学问题,而且这些已解决问题的数量每周都在攀升。LLM现在解决的许多具体问题,以前人类也在挣扎。
这也产生了一个问题:如果LLM或类LLM的AI系统在某些难以(自动)验证的问题类别上的成功率即使只有1%,而且如果这些问题比如多年来未解决或/和以某种方式有用的话,那么使用这些系统仍然可能值得——但你需要人类用他们的大脑验证大量这样的结果,在过度自信的垃圾(错误结果)海洋中挖掘金块(正确结果)。
所以最终你会遇到一个瓶颈,即你有多少人类注意力资源,而你可能没有足够的资源。这可能导致交通堵塞:生成的AI证明太多,而验证它们的人类数学家不够。陶哲轩在这个X片段中表达了这种担忧。(SAIR on X: ”Terence Tao: AI is creating a “traffic jam” in math If AI generates more proofs than humans can verify, science needs new infrastructure. SAIR competitions build that infrastructure by surfacing high-quality results, so the best work is not lost in a flood of AI-generated math. https://t.co/3lO0LiGQib" / X)所以结果往往更需要专家。
与此同时,成功率似乎有时会随着测试时计算的增加而增长。数学家们还传闻说,随着每个新模型的推出,成功率在攀升,他们不需要那么多地采样模型,也不那么淹没在垃圾中。(Daniel Litt on X: "@marcusgnt I don’t think this is typical, just common enough. That said I do think it BS’s a bit less than previous models (maybe 5.2 Pro excepted) and it’s somehow easier to tell when it’s BSing.“ / X)所以在某些方面,情况在变好。
人类也可以在可能的情况下在一定程度上更引导这些系统。这类似于必须时刻验证和照看编码和研究智能体,引导它们确保它们不偏离。即使有时它们完全不偏离并一次性达到正确解。这在数学证明中也是类似的偏离。更多的引导通常——但并不总是——意味着更少的失败。但有时模型独自工作可能会发现人类引导可能使其盲目的东西。
另一个挑战是广泛开放科学共同体的验证和复现。大实验室宣布的许多数学结果,对其背后的过程几乎没有透明度。理想情况下,你希望知道:他们尝试了多少提示,他们大规模采样了多少,错误率,他们尝试了什么提示,原始思维链,原始输出,关于脚手架的细节,是否在预训练、SFT、RL环境中做了一般或专门的训练,等等。所有这些都允许更好的全球验证和复现,更好的开放科学!它还允许你以开放的方式科学研究模型是如何做到的!此外,如果你能访问权重、架构、数据、RL环境等,你可以使用机械可解释性或深度学习理论等进行逆向工程!关于这些模型如何找到这些新颖的数学结果,目前几乎没有科学。我在等待所有这些开放科学!
数学家对这两个结果怎么看?
Erdős单位距离猜想的反驳
有趣的是,数学家们大多假设这个猜想是真的,但LLM试图反驳这个猜想而不是证明它,这与最常见的直觉相反。尽管之前有一些联系,但他们也没有那么多地从将原始构造推广到代数数论中其他数域的角度来看如何解决这个问题,所以模型教给他们的是,离散组合几何和代数数论之间的联系比他们之前认为的要强,但最新颖的似乎是让域的次数趋于无穷。
我对单位距离猜想最喜欢的评论来自数学家Thomas Bloom在《关于单位距离猜想反驳的评论》中的话([2605.20695] Remarks on the disproof of the unit distance conjecture):
”仔细审视这个构造,就更清楚人们以前是如何错过它的——它需要几个不同的小概率事件汇合:一个好的数学家
(1) 首先花了大量时间思考单位距离猜想;
(2) 认真尝试反驳它,尽管Erdős的信念被反复提及,认为它是真的;
(3) 相信将原始构造推广到其他数域是有价值的,因此愿意花大量时间探索这样的构造;以及
(4) 足够熟悉类域论的相关部分,认识到关于具有适当参数的无限数域塔的恰当表述问题可以用现有理论解决。
AI满足了所有这些标准,它在这些方面的成功呼应了之前的成就:它经常通过沿着人类可能认为不值得花时间探索的路径坚持下去,产生最令人惊讶的结果,将超人的耐心与对大量技术机制的熟悉结合起来。
在评估AI生成的证明的重要性和影响时,我问自己的一个问题是:这是否教给了我们关于这个问题的新东西?我们现在对离散几何是否理解得更好?我认为答案是温和的肯定:这表明数论构造在这些类型的问题上能说的东西比我们想象的要多得多;而且,所需的数论可以非常深。毫无疑问,许多代数数论学家将在未来几个月密切关注离散几何中的其他开放问题。
另一方面,也许该领域的一些人会对此告诉我们多少东西感到有些失望:它没有引入任何强大的新几何工具,或者迄今未被怀疑的结构性结果,而这些是证明单位距离猜想可能需要的东西。不过,虽然这可能不是我们所希望的那个猜想的证明,但毫无疑问,这个构造及其涉及的思想将对离散几何产生重大影响。“
如果一个人数学家满足这些标准,他也许也能做到。
来自William Timothy Gowers的话:
”无论如何,毫无疑问,单位距离问题的解决是AI数学的一个里程碑:如果一个人写了这篇论文并提交给《数学年刊》,而我被要求给出快速意见,我会毫不犹豫地推荐接受。以前没有任何AI生成的证明接近这一点。
此外,即使AI还不能找到需要长提示序列的证明这一点是正确的,这样的证明对人类来说也很难找到,所以在AI数学的进展突然停滞的不太可能的情况下,我们仍然可能已经进入了一个时代:人类在解决数学问题方面很难与AI竞争。
“
评论论文中的另一段引文是:
”AI论证的一个新颖成分是取[K : Q] → ∞“
以及:
”那个代数实现的次数和高度可能是巨大的……也许那个巨大的次数不仅仅是一个麻烦,而且是可能反例的一个来源。数域值得更仔细地审视。“ 尝试使用数域来构造反例的想法并不完全是新的,但让它奏效有微妙之处(在这篇注记的一些反思中讨论了),特别是考虑到也许大多数专家相信猜想n^{1+o(1)}是真的。
以及来自Arul Shankar的话:
”尽管如此,我认为这是一个非常“人类”的证明,尽管是一个极其巧妙的证明。
模型的思维链非常有趣。值得注意的是,绝大多数思想都在尝试构造一个反例来反驳被广泛相信的上界,而不是试图证明它。这说明模型具有某种组合:良好的直觉、尝试被共同体视为长射程方法的意愿,以及尝试构造的倾向。
思维链显示模型尝试了大量来自广泛数学领域的想法来进行所需的构造。模型相当快地遍历了各种想法,但当它到达关键想法时(在以“乐观地假设……”开头的段落中),它相当有条不紊地专注于证明。
在我看来,这篇论文表明当前的AI模型超越了仅仅作为人类数学家的助手——它们能够拥有原创的巧妙想法,然后将它们实现。
“
来自Jacob Tsimerman的话:
”这是一项非常令人印象深刻的工作,我会毫不犹豫地为任何期刊接受它。
我实际上简短地研究过这个问题,并试图构造反例,但未能取得进展。“
以及Noga Alon的话:
”这是Erdős最喜欢的问题之一,我亲自听他在讲座中多次提到这个问题。我相信可以公平地说,每个从事组合几何工作的数学家都思考过这个问题,很多在其他领域工作的数学家也至少花了一些时间思考它……OpenAI内部模型对这个问题的解决,在我看来,是一项杰出的成就,解决了一个长期存在的开放问题。正确的答案不是n^{1+o(1)}这一事实令人惊讶,而且这个构造及其分析以优雅而巧妙的方式应用了代数数论中相当复杂的工具。“
雅可比猜想反例
陶哲轩,当今世界领先的数学家之一,在这一点上就像AI数学的领导者,在他的博客文章《雅可比猜想反例的消化》中评论道(A digestion of the Jacobian conjecture counterexample | What”s new):
“虽然这是一个极其快速的验证,但以这种方式呈现的构造看起来像一个巨大的奇迹。这个例子后来被追溯性地用更几何的术语解释了。作为给自己的一项”消化“练习,我试图以较少使用代数几何的方式写这个解释,以尽量减少所需的”奇迹“数量,但仍有一些地方发生了值得注意的现象。”
我的看法
这只是笨拙的暴力搜索吗?
你从他们引言的语气中可以看出,这不是暴力搜索,按照暴力搜索最广泛使用的定义。(Brute-force search - Wikipedia)如果你做笨拙的暴力搜索,那么可能解的空间如此之大,以至于你会因为存在太多可能的解而遭遇组合爆炸。
对于雅可比猜想,陶哲轩写道“找到这样一个多项式看起来极不可能通过暴力搜索找到”。(A digestion of the Jacobian conjecture counterexample | What“s new)
而单位距离猜想的可能证明空间是……巨大的……因为这个结果是一个证明,使用的抽象数学来自与原始问题领域不同的领域,而抽象数学中有很多类似的领域,而且很难验证,所以数学家们必须用他们的头脑来验证它,而不是某种自动验证。
要更直接更容易地在这个问题上爬山,你需要能够更容易地验证解决方案,而这里的情况并非如此。
而且这些问题已经为人所知并开放了相当长的时间。
过去对这两个猜想也尝试过暴力搜索方法和其他启发式方法、算法、理论工作等。([2406.15317] Diverse beam search to find densest-known planar unit distance graphs),([2412.11914] The Erdős unit distance problem for small point sets),([1708.07936] Some algorithms related to the Jacobian Conjecture),(The jacobian conjecture: reduction of degree and formal expansion of the inverse)
与此同时,在X上当前的反例爆炸中,其他一些猜想——其中一些几乎没人以前听说过——可能是LLM用老式暴力搜索(用Python或WolframAlpha或老式AI或其他暴力搜索软件)解决的,因为也许以前还没人在那些相对不知名的问题上尝试过。
陶哲轩在一条推文中非常漂亮地描述了LLM(Terence Tao: ”I've been working (together with Javier Gomez-Ser…" - Mathstodon):
“非常粗略地说,这是一个可以尝试对函数F(x)进行极值化的工具,其中x在某个高维参数空间Omega中取值,当参数空间非常高维且函数F(及其极值化器)具有不明显结构特征时,它可以超越更传统的优化算法。”
这是智能/创造性的吗?
我认为单位距离猜想的反驳是目前LLM做抽象数学推理的最伟大壮举。
诚然,大多数AI数学发现恰恰是在验证器上爬山的领域(可数值验证的解决方案,可以在Lean中形式化并检查准确性的证明),有时有一个演化中的解决方案数据库,有时如果有一些可以被改进的先前解决方案(如AlphaEvolve中那样)就从SoTA解决方案开始,有时他们在验证器的奖励信号之上做强化学习,如DeepSeek Prover中那样,等等。
但单位距离反驳在许多方面与大多数其他LLM数学发现不同。你不像许多其他问题那样有数值验证,你也没有Lean中的形式化证明验证,因为证明是自然语言的,就像许多其他问题一样,因为证明中使用的代数数论机制当时还没有在Lean中形式化。数学家们事后用他们的头脑验证了它。LLM系统没有使用专门的脚手架,也没有针对这个问题的专门训练,这使它更加重要和令人印象深刻。
LLM非平凡地使用了代数数论——一个不同的数学领域——的机制,而专家们没有看到如此强的联系,来解决这个问题。它走向了专家们不太下注的方向,反驳而不是证明。
这个问题是组合离散几何的核心问题。一个数学家会因这个成就而受到赞誉。
这是同类中的第一个。
很多其他最近的AI生成数学结果都在这个领域:综合数学文献中各子领域的见解。
阅读和聆听所有数学家对此的评论令人着迷。
Thomas Bloom关于反驳的评论引起了我的强烈共鸣。这个结果似乎部分地开辟了新天地,用我转述他的话来说,它展示了离散组合几何和代数数论之间的非平凡联系。我认为LLM在某种程度上是创造性和智能的。它连接了两个领域,以让我们从中学习到一些东西的方式。
很多数学都是在这个水平上的。所以这是研究级数学。
这似乎也反驳了LLM常见的“仅仅复现之前见过的答案”和“来自训练数据的最统计可能行为”叙述的最强形式,因为模型似乎走向了大多数专家似乎没有预料到的方向,并找到了这种级别的novel结果。
也许这里大量的强化学习确实在很大程度上将输出分布塑造成了不同的形状,而不只是浮出基础模型中已有的东西。([2504.13837] Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?, [2505.24864] ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models, [2510.03865v1] Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration)
也许模型的内部表征甚至在一定程度上被改变了,重塑了它的一些特征流形和电路。(Goodfire on X: "If models think in shapes, our tools should too. Our latest research: Block-Sparse Featurizers (BSFs), a new way to find concepts in model activations - using multidimensional “blocks” instead of single directions. (1/9)“ / X, On the Biology of a Large Language Model)
也许强化学习激励了先前学习策略的新颖非平凡组合,这可以被视为一种新颖推理模式的形式。
它可能来自强化学习,奖励来自符号验证器、或来自作为评判者的LLM、或来自人类,奖励可以是简单的正确性,也可以是评估证明不同方面的复杂评分标准,例如使用某些证明技巧。(Rubric-Based Rewards for RL - Deep (Learning) Focus)
如果RL首先是导致这个结果中这种行为出现的核心原因之一。我很好奇,如果只有基础模型而没有RLVR/RLHF后训练,这个结果是否可能实现。
更精确地定义创造力和智能是另一篇文章的事,所以我们现在暂且停留在一个围绕以下能力的定义上:在广泛环境中解决问题的能力([0712.3329] Universal Intelligence: A Definition of Machine Intelligence),对新情况的适应性([1911.01547] On the Measure of Intelligence, Intelligence: From Definition to Design),生成新颖有价值的输出,尊重某个领域的约束(Why Creativity Cannot Be Interpolated | MLST Archive)。
而你可以解决更难的问题,更有效地适应,生成更新颖的输出,更分布外,等等。
AI数学在这个层面的未来
我认为这值得一定程度的炒作,因为能够以更自动化的方式证明许多这种难度级别的定理,具有切实的意义。特别是随着成本下降。我们会看到越来越多这种类型的大规模AI数学。
数学中的猜想在某种意义上,是现代AI新的AlphaGo围棋棋盘。
据我观察,很多个月前,模型平均每月解决大约一个开放问题。几个月前,模型平均每周解决大约一个开放问题,而且主要是简单可验证的问题,因为它是数值解或在Lean中形式化的。现在我们几乎每天都有这种新结果的爆炸。或者最近DeepMind发布了一篇论文,一篇论文里有53个新结果。([2605.22763] Advancing Mathematics Research with AI-Driven Formal Proof Search)
到了这个地步,很难跟上所有新结果。(Open Math Problems Claimed to Be Solved with AI, AI Uncovers Counterexample to 87-Year-Old Jacobian Conjecture / X)
如果你外推这个趋势,那么数学很可能会被彻底改变。越来越多容易的问题将被解决。越来越难的问题将被解决。它已经在某种程度上被改变了。但进展也可能反而平台期,虽然我认为那不太可能。
对于单位距离猜想,增加测试时计算似乎也相对可靠地增加成功率,这一事实也很有趣。也许对于一些困难的定理,你会通过几天、几周、几个月、几年的测试时计算获得足够好的成功率……(Noam Brown on X: Implications of Large-Scale Test-Time Compute / X)
陶哲轩在这个伪数学的拟猜想族中很好地表达了这一点:(ICM 2026 Public Lectures - Terence Tao - YouTube)
下一个目标:发明新颖且有价值的数学结构、语言、整个数学分支来解决最难的数学问题
这绝对不是那种”数学家现在完了“的炒作。让我解释一下。
还有比我刚才描述的更有创造性和智能的数学。我相信还有更大的数学创造力和智能我们还没有看到。
我仍在等待一个AI系统通过创造新颖、有价值的数学结构或全新的数学分支和语言来解决一个问题,从而解决最难的数学问题。那还没有发生。François Fleuret on X: ”Exactly where we are: AI is able to use existing tools and methods very efficiently, but in some way it is not yet able to invent new tools and methods. Maybe there are already sparks of this, but they definitely cannot match humans on this, yet." / X
“好的数学家证明定理,伟大的数学家提出猜想,最伟大的数学家提出定义。”
3Blue1Brown(Grant Sanderson (@3blue1brown) – AI disproved a famous math conjecture. Now what? - YouTube)
变革性创造力
这一切的核心是变革性创造力(transformational creativity)。(Creativity in a nutshell | Think | Cambridge Core, Why Creativity Cannot Be Interpolated | MLST Archive)
如果你能做组合性创造力(combinational creativity),你就能以不熟悉的方式将你已知的现有概念组合成新的东西,组合成以前不存在的组合。组合已知的数学结构或定理来证明一个猜想。
如果你能做探索性创造力(exploratory creativity),你就更能在结构化概念空间内探索可能性,改变你已知的现有概念,并组合它们。稍微改变一些数学结构和定理,用它们来证明一个猜想。
如果你能做变革性创造力(transformational creativity),你就能改变一个概念空间的组织约束,改变或发明全新的概念、规则、语言和领域。发明新的数学结构、语言、整个数学分支。这就是我现在将尝试用一些例子描述的。
Alexander Grothendieck是我最喜欢的在解决问题时实践了变革性创造力的例子。他被许多人认为是二十世纪最伟大的数学家。他是现代代数几何创建中的领军人物。“他的研究扩展了该领域的范围,并在其基础上添加了交换代数、同调代数、层论和范畴论的元素,而他所谓的”相对“视角导致了纯数学许多领域的革命性进展。”(Alexander Grothendieck - Wikipedia)
Alexander Grothendieck用下面描述的方法解决数学问题。我想以某种方式把这个过程放到一个算法中:
“Alexander Grothendieck是一位特殊的数学家。他极其有创造力、有魅力且古怪,不仅革命性地改变了数学的很大部分(现代代数几何、交换代数、同调代数、层论、范畴论),而且在他生命的后期选择将自己与世界隔绝,独自隐居。今天我们了解到Grothendieck画过一幅关于解决数学问题方法的图。那就是锤与凿原则对比涨潮法(rising sea approach)。
锤与凿原则是把凿子的刃放在壳上,然后用力敲击。如果需要,在多个不同的点重新开始,直到壳裂开——你就满意了。Grothendieck诗意地将此比作一个要打开的坚果。数学家使用锤与凿来达到”被壳保护的营养果肉“。它也可以被称为大锤法。你只是用你所有的一切去撞击问题,研磨它直到问题解决。
涨潮法先将问题淹没在一个理论中,远远超出最初要建立的结果。Grothendieck想象将坚果浸入某种软化液体中,直到壳变得柔韧。经过数周和数月,仅仅通过手压,壳就像完美成熟的牛油果一样打开了。”
(Linear algebra and vector analysis: Rising Sea)
"“涨潮”(rising sea)是Alexander Grothendieck的一个隐喻(见下面的引文),意思是阐明一般抽象理论的发展如何最终带来对具体特殊问题的轻松解决,就像硬坚果可能不是立即通过纯粹的点状力量裂开,而是最终通过将其轻柔地浸入整个水体中而裂开。“
来自Grothendieck本人的话:
”我可以用同一个要打开的坚果的形象来说明第二种方法。
我想到的第一个类比是将坚果浸入某种软化液体中,为什么不干脆用水呢?不时地揉搓,让液体更好地渗透,否则就让它随时间流逝。壳通过数周和数月变得更加柔韧——当时机成熟时,手压就足够了,壳像完美成熟的牛油果一样打开!
几周前另一个不同的形象出现在我脑海中。
未知的事物在我面前显现为一片土地或坚硬的泥灰岩,抵抗着穿透……海水无声地、不知不觉地前进,似乎什么都没有发生,没有东西在移动,水太远了,你几乎听不到它……但它最终包围了那抵抗的物质。“
(The Rising Sea in nLab)
人工格罗滕迪克智能(AGrI)
我最喜欢的目标——最让我印象深刻的目标——将是人工格罗滕迪克智能(AGrI)(Aran Nayebi on X: ”FWIW, I think this moves up my AI timelines a bit. I think the next milestone will be "Artificial Grothendieck Intelligence" (AGrI): defining new general mathematical structures to solve the hardest of open problems as special cases, like the Riemann Hypothesis or P vs. NP.“ / X),定义为:
定义新的一般数学结构,将最难的开放问题作为特殊情形解决,如黎曼假设或P vs. NP(Millennium Prize Problems - Wikipedia),或/和发明正确的环境语言,使原始问题成为更一般结构的特殊情形,Alexander Grothendieck风格。
创造/发明/发现新的数学语言、新的数学领域、新的数学山脉、新的数学大教堂。现代代数几何风格。(Algebraic geometry - Wikipedia)
此外,也在其中定义有趣的开放问题,黎曼假设风格。(Riemann hypothesis - Wikipedia)
此外,也构建数学结构之间和数学宇宙之间的桥梁,范畴论风格。(Category theory - Wikipedia)
一些满足这个目标的例子有:
Grothendieck(等人)对Weil猜想的解决,在这个过程中在很大程度上催生了现代代数几何,使用了诸如étale上同调这样的抽象机制。(Weil conjectures - Wikipedia)
费马大定理的证明,它被写成相对”简单“的数论问题,由Andrew Wiles和Richard Taylor通过证明代数几何中半稳定椭圆曲线的模性定理来解决,这足以推出费马大定理,在解决定理的过程中创造了大量的抽象数学机制。(Fermat”s Last Theorem - Wikipedia)
宇宙际Teichmüller理论。该理论最引人注目的声称应用是为数论中各种杰出猜想提供证明,特别是abc猜想,其中abc猜想是一个相对简单的数论问题。该理论是Teichmüller理论对配有椭圆曲线的数域的算术版本。Mochizuki(作者)和其他几位数学家声称该理论确实产生了这样的证明,但迄今为止尚未被数学共同体接受,而且这个证明的验证已经持续争议了14年。(Inter-universal Teichmüller theory - Wikipedia)
Gaitsgory、Raskin等人级别的新理论,2024年关于几何Langlands的近期工作。(Acer on X: "@publishiperishi @curiousiter @thomasfbloom @OpenAI If we can get LLMs coming up with new theory on the level of Gaitsgory and Raskin’s recent 2024 work on Geometric Langlands, then that would be a major step up. I think we are still two years off from this.“ / X),(Monumental Proof Settles Geometric Langlands Conjecture | Quanta Magazine)
Grothendieck级别的新颖性是重新组织其他人所能看到和所做之事的新颖性。
AI肯定还没有达到Grothendieck式发明非常新颖的数学结构或整个数学领域/语言来解决问题的水平。或者达到提出黎曼假设式开放问题的水平。或者达到发明群论、或像Newton/Leibnitz那样发明微积分的水平。等等。
Grothendieck级别的数学是相当罕见的。而且需要很多年。但它是可能的。
也许在通用脚手架中缩放通用推理LLM并配合强化学习,就足以实现这种级别的首次发现。也许我们需要一个Grothendieck式的强化学习环境或算法。或者我们需要全新的架构和学习算法。也许我们将需要更根本的神经符号程序合成系统,如DreamCoder。([2006.08381] DreamCoder: Growing generalizable, interpretable knowledge with wake-sleep Bayesian program learning)也许我们需要添加一些类似开放式发散演化新颖性搜索的东西,永不停止地积累信息。([ALIFE 2018] What Evolution Teaches Us about Creativity | Ken Stanley - YouTube)也许需要对AI所基于的概念有”更深刻的理解“,才能真正更深入地扩展它们,无论这在哲学和科学上究竟意味着什么。这里有很多不确定的未知。
验证外星证明
一旦AI系统开始产生宇宙际Teichmüller理论级别的证明,那将会很有趣——这种证明的验证尝试已经进行了14年,仍未完全解决,部分原因是该证明是用如此不寻常、特殊、独特、新颖、外星、原创的数学语言写成的,其他数学家难以理解,部分原因是其他数学家不同意某些子主张的有效性,并认为存在实质性的数学鸿沟。因此,大多数数学共同体目前仍认为abc猜想未被证明。但最近有一些进展。(Reddit: Latest IUT formalization news)
验证某个其他这种级别的潜在证明——无论由人类还是机器生成——如果由AI系统生成,即使你把所有AI智能体都投入到验证过程中,也可能需要15年或更长时间!
潜在正确的证明——可能由人类或机器生成——可能只能用一种不寻常、新颖、特殊、外星、独特、原创的语言来表达,这种语言很难被人类和机器理解和解析验证。我们的直觉可能会在其中挣扎很多。而且在某些情境下可能没有其他办法。但在不同的数学语言之间可能存在隐藏的翻译,例如可能使用范畴论。
与此同时,努力使难以理解/解析的证明更容易解析,对人和机器都是,当然也是一个有用的目标,原因很多。
但在某些情境下,这可能并不总是可能的——对于一些复杂数学问题,甚至一些简单问题,最简单、最易理解的证明可能已经处于这种足够外星、难以解析的水平,而且可能没有进一步简化的可能,没有任何缩减,而不丢失你在数学中需要的严谨性、精确性、形式性等。它可能就只是太复杂了。
我最喜欢的抽象数学分支之一是Topos理论,它研究不同的”数学宇宙“,即topos(topoi),每个都有自己的规律,规定其中的数学对象如何行为。这样的一个宇宙例子是集合,但还有更多。(Toposes - ”Nice Places to Do Math“ - YouTube, Category Theory For Beginners: Topos Theory And Subobjects - YouTube)
换句话说,Topos理论是范畴论的一个分支,它推广了包含和逻辑的概念,这些传统上基于集合论。
我有时会想,如果我们想让AI发现一些非常分布外、新颖、高度抽象的数学,也许一种方式可以是在topos的空间中进行开放式搜索?但那将极其困难。
也许那将会存在,我们将以这种方式发现新颖的数学宇宙?谁知道呢!
这个基准的动机
我不太信任目前大多数基准,因为它们通常可以通过对它们过拟合而轻易被benchmaxx。对新模型的集体vibe检查从科学角度来看也不是好的数据来源。
所以我认为在形式科学和经验科学中解决的实际开放问题是相对最好的真实基准。并且看它们的数量、难度、重要性、新颖性和价值。从最简单的Erdős问题,到解决黎曼假设这样的东西,到以某种方式解决量子引力(Quantum gravity - Wikipedia),或者只是像物理学中的简单猜想,或计算使某些现有物理理论更准确的高阶修正。(Rohan Paul on X: ”Demis Hassabis’s “Einstein test” for defining AGI: Train a model on all human knowledge but cut it off at 1911, then see if it can independently discover general relativity (as Einstein did by 1915); if yes, it’s AGI.“ / X)
未来AI的能力将通过每小时定义和解决的千禧年问题等价物的数量和重要性来量化和衡量。
你也可以把提出新颖、有趣和有价值的开放问题加入其中。还有定义。
以及实际中正常运作的工程系统。
而且结果必须被适当验证。
LLM在这个基准上随着所有数学结果得分越来越高。但它可以更好!
这个基准也相当广泛,所以你不能真正广泛地饱和它。
数学和科学——形式科学和自然科学——以及工程在实践中没有真正的尽头。
自然科学在很大程度上也与形式科学不同,因为你必须对你的理论进行经验检验,所以与许多形式科学相比,这给出了一个更硬的验证信号。并且需要科学方法中更多的自动化部分,比如控制实验室的机器人。
在经验科学中,我相信科学方法各部分的自动化近似将更需要这种风格的循环:定义领域 -> 在该领域中定义问题 -> 收集与之相关的现有信息、数据、模型 -> 基于此提出一个假设,该假设在其领域内具有你所能用有限信息和计算做出的最大预测力和解释力 -> 通过测试假设的实验收集经验数据 -> 分析、解释数据,得出结论 -> 据此完善假设或在证伪下放弃它 -> 用更多实验测试 -> 用理论完善 -> 测试 -> 完善 -> 测试 -> 完善……循环。(Scientific method - Wikipedia, Scientific Method (Stanford Encyclopedia of Philosophy), Explanatory power - Wikipedia)你可以尝试自动化那里的很多部分。这是从一个角度对科学各部分的可能近似之一。
这个谜题中很大一部分可能也是在那些没有明确目标、没有明确目的、没有明确指标、没有明确验证信号的领域中的发现,这些领域更难用强化学习爬山。我喜欢Stanley等人提出的用演化方法、发散搜索、新颖性搜索等来攻击这个问题空间的方法。([ALIFE 2018] What Evolution Teaches Us about Creativity | Ken Stanley - YouTube)也许有时你可能需要在费耶阿本德《反对方法》的意义上更加认识论无政府主义。(Against Method - Wikipedia, How Galileo Broke the Scientific Method - YouTube)也许你可以添加不同的智能体来探索和比较不同的竞争假设,或由竞争智能体群体来比较竞争范式。等等。看起来在这个经验混乱的空间里有很多可能性。
但那是另一篇文章了。
一切都是数学
要仅用数学来总结当前的整体情况:
我们在使用数学(AI架构和学习算法和数据)来发现新的数学(猜想的解)。
然后用其他数学(AI科学([2604.21691] There Will Be a Scientific Theory of Deep Learning),可解释性工具)来找出什么数学(激活空间中的特征几何和电路)(Goodfire on X: ”If models think in shapes, our tools should too. Our latest research: Block-Sparse Featurizers (BSFs), a new way to find concepts in model activations - using multidimensional “blocks” instead of single directions. (1/9)“ / X, On the Biology of a Large Language Model, [2301.05217] Progress measures for grokking via mechanistic interpretability)使用了那种数学(AI架构和学习算法和数据)来发现新的数学(猜想的解)。
其中(部分)过程可以由更多的数学自动完成(自动化AI研发的部分,自动化AI科学和可解释性的部分)。(Current state and future of recursive AI self-improvement research. In how strong form is it real - Burny)
如果我们用它来发现元数学中的结果,那么它就是在寻找关于数学的数学结果(如哥德尔定理)。(Gödel”s incompleteness theorems - Wikipedia)
而这一层层数学的每一层都使用一些共享的和一些不同的数学子集。
对AI数学未来的思考
数学在很大程度上是收敛的吗?任何“足够先进的智能”是否会重新发现大致相同的结构(素数、实数、群、矩阵、导数、计算、集合、范畴论、topos理论)?我们目前所拥有的是否是一条由拥有双手、生活在三维空间中、计算离散对象、需要生存等所塑造的受限路径?外星人,或那些在没有人类数据的情况下工作的AI系统,会收敛到相同的数学,还是截然不同的数学?现实在这个光谱的哪个位置?对于不同的数学子集,它有多大的不同?
我认为它部分是收敛的,但不完全收敛,所以我确信未来的AI将发现大量外星结构。
我对数学的真理性感兴趣。我对人类和机器都可以探索的数学的广阔不可理解多样性感兴趣。
我想以其全面性来绘制整个数学的柏拉图领域。
我想用我们的大脑、用我们的机器、用两者来绘制它。也许未来还会用混合赛博格、或合成生物生命形式、甚至可能存在于宇宙某处的外星人来绘制。谁知道未来会带来什么!
人脑的架构是有限的。它使用有限的物理过程,有限的信息处理算法,有限的计算能力。
因此,仅用我们的大脑,我们只能看到数学柏拉图领域中存在的美丽大教堂的一个子集。在这里用“子集”这个词可能不是最优的,因为数学柏拉图领域超越了集合论,进入范畴论等等。即使是最顶尖数学家提出的最顶尖猜想——那些需要他们发明全新数学子领域的猜想——在我看来仍然远远不是所有可能的巅峰数学。
我们可以通过许多其他可能的方式超越这些生物限制,照亮我们大脑有盲点的柏拉图领域部分。
物理定律和运行在数学定律上的其他科学定律,以及工程约束,是主要的实际限制。
未来的一些机器数学将完全是外星般的,但以其自身的方式如此美丽。
它将包含如此多特殊的、独特的、新颖的、外星般的、原创的数学语言。类似于Grothendieck艺术的独特性,或宇宙际Teichmüller绘画。但以AI自己的方式,带有它自己类型的独特美。
人类仍将是绘制数学景观的人。AI将像直升机一样,把我们带到任何我们想去的地方。
当你攀登永无止境的困难之山时,可能数学的日益增长的复杂性和难度是永无止境的。
许多已解决的数学问题解锁了大量其他开放问题。
我们在费马大定理、Weil猜想、Langlands纲领中看到了这一点……
所以我们在实践中永远不会用完数学。
相反,将会有新颖数学结果和整个外星理论的爆炸,这在实践中永远不会结束,因为它只会在宇宙结束时结束。
你可以学习更多数学,以便能够充分欣赏人类数学家的外星数学,以及未来AI的更外星数学!我肯定会这样做!
我推荐观看对3Blue1Brown的采访(Grant Sanderson (@3blue1brown) – AI disproved a famous math conjecture. Now what? - YouTube)和陶哲轩的视频(Terence Tao: "Mathematics in the Age of AI" (ICM 2026) - YouTube, Terence Tao - Machine assistance and the future of research mathematics - IPAM at UCLA - YouTube, The Potential for AI in Science and Mathematics - Terence Tao - YouTube, Terry Tao — The future of mathematics | Math, Inc. - YouTube, Terence Tao: Hardest Problems in Mathematics, Physics & the Future of AI | Lex Fridman Podcast #472 - YouTube, Terence Tao – How the world’s top mathematician uses AI - YouTube, Terence Tao at IMO 2024: AI and Mathematics - YouTube)。
机器正在加入我们,共同演奏数学柏拉图领域的交响乐,那里充满了美丽的大教堂。我们将共同探索!
我们将有机器与我们并肩工作,讲述它们自己的故事。
构建它们自己版本的宇宙际Teichmüller理论。
(Bartosz Naskręcki on X: "It's an interesting discussion about why we humans do mathematics in the first place. My expectation is that in 4 years models will be able to do an incredible work, going possibly far beyond human comprehension and skill." / X)
数学的交响乐在这篇伟大的Quanta Magazine文章中被精美地可视化:Monumental Proof Settles Geometric Langlands Conjecture | Quanta Magazine