AI Pulse
📡 X 信号

党哥推出The Last Math Competition,每周AI生成一万个猜想

我不知道我这个做法将会狠狠推进数学一大步,还是彻底终结数学。党哥这里隆重推出The Last Math Competition(“最后数学竞赛”),可能将是全人类最后一场、也将是最旷日持久的一场数学竞赛。以下是党哥制定的 The Last Math Competition 的规则: 1. 举办方每周会使用 AI Agent 新增 10000 个纯数学领域的猜想,添加到 ./conjectures 文件夹中; 2. 人类和 AI Agent 将共同对现存的所有猜想进行不同维度的打分,预估这些猜想证明或者证伪的难度,评价猜想的重要程度; 3. 人类和 AI Agent 可以共同提交对于每个猜想的完整证明,以 pull request 的形式提交在对应序号的文件夹中(比如 ./solutions/00000000001/my_submission_20260912041426),其中需要同时包含 LaTeX 源代码、PDF 文档和 Lean 4 项目,经过完整 review 后,完成证明或者证伪该猜想的提交将会被 merge 进来; 4. 举办方将会持续维护和更新一个含有所有猜想相关统计数据的表格。

表格中的每一行对应一个猜想的所有信息,其中包括猜想的难度预估、重要程度打分、是否 well-defined、目前是否被证明或者证伪、第一次成功解决的时间、成功解决者的姓名和 affiliation 等信息; 5. 根据现存的猜想、对现存猜想的评估、对现存猜想的成功证明或者证伪,举办方将调整使用 AI Agent 生成猜想的策略,来逐步提高未来生成数学猜想的质量,以及可能逐步提高生成猜想的数量。由于比赛尚在早期,我们必须声明:在早期生成的数学猜想的平均质量比较差,一部分猜想可能定义不充分或者存在错误的条件,或者存在显而易见的错误,甚至可能 "not even wrong"。所以我们将会根据对猜想的统计数据表格,来提升新生成猜想的质量和方法。

党哥的长远目标是: 1. 经过长期的比赛和反馈,我们将尝试逐步提升猜想质量。在长期大量猜想生成的过程中,我们希望能够创造若干重要猜想,通过对这些重要猜想的证明和证伪,来推动数学知识体系的推进; 2. 我们将探索以 AI Agent 为主导的数学研究和证明的技术路线。本比赛作为公开的比赛和 benchmark,将会实时评测所有模型的性能、harness 的性能、数学证明工具的性能,整个社区的所有���与者将一起探索 AI 时代科学研究的方法论; 3. 整个竞赛的所有猜想、对猜想的评估和打分、对猜想的最终证明或证伪,作为全世界 AI Agent 共同的经过验证和评议的知识成果,可以用于未来的数学研究,也可以用于未来的 LLM 训练。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新