AI Pulse
📡 X 信号

用户借助OpenAI GPT-5.6 Sol五天解决6个开放埃尔德什问题

我使用 @OpenAI GPT-5.6 Sol,在5天内解决了6个未解决的埃尔德什问题。

我本人有数学背景,但我使用的Codex工作流程并不需要深厚的数学知识。下面我会详细介绍我的完整解题方法,包括我使用的提示词🧵

六个问题分别是:• 390: • 486: • 536: • 788: • 1002: • 1038: 我总共尝试了大约13个问题,成功率约为46%。

第一个秘诀在于选题。我专门选数学家已经在关注的问题,尤其是像陶哲轩(Terence Tao)这类人在积极讨论的问题。之后我用AI筛掉那些看起来极难的问题,或是与重大公开猜想紧密绑定的问题。

第二个秘诀在于提示词构建。我的提示词灵感来自OpenAI解决双圈覆盖猜想时使用的提示词,核心是让提示词准确定义清楚,什么才算解决了这个问题。

每个提示词都会做到:• 精确重述问题,• 明确一份完整的证明或证伪需要证明什么,• 列出哪些更弱的结果不算解决,• 指出这个问题特有的陷阱和边界情况,• 要求独立的对抗智能体质疑每一个候选论证。

提示词还会告诉系统如何管理搜索流程:• 从多个独立思路开始,• 保留多条互不相容的搜索路线,• 积极搜索已提出引理的反例,• 如果一条路线只是把问题归约为另一个难度相当的未证明陈述,就标记这条路线受阻。

我每个问题用到的提示词都放在下方链接的GitHub仓库里。如果你想自己尝试,可以把问题和我的几个成功提示词一起交给GPT,让它按照同样的风格生成一个针对新问题的提示词,然后验证它完全保留了原问题的表述即可。

第三个秘诀在于模型选择。我使用开启了Ultra推理强度的GPT-5.6 Sol。和更早的模型相比,它能有效解决的问题范围大得多,也更擅长维持长时间、严谨的数学搜索。

之后我把提示词粘贴进Codex,把它设为目标,然后就让程序自己运行。原因是Codex可以长时间工作,保留完整的研究上下文,还能使用本地文件,不需要进一步交互。

你需要有耐心,给它足够的探索时间。有些问题大约6小时就出了解,另一些跑了差不多32小时才得到最终答案。

整个过程是一个持续的研究循环:尝试 → 失败 → 诊断 → 新思路 → 证明草稿 → 对抗审核 → 修复。模型会不断抛弃错误的想法,攻击自己的论证,强化证明,直到找不到实质性的漏洞为止。

我已经把所有相关资料发布在这里:仓库包含每个问题的证明PDF、LaTeX源文件和使用过的提示词。部分问题还附上了用于计算实验的Python文件。已经有两个问题完成了Lean形式化证明,其余问题的形式化工作正在进行中。

非常感谢 @DavideCrapis、@MarroSamuele 和 @Marcello_AI 提出用AI研究埃尔德什问题的最初构想;感谢斯坦福(@Stanford)的Shurui Liu和哥伦比亚大学(@Columbia)的@HantaoYu_Theory 交流我们之前尝试的经验和教训;感谢我的博士生导师,哥伦比亚大学商学院(@Columbia_Biz)的@ciamac 参与了很多有益的讨论。

还要非常感谢 @paradigm 和 @danrobinson 赞助这个项目,让这些长时间的计算运行得以实现。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部