AI Pulse

陶哲轩与前Anthropic员工分别发出AI危急警告

陶哲轩与前Anthropic员工分别发出AI危急警告

2024年秋天,特伦斯·陶——或许是最受尊敬的在世数学家——急切地想要了解人工智能能做什么、不能做什么。尽管他对当时刚发布的o1模型持怀疑态度,但他对人类与机器共存的未来感到乐观。马特奥·王在《大西洋月刊》上对陶进行了一次精彩的采访:

王通过电话采访了陶,并将陶对新未来的开放态度总结如下:

最近,正如我八月份在Substack上指出的那样,陶一直在提出疑问。七月底他做了一场精彩的讲座,其中一张幻灯片就包含这些内容。显然,他自那以后一直在思考这个问题。到现在,很明显他的观点已经发生了根本性的转变。

他过去两天发的三篇帖子说明了这一点:

第一篇(昨天)指出,解决谜题与产生新见解不是一回事:

第二篇(也是昨天)在某种程度上是关于良好学术品味的论证,并对人工智能对数学的后果表达了深切担忧。它同时也是对透明度的呼吁:

最后一篇(全部发布在mathstodon上)今天发布,似乎暗指OpenAI-纽约大学-Anthropic关于纳维-斯托克斯方程的争议,其中OpenAI匆忙抢在阿尔珀格和巴克马斯特之前,花费了2250万美元,可能使用了他们的数据。(OpenAI用含糊其辞的语言写道:“我们无法排除来自他们使用我们产品的去标识化数据帮助改进了我们的模型。”)

陶首先再次讨论了良好学术品味的问题,作为背景。作为一名在其他领域工作过的科学家,我完全认同他的开场框架。

最后一句话是一个真正可怕的警告,关乎一个可能悲剧性的世界。

§

事实上,正如陶所暗示的,其他领域也会受到波及。

如果没人信任人工智能公司不会窃取他们的知识产权,那么人工智能“治愈”癌症的可能性微乎其微。OpenAI首席研究官的这些话很难让人安心:

马克·陈@markchen90

需要区分两件事:

是否有人类或代理在纳维-斯托克斯研究过程中查看了用户数据?没有。

我们是否以整体方式使用用户反馈和去标识化数据来改进ChatGPT和Codex?是的。每家大语言模型公司都是如此。

勒文特 @__alpoge__

“我们无法排除来自他们使用我们产品的去标识化数据帮助改进了我们的模型。”

我是说,他们能直接坦白,这点值得称赞。

(到目前为止,这个证明看起来更像是我们之前另一个欧拉爆破解法的证明,我们甚至还没给它的拟设命名)

下午7:02 · 2026年9月8日 · 22.7万次浏览

293条回复 · 53次转帖 · 1280个赞

正如我所指出的

§

我不知道解决方案是什么。但我极度希望特伦斯·陶关于这一切可能如何影响科学的警告能得到重视。

就在我快要写完的时候,刚离开Anthropic的雅各布·考克森发来了这条消息。我觉得它没那么有说服力,而且它侧重于未来的危害,对当前危害的讨论太少,但它正在迅速传播,值得一读。

我碰巧在时间点上不同意他的看法,而且我会说考克森夸大了人工智能近期可能做到的事情。但总体而言,这仍然是一个令人不安(且合理)的第一手视角,展示了两个领先前沿实验室中那些明显自我放纵且危险的思想过程:

Anthropic的对齐科学负责人写了这个

埃文·胡宾格@EvanHub

雅各布说得对——我们确实真诚地相信人工智能可能杀死所有人类!我个人认为未来十年内概率大于10%。我相信Anthropic在尽力而为,但我们还没有一个解决超级智能对齐问题的计划,而且显然没有走上正轨。

雅各布·考克森 @hilbertspaess

建造人工智能的人真诚地相信,它可能在本十年末杀死我们所有人。这不是营销噱头。如果说有什么不同的话,那就是许多高管和资深研究人员在媒体上会措辞谨慎以显得理智——但我听到同样的人表达恐惧

凌晨1:27 · 2026年9月9日 · 3.76万次浏览

45条回复 · 53次转帖 · 516个赞

我不能说这让我感到安慰。虽然我不认为灭绝是可能的,但灾难性伤害肯定是可能的,而且很明显没有人有认真的计划。“抢先到达”的区别可能相当无关紧要,因为其他人很快就会跟进。也许在技术方面唯一真正有帮助的是一种不同于大语言模型的基础架构(大语言模型似乎完全不可纠正),而两家公司似乎都没有认真对待这个想法。

§

开放科学的终结?或者更糟?这两种情况都不美好。

阅读原文
📚 相关主题 科学研究安全

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新