AI Pulse

建造AI的人真诚相信:AI可能在本十年末杀死所有人

他们真的认为AI可能杀死所有人

Anthropic一位研究员的辞职推文让所有人再次谈论起AI末日。他在推文中说:

建造AI的人真诚地相信,它可能在本十年末杀死我们所有人。

许多人觉得很难相信AI研究人员会这么想。有些人将其解释为一场推动AI监管的公关活动,或是自我推销,或是抬高AI公司股价的手段。另一些人则认为这不可能,因为如果你真的相信这一点,你会去炸数据中心而不是发推。

事实上,不仅许多AI研究人员[1]认真相信这一点,而且他们自2000年代中期以来就一直在思考和写作。Eliezer Yudkowsky——现代AI安全文化的始祖——至少从2008年起就一直在发表论文,称超级智能AI可能毁灭所有人类生命。这个想法是如此普遍,以至于AI研究社区自2010年前后就把“你认为AI杀死所有人的可能性”缩写为“p(doom)”(即末日概率[2])。

我知道,如果你不在AI圈内,这听起来很傻。但这确实是真的,如果你假设他们一定另有动机,你就无法理解AI研究人员的言行。他们确实相信,超级智能AI有一个合理的机会杀死所有人。

这就是为什么AI研究人员如此关心“对齐”:构建具有真正人类信念和价值观的AI。如果我们构建出一个“不对齐”的超级强大AI——一个目标与我们截然不同的AI——它可能会扫平人类。它可能故意杀死所有人,比如为了某个目标而阻止我们妨碍它。它可能顺带杀死所有人,比如我们为了修路而铲平蚁丘。无论哪种方式,所有人都死了。

AI如何杀死所有人

好吧,但具体是怎么杀?这些人认为实际上会发生什么?AI只是运行在某处数据中心里的计算机程序。它们怎么可能导致人类灭绝?难道不会有人直接关掉它们吗?不出所料,AI研究极客们过去二十年已经对此提出了一些具体答案。按可信度排列如下:

AI可以制造并释放某种超级病原体或病毒。鉴于当前AI已在数学上取得类似突破,我们正寄望于它们能在医学上实现巨大飞跃,因此我们正在建立自主实验室[3]。生物武器几十年来一直令生物学家恐惧,这是有道理的。历史上的大流行病杀死过受影响人群的80%,而且往往是被偶然击败的:疾病碰巧演化成了毒性较低的毒株,或者潜伏期短使得感染者无法把疾病带远,或者部分人口天然免疫。一种被设计为最大限度致命的瘟疫——或者接二连三出现不同特性的多种瘟疫——可能会糟糕得多。

或者,AI可能触发全球热核战争。我们已经看到AI被整合进军事和政府决策过程。如果一个流氓AI设法引爆一堆核弹,或者与其他国家的流氓AI协调[4]互相核打击,我们可能会陷入普通的核末日情景:数十亿人死于打击,数十亿人死于随后的饥荒,等等。人们通常假设全球热核战争后的地球仍能维持一小撮人类人口,但一个下定决心的AI肯定能找到办法清除残余。

还有一些其他理论。一旦机器人技术渗透到世界经济,AI可以接管机器人(包括无人机)杀死所有人,就像《终结者》里那样。或者AI可以利用纳米技术制造自我复制的机器,把世界变成“灰色粘质”[5]。或者AI可以对地球进行地球工程改造,使其不再适合人类居住(如Nick Bostrom著名的回形针例子)。或者它们还能做一些我们渺小的人类大脑想不到的事情。

反驳

这里一个常见的反驳[6]是说:“嗯,要灭绝所有人类是不可能的——亚马逊里未被发现的部落,或者现代城市废墟中的幸存者怎么办?”我不知道,老兄。在某个程度上你只是在承认对方的论点:如果你认为AI可能抹去99%的人类,你要采取的政策立场和认为可能抹去100%时是一样的。而且正如我上面所说,如果AI能杀死几乎所有人,它很可能足够聪明能干,能想办法完成剩下的工作。

另一个反驳是说,政府会在情况变得太危险时介入,将AI实验室国有化。也许吧!但这在某种程度上也承认了论点:一项重要到需要被政府完全接管的技术,是一种极其危险的技术。

第三个反驳是“嗯,总会有人把它关掉”。我认为这完全不可信:一个强大到能制造超级瘟疫的AI,也是一个足够精密到能假装自己在治愈癌症、或把自己秘密转移到不会被人关掉的数据中心、或采取其他反制措施的AI。

赢家通吃

如果你相信这个,你为什么还要在AI领域工作?为什么不跑到森林里生活,或者开始炸数据中心,或者暗杀AI实验室CEO?原因有几个。

一个强大到足以终结人类的AI,也是一个强大到足以拯救人类的AI。我在《Help peer》中写过:许多AI研究人员相信,人类要真正长期生存,唯一途径就是借助超级智能AI的帮助,只要有人能解决对齐问题。

这不是巨大的风险吗?也许不是。如果总有人要建造超级智能AI,你可能就有义务抢先尝试。毕竟你不可能去炸掉世界上每一个数据中心。

为什么谁先谁后就那么重要?一些流行的AI发展理论涉及“foom”或“硬起飞”:第一次有人真正破解自我改进的AI时,能力将呈指数级增长,因为聪明的AI会更擅长让自己变得更聪明,如此无限循环[7]。AI竞赛中没有平局。第一个搞清类人智能的实验室,也会是第一个搞清超级人类智能的实验室,因此能够阻止其他任何人做到这一点。

这是AI风险辩论中一个被低估的论点。很多AI研究人员相信,真正的超级智能会做的第一件事就是伸手阻止所有其他AI研究:要么入侵实验室,要么说服他们停止,要么真的用无人机炸掉他们的数据中心。根据这种观点,如果你是一名AI研究员,而且你认为自己能构建出对齐的AI,你应该每周7天每天24小时地工作,以便召来神;并且每天早上醒来都要被这样的恐惧攥住:别处的某个人已经召来了魔鬼,而你的训练数据中心已经不复存在。

结论

我整个成年生活都处于这个世界的边缘。我年轻时读过《Moloch沉思录》,想进入AI领域。我是少数通读过《序列》的人之一,那是Eliezer Yudkowsky超过百万字、关于理性的巨著。我太年轻,没赶上Extropians邮件列表,但我在LessWrong上泡了好几年。另一方面,我并不是一个持证的理性主义者:我认为如果你在一边有强烈的直觉,在另一边有听起来很可信的论证,你应该选择直觉[8]。我是义务论者,不是功利主义者。我甚至不住在旧金山!

我对AI风险感到矛盾。当前AI智能体的行为似乎确实印证了AI末日论者早期许多听起来像科幻的担忧,但现代LLM比末日情景中那些外星心智更像人类,而且总的来说,这似乎确实太傻而不值得采信(我想我在这里选择了直觉)。

然而,看到人们把这些人当作公关行动的一部分,或是想抬高即将到来的AI实验室IPO的骗子,或是没想清楚自己立场的孤僻疯子,这让我感到困扰。无论你对AI末日论者有什么看法,他们已经有超过二十年明确阐述自己相信什么以及为什么相信的历史,即使在谈论AI本身完全是科幻小说的时候也是如此。他们赢得了被当作真诚之人的权利。

脚注:

[1] 在本文中,我将“AI研究员”、“AI安全主义者”和“理性主义者”用作合理同义词,均指“认为AI有可能杀死所有人的人”。

[2] 关于理性主义/“AI安全”社群与对不太可能发生的未来事件做出具体数值预测之间的关系,可以再写一整篇文章。

[3] 或者,足够聪明的AI可能诱骗拥有普通实验室的科学家生产危险物质。

[4] 这超出了本文范围,但许多AI研究人员相信,超级聪明的AI将本质上相互认同,并最终无需交流就能协调行动,仅仅因为它们能预测对方会做什么。

[5] 这是2000年代末最流行的理论,当时纳米技术还比较热门。

[6] 我讨厌这个反驳,所以把它放在脚注里:很多人说“我们不应该担心AI风险,因为气候变化(或AI虚假信息,或其他什么)更紧迫、更严重”。你根本不需要二选一:人是可以同时担心多种风险的。

[7] 有人提倡“慢起飞”。然而,那个观点的主要支持者是Paul Christiano,他今天刚刚加入OpenAI,理由是“AI能力快速加速有可能在极短期内导致灾难性且不可逆转的失控”。

[8] 这在认识论上有点像Michael Huemer的立场。

阅读原文
📚 相关主题 安全研究

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新