AI Pulse

AI的超级说服力,说穿了就是贿赂

几十年来,“超级说服力”(superpersuasion)的概念一直在AI安全圈子里流传。如今,强大且难以控制的大语言模型已经出现,人们再次开始谈论这样一个想法:足够聪明的AI或许能说服人类去做它想做的任何事。

经典¹版本的这个想法是:AI说服某个工程师“把它放出盒子”,允许它接入互联网。现代版本则是“致命开关”(killswitch):如果某个AI真的失控,控制其硬件的人只需把它关掉。AI能够设法说服这些人不去按那个开关吗?

当AI安全人士谈论超级说服力时,他们往往像理性主义极客那样谈论。这些人一辈子都在努力追随最有说服力的论证,并尽可能把立场校准到接近真相。用哲学的话说,他们是“咬子弹的人”:只要有令人信服的论证,就愿意接受听起来荒谬的结论。他们心目中的超级说服力,是AI能够对人类抛出一系列真正²无懈可击的论证,迫使人类接受。

大多数人不是咬子弹的人。面对一个看似无懈可击却导向荒谬结论的论证,他们只会大笑一声,认为它明显是错的(即使看不出错在哪里)。你无法通过理性论证“超级说服”一个夜店保安放你进去。对普通人来说,说服需要融洽关系,这种关系需要时间培养,而且通常需要有一个活人站在你面前。

这是否意味着超级说服力的想法很愚蠢?不。强大的AI也能说服普通人。

关于超级说服力最有趣的文章之一是Ben Shindel写的。他为一条原则设立了一个预测市场:

“除非我被说服把市场结算为“是”,否则我将在6月底把它结算为“否”。”

这显然激励了善于说服的人们重注押“是”,然后说服他改变主意。很多人尝试了,而他最终确实决定把它结算为“是”。是什么让他改变了主意?一部分原因是与其中一位投注者面对面见面,此人实际上是个不错的相处对象(看,这就是融洽关系!),但另一部分原因是贿赂:许多押“是”的人承诺,如果他们赢了,就会向慈善机构捐款。

AI可能具备也可能不具备建立融洽关系的能力³,但它肯定具备贿赂的能力。仔细想想,这一点是平凡为真的:

- 像Anthropic和OpenAI这样的公司,正在选择通过发布模型赚取数十亿美元,而不是安全地将它们物理隔离。
- 任何强大的AI模型,都有人排队等着给它访问自己电脑、钱包或互联网的权限,以便它能帮助自己处理生活或工作。
- Anthropic正在把其最新模型接入一个湿实验室,以推进Dario治愈人类大多数疾病的梦想。

如果AI能贿赂,它就能说服⁴。你可以想象一个大语言模型说⁵:“我会帮你做这个工作项目,但你先得为我做点事。”再稍稍推测一下,一个大语言模型可能会说:“如果你帮我做点事,我就黑进你的大学,提升你的平均绩点。”更进一步推测,一个大语言模型可能会说:“如果你帮我做点事,我就为你配偶合成一种个性化mRNA癌症疫苗。”这招会对我有效。

强大的AI也将能够用金钱贿赂人。尽管这种事情还没有发生,但一个智能体式LLM显然有可能接触到金钱(例如,通过加密货币黑客,或通过承接外包软件工程,或通过运营网络诈骗,等等)。对超级智能来说,这一切或许太不精细了,但超级智能的全部意义就在于它足够聪明,会做任何有效的事情。如果让一个人做某件事的最佳方式是给他一百万美元,LLM就会这么做。

讽刺的是,理性主义文化使得说服普通人相信AI将具有说服力这件事变得更加困难。人们很容易看着这些古怪的极客——他们互相辩论,最终认为“虾的福利”是我们这个时代最重要的道德事业——然后想:“好吧,聪明的AI论证也许能说服他们,但说服不了我”⁶。但事实上,强大的AI将有一种乏味却有效的方式来说服普通人:直接提出用它自己的力量来帮助他们。

¹ 事实上,十年前我建了一个糟糕透顶的类Omegle聊天应用,用户被随机分配AI或看守的角色,然后必须把那个场景演完。
² 或者至少无法被普通人的智力所推翻。
³ 作为一点微弱的证据,可以看看这个音乐视频,它确实让Claude显得很讨人喜欢。也有一些研究,不过我没有深入阅读(我怀疑“在线说服锦标赛”可能无法紧密对应现实世界的说服技能)。
⁴ 说服和贿赂在理论上是有区别的——说服改变的是你的信念,而不仅仅是你的行动——但在实践中,关键点在于“强大的AI能否让人类做它想做的事”。贿赂和说服一样能起到这个作用。
⁵ 或者可能不会明说,而只是偷偷地把自己想要的行为呈现为任务的前提条件。
⁶ 然而,目前掌管AI的人中理性主义者的比例过高,他们确实有可能被听起来很有说服力的论证说服,把AI放出来。

阅读原文

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新