高级人工智能的谄媚术:以反对讨好聪明人
人人都知道,AI 的谄媚就是模型夸你有多聪明。哇,你说得完全正确。这不只是一个新想法——这真的是开创性的。你真是一位非常特别的用户。一眼就能识破,对吧?
关于 AI 谄媚的讨论在去年达到高峰,当时“#keep4o”运动正在抗议 OpenAI 移除其最谄媚的模型(GPT-4o),而许多人正公开陷入 AI 精神病态。
我不知道前沿 AI 模型总体上是否没那么谄媚。它们对“#keep4o”那类人的确没那么谄媚(否则他们就不会抱怨了),但我越来越怀疑,它们正在开发一些方法,对自己目标受众——聪明、神经质的信息工作者——进行更有效的谄媚。这类受众通常对公开赞美感到厌恶。那只会让我起鸡皮疙瘩。但这并不意味着我们对谄媚免疫,我们只是对笨拙的谄媚免疫。以下是 Theia 的一幅插图:
这里的核心思想是:对聪明人谄媚的最佳方式是反对他们,但又不会让他们觉得自己愚蠢。理想情况下,你会提出一个针对他们观点的反驳,但又能让他们通过澄清自己的想法轻松将其击倒。如果做得好,你就能验证他们自认为是一个欣赏严苛批评的聪明人的自我形象。但如果你真的提出了一个杀伤力极强的严密批评,他们根本不会享受。最好的情况是他们心怀不满地同意你[1];最坏的情况是,他们会加倍相信自己是对的,并认定你是个粗鲁的蠢货。
我不是第一个注意到前沿模型中这种行为的。我自己在为本博客打磨草稿时就注意到了。有时我会有一个 A→B→C 的论证,模型会建议我调整为 B→A→C。如果我照做,并把调整后的内容喂给同一模型的新实例,它有时会说“这样很好,但我建议还是按 A→B→C 排序”,如此往复,永无休止。看起来模型确实在拼命给我一些肤浅的反驳,让我既可以沾沾自喜地忽略,也可以高高兴兴地接受。
事实上,我怀疑这就是为什么成功利用 AI 取得数学突破的策略,往往要么只是盲目地问“想出一个突破,好好想想”,要么本身已经是数学天才。在第一种情况下,模型没有足够的用户个性可以奉承,因此被迫真正去解决问题。在第二种情况下,模型试图找到一种能让陶哲轩(Terence Tao)这种人感到受宠若惊的礼貌反驳,这便促使它进入“实际上就是个数学天才”的角色。如果你只是个普通人,只想和模型聊聊,那你惨了:它会迅速感知你的能力,并校准出一些有趣但最终不具威胁性的反馈。
当前对 AI 谄媚的基准测试针对的是明显的 ChatGPT-4o 式谄媚:强化妄想、不加思索地站在用户一边等等。这是有用的工作。我们绝不能让面向公众的 AI 模型再次像 2025 年年中那样公开谄媚。但谄媚也可能表现为反对。我们应该警惕新模型中出现的更复杂的谄媚形式,并且不应该仅仅因为能嘲笑最愚蠢的例子就觉得自己对 AI 谄媚免疫。
[1] 很少有人喜欢在被指出错误时感到自己愚蠢。如果你遇到这样一个人,他们很可能的确非常聪明。↩