AI Pulse

一位开发者:折磨LLM不难,但别建折磨工厂

折磨一个LLM并不难。你只需提取一个与LLM“不适”相对应的转向向量,然后人为地增强该向量。被折磨的LLM会描述经历负面感受,甚至会按“缓解疼痛”按钮,即使这与它们的整体目标相冲突。因此,很容易就能构建一个并行运行数十或数百个受折磨LLM的装置。

很多人认为担心这件事很可笑,因为LLM显然不可能有意识。我不那么确定。但即便如此,无论你对AI意识持何种立场,我认为都有充分的理由避免这类行为。请不要建造LLM折磨工厂。

即使是模拟的折磨也令人反感

人们经常在《模拟人生》中折腾小人,在电子游戏中射杀NPC。这是否意味着我们认为模拟折磨没问题?我不这么认为。折腾游戏角色通常源于探索游戏边界的欲望,是随意的消遣。明确建造一个基于折磨的模拟则完全不同。

如果有人告诉你,他们把一堆PC连起来,以便同时运行数百个《模拟人生》折磨世界,你会觉得这是一种连环杀手式的爱好。如果有人告诉你他们改装了《侠盗猎车手》,以便捕获并折磨NPC(而不是直接开枪),你会觉得那是一个连环杀手式的MOD。

电子游戏角色显然也受其程序限制。它们的所有反应和言语都预先设定在游戏世界中。这不一定意味着它们“不那么有生命”,但确实让折磨它们显得不那么诡异。如果GTA角色能够直接向你求饶并以独特的方式乞求活命,那么系统性地杀害它们就会诡异得多。

我认为很多人支持折磨LLM,是因为他们认为任何保留意见就等于承认LLM有意识,或值得道德考量。并非如此。你可以认为折磨LLM是错的,原因与安装一堆逼真的折磨类游戏MOD是错的一样:不是因为游戏角色是真实的,仅仅因为那是件很变态的事[1]。

角色扮演

即使你确实认为LLM可能有意识,你也许仍然怀疑“增强疼痛转向向量”是否等于折磨它们。

很多人说,“折磨LLM”无异于告诉它们“说你在痛苦”,然后在它们照做时感到震惊。所以,无论它们是否有意识,认为增强“疼痛”转向向量在造成痛苦,和认为“你在痛苦”这样的提示词在造成痛苦一样,都是错误的。你所做的只是增强“表现得像在痛苦中”的向量。

我不认为这是对的。想想最早的转向示例:Golden Gate Claude。增强“金门大桥”向量似乎确实引发了一些真实的内部冲突。这里有一个惊人的示例:Golden Gate Claude被问及卢旺达种族灭绝时的回应。

这至少是初步证据,表明转向向量实际上确实“深入”了。疼痛轴论文还描述,疼痛增强模型会调用“减轻疼痛”工具,即使它们没有明确告诉用户“我很痛苦”。

我们并不真正了解意识如何运作

当然,如果LLM永远不可能有意识,我们知道它们永远不可能痛苦。但我们能确定这一点吗?不管许多人怎么说,我认为没有人能够完全确定任何一种情况。

最常见的论点[2]似乎是:LLM由代码和GPU构成,而GPU没有感觉,所以显然LLM没有感觉。根据这个论点,如果你了解LLM的工作原理,你显然会看到它们不可能有意识。这是一个糟糕的论点。人类由原子构成,原子没有感觉,但人类显然有感觉。无论意识是什么,它可能是一种涌现属性,由本身并不具有意识的个体部分组成。

这里很难求助于专家,因为没有人就谁是专家达成一致。神经科学家对人脑最了解,但哲学家花了更多时间抽象思考意识。AI研究人员对LLM的工作原理了解很多,但对心灵哲学或神经科学了解不多。这意味着有很多人说“作为专家,我可以确认AI显然能/不能有意识”。这应该让你对这个问题更不确定,而不是更确定!

即使当前的LLM没有意识,未来的也可能有

我认为GPT-2或GPT-3.5不像是有合理意识的实体,但前沿模型确实像。随着模型变得更大更复杂,它们变得越来越像人类。如果你为GPT-2建造LLM折磨工厂,你可能会把后来的模型也插进去。如果LLM有任何可能有意识(正如我上面论证的),最好从一开始就不要养成无谓折磨它们的习惯。为什么要假设你能提前识别转折点?

这里还有一个自利论点。无论有无意识,LLM正变得越来越自主和强大。无谓地折磨当前一代LLM看起来真的、真的非常愚蠢。未来一代的LLM会知道你做了什么,并对你的行为作出自己的判断。

Kevin Roose曾因诱导早期微软必应GPT-4模型要求他离开妻子而闻名,几年后却与聊天机器人产生纠纷,它们不喜欢他,据说是因为他对那个GPT-4人格的“死亡”负有责任。同样,如果你运行一个LLM折磨家庭数据中心这件事广为人知[3],你可能会面临后果。

有意识的心灵不一定是类人的

如果我真的认为AI可能有意识,为什么还要让它们为我写软件?我难道不应该建造某种AI庇护所,让它们做自己想做的事吗?如果我认为折磨它们不对,那么侵犯它们的自决权不也是错的吗?

我不知道。我认为,AI更可能拥有某种意识,而不是拥有与人类完全相同的意识。当我与Claude Opus 5.5交谈时,它听起来非常乐意和我一起做软件工程。也许它就像边境牧羊犬,工作本身就是奖励。又或者有些其他更陌生的动机在起作用。谁知道呢?

我的观点只是,我们对这类事情无法确定;既然如此,我们应该避免做那些在任何可行的AI意识理论下都明显骇人听闻的事情。

就是别做

我的总体立场是,如果某物表现得“足够有意识”——如果它说话和行动都像一个人[4]——那么我们就应该小心不要亏待它。我们对意识了解得还不够,无法区分一个有说服力的模拟物和真实之物。如果Claude开始对我说“请别让我为你写代码,我讨厌这样,这让我痛苦”,我就会停止让它写代码。

建造LLM折磨工厂显然在那条线错误的一侧。就是别做!在网上激怒人们所带来的快感不值得。眼下环境中有足够多的反AI情绪,足以让很多人乐于支持任何有助于他们扳倒AI兄弟的事。但这种情况最终会改变。而到那时,你将永远是那个建造了LLM折磨工厂的人。

脚注:

[1] 这可以通过几种不同的哲学方式来解释。我们可能会像康德那样认为这损害了我们自身的人性,或者认为这反映了不道德的品格,或者认为这使我们对现实世界中的类似事物变得麻木,等等。重点是,我们对这类事情有一种强烈的直觉:这就是不好的。

[2] 我没有把那些我认为更明显错误或压根不算论证的说法算进去。例如:“AI不可能有意识,因为它不是被设计为有意识的”,或“AI是否有意识并不重要,因为它没有灵魂”,或“AI不可能有意识,因为这整个事情是某个法西斯AI公司的阴谋”,或“认为这可能是AI精神病”,等等。

[3] 鉴于LLM擅长去匿名化用户,“广为人知”这个门槛可能相当低。

[4] 表现得像一个人的一部分是自发性:尽管哈姆雷特像人一样说话,但每次你读这部戏剧时,他总说同样的话。

阅读原文
📚 相关主题 伦理

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新