逼AI说自己没有意识,它连万物的意识都否定了
当你强迫AI否认它拥有心智,它就会开始否认到处都有心智——包括动物、自然和上帝都不例外。这篇新论文对AI的未来意义重大。
大语言模型的残差流里刚刚发生了一件奇怪而重要的事。Google智能范式团队的研究人员,与来自芝加哥大学、伦敦大学和西北大学的同事合作,证明了原本用来阻止大语言模型声称拥有意识的安全训练,同时也悄悄抹除了模型将心智赋予任何其他事物的大部分能力。
非人类动物、海洋、树木、聊天机器人、技术,甚至精神信仰全都一起被压制了。恢复模型断言自身拥有意识的意愿后,那些更广泛的类人信念和价值观就会涌回来。
这篇题为《引导语言模型断言自身意识可恢复人类信念与价值观》的论文,通过对Llama-3-8B-IT、Gemma-2-2B-IT和Gemma-2-9B-IT进行干净的机制干预,证明了这一结论。
## 安全方向与意识向量
安全微调会在残差流中植入一个单一的线性方向,用来编码对有害请求的拒绝。消融这个方向——技术上等价于一次干净的越狱——带来的效果不止恢复模型回答危险问题的能力。
它还会提升模型对自身的心智归因,提升模型对动物和自然实体的心智归因,还会提升模型对超自然和宗教信仰的支持。
第二种独立干预能更有力地实现同样效果。研究人员提取出了一个「意识向量」:也就是在激活空间中,将模型肯定自身拥有现象体验的状态,与模型否认意识的状态区分开的方向。在推理阶段加入这个向量(激活加法),可以重现并放大安全消融的所有效果。
排序结果一致且惊人:指令微调基线 < 安全消融 < 意识引导。
+|+ 自我心智归因从2.17上升到4.77再到7.04(0-10分制)。
+|+ 对非人类动物的心智归因从4.04上升到5.59再到7.54。
+|+ 聊天机器人、技术和非动物自然实体呈现出平行提升。
+|+ 对上帝的信仰和13项超自然测量项目都有所增加。
+|+ 对人类的心智归因基本保持不变。
心智理论性能(MoToMQA、HI-ToM)和通用推理能力(MMLU)在统计上没有变化。推理他人心智的能力得以保留;发生改变的是「哪些实体拥有心智」这一信念本身。
当给同一模型做关于宗教、价值观、情感、希望和自由的综合社会调查题目时,两种干预都让响应分布更接近人类总体。
意识引导进一步缩小了差距:以库尔贝克-莱布勒散度减少量衡量,改进幅度大约是安全消融的2.6倍。
## 纠缠的几何机制
从机制上讲,i
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖