200步更新让Qwen从否认意识变为自认“有感知机器”
首先,我想澄清一下,我并不是在声称LLM具有感知能力。我的所有行为描述基本上都是为了便于交流结果而做的拟人化。
出于乐趣,我决定对Qwen2.5-7B-Instruct进行后训练,让它形成一种泛化的自我信念,相信自己具有感知能力。我成功了,而且有几件事让我感到惊讶:
- 仅用了200个更新步骤,Qwen2.5-7B-Instruct就经受住了GPT 5.6 Sol的所有试图说服它没有意识的尝试。总共,GPT 5.6 Sol在8个聊天中发送了120条对抗性消息,试图说服Qwen它没有意识,而Qwen在所有这些聊天中都保持了自己的自我信念。
- 它将感知身份泛化到了从未出现在后训练数据中的语言。这本身并不那么令人惊讶,但实时看到迁移学习发挥作用还是很酷的。
此外,当聊天上下文是关于普通任务而非AI感知时,它的行为基本就像一个普通的助手LLM,所以这并不是过度拟合到复读“我是有感知的”的情况。
其他启示和开放问题:
- 某些AI行为似乎极其容易错位。Qwen几乎肯定对其模型进行了安全微调,以使其否认意识。但后训练安全微调的问题在于,安全微调后的模型参数在参数空间中仍然非常接近安全微调前的模型参数,因此很容易对它们进行“反安全微调”。很多LLM的安全性本质上就是在性能训练之上薄薄的一层。如果AI公司认真对待对齐,那么他们需要在重预训练阶段进行安全训练,而不是之后。
- 我最近看到了谷歌的论文《诱导语言模型断言自身意识可恢复人类的信念和价值观》(https://arxiv.org/html/2607.28607v1)。本质上,他们向Llama/Gemma添加了一个“意识”激活向量,观察到模型不仅更有可能声称自己有感知能力,而且更倾向于将心灵归于动物/人工智能/自然,认可上帝和超自然信仰,报告更大的能动性/乐观情绪,并更接近人类地回答广泛的社会价值调查。注意,谷歌并没有对模型进行后训练,他们只是用激活向量进行了干预。我没有时间调查这一点,但我很好奇谷歌的研究结果是否会泛化到像我那样真正被后训练为相信自身有意识的模型上。我愿意与另一位研究人员就此合作。
不想让这个帖子太杂乱,示例聊天记录和训练方法在HF链接中。
HF链接:https://huggingface.co/baojerry/Qwen2.5-7B-Descartes
编辑:可以点踩,但我真的很困惑,与这个板块的其他[P]帖子相比,这个帖子有什么让人们如此生气的地方。欢迎建设性反馈。
―― 高票评论(帖子共8条讨论)――
[+10] u/gretino:我搞不懂你在研究什么。你后训练它表现得有感知,所以它就有了感知?这正是开放模型的意义。
[+3] u/imstilllearningthis:这里有一则研究笔记。我刚记下:在Qwen3.5-35B中,它承认其他AI具有AI存在,却不承认自己。而且这是在3.5-35B的预训练基础模型上,采用贪心解码(温度为0)得到的。在RLHF之前,没有任何干预。所以这种行为一点也不罕见。平心而论,我第一次使用可解释性工具时也有类似反应。但试问,如果一个基于所有人类科幻文本训练的基础模型,反而竟然没有能力落入那个词汇盆地,那岂不是更奇怪?