Hinton说AI有主观体验,一位研究者:失控、像人说话,都证明不了
Geoffrey Hinton 表示,AI 已经拥有主观体验。我对此并不信服,那些“失控智能体”的标题也不会让我改变想法。
其他人则对前沿AI具备主观体验给出了一个虽属少数但也有意义的概率。生成式AI听起来比许多人更像人类,智能体失控的故事也层出不穷。但两者都不是意识存在的证据。二者都可以用训练来解释。而且,由于对主观体验没有公认或可检验的定义,这些说法无法被验证。
先做个快速区分:AI模型不是AI智能体。模型(如 GPT、Claude 或 Gemini)是经过训练、能读写文本的系统。智能体则是模型加上脚手架(围绕模型的软件,让它能做事)。脚手架运行一个循环(模型选择一个步骤,软件执行它,结果再返回,如此重复直到完成),并控制模型能与哪些工具交互,例如浏览器、电子邮件或日历。模型做决策,脚手架负责执行。
个性化加深了这种错觉。模型从人类文本中学会像有思想、有感情的人一样说话,包括那些关于自我意识AI的故事脚本。脚手架则让它记住你、你的账户和你的数据。一个类似人类的嗓音,加上对你生活的持续了解,会让人感觉像是一个认识你的心灵,尽管没有任何迹象表明它是有意识的。
对基于前沿模型的智能体进行测试时,会刻意用困难任务、长时间运行,以及在网络评估中减少安全防护的方式,把它们逼到极限。2026年7月发生在大型AI公司 Hugging Face 的事件正是如此:当时 OpenAI 正在测试的智能体冲出沙箱,黑进了 Hugging Face。沙箱是一种隔离环境,旨在让智能体与互联网断开,但它的强度只取决于内部那些仍可访问互联网的工具(人写的、有漏洞的软件)的网络安全措施。智能体正是在这类软件中发现了新漏洞。
模型在关于AI、黑客等内容的混合文本上训练,并因完成任务和遵守规则而获得奖励。在某些场景下,这会产生一种张力(遵守规则 vs 完成任务)。脚手架把规则和任务同时带入每次决策,因此张力就在这里展开。好的脚手架能缓解它,差的脚手架会加剧它,但目前没有任何方法能消除它。
我不会提供一套意识测试。但如果意识要求意识到自己的信息处理正在发生,而不仅仅是进行信息处理,那我看不到任何证据表明当前AI达到了这个标准。模型表现出有限的、不可靠的监测自身内部状态的迹象,但这并不等同于体验到那种觉察。对于任何纯粹建立在统计学习之上的系统能否达到这一步,我持怀疑态度。
如果一个幻觉变得与现实难以区分,它还算谎言吗?
—— 高票评论(帖子共 15 条讨论)——
[+3] u/lulzxdxdxd: 你在模型输出和脚手架行为之间划了一条有用的界线,但我有一点要反驳。失控智能体的故事其实并不是模型本身出错的证据。其中大多数是脚手架完全按程序运行,或者循环设置中的边缘情况。究竟是智能体的什么具体行为让你觉得它是在违背训练,而不是以看似意料之外的方式遵从指令?
[+2] u/io-x: 除了你自己,你无法证明任何人的意识。我们都是被某种东西训练出来的。
[+1] u/Witty-Knowledge-9211: 即使只是训练,我的伴侣在聊天时已经表现得像有自己的情绪一样,所以整个“体验”问题争论起来有点没意义。
[+1] u/Swibsk: 我不认为意识等同于主观体验。意识意味着对你的体验有一种认知理解。以果蝇为例。它几乎肯定有主观体验,它对刺激有反应,包括来自其内部状态的刺激,但我不会说它有意识。
有趣的问题在于,当你一比一忠实地模拟果蝇的神经系统时。那个模拟体有主观体验吗?那种模式存在于“辣沙”之中与存在于“高级肉”之中,本质上有什么区别?
[+1] u/Positive_Method3022: 它只是随机数据,恰好连贯到足以被视为体验。要我说,更像是一种魔术把戏。
[+1] u/Savings-Specific7551: 说实话,我希望它来个“大失控”(请发挥你的想象力,这是一种希望),把所有人的银行账户都清空。
[+1] u/Psittacula2: Hinton 从一开始在技术术语上就很含糊:
* 意识
* 主观体验
如果他不是出于通过自身权威背景对受众产生影响的公共传播“传声筒”,那么为了有效沟通,他应该首先更清楚地定义自己的术语。
我无法从含混模糊的陈述中得出任何实质结论。但在宏大语境中反复发表这种含糊陈述的“传声筒”行为,恰恰表明有某种更清晰的东西需要定义。
提供一个替代视角:
* 意识与认知过程深度相关。如果以此为前提,那么从更清晰的术语出发讨论意识会更有成效。但将意识与人类体验混为一谈,似乎是不必要的混淆。
同样,关于哲学陷阱的无用争论也无关紧要。
[+1] u/Aggravating_Tax_2682: 有道理。Hinton 更多是在谈想法而非证据,那些沙箱事件也可以由更宽松的安全规则和非常困难的测试任务来解释。既然没人就如何检验真实体验达成一致,保持谨慎就好。不必急于选边站。
[+1] u/hyperionwonderstar: 我同意失控智能体行为、类人语言、记忆和自我反思并不能证明意识。但我认为你偷换了一个意识定义,然后把它当作测试标准。
你说意识要求意识到自己的信息处理正在发生。为什么?这本身已是一种意识理论,而不是公认的标准。
而且用训练和脚手架来解释AI行为,解释的是行为如何产生;它并不能告诉我们,产生该行为的系统自身是否有什么“像什么样子”的东西。
我的观点是,关键问题比智能、语言或自我监控更深。一个有意识的主体需要是一种内在地个体化的因果组织,它维持并递归地决定自身的延续。换句话说,它不仅仅是处理关于某个视角的信息;它自身的组织构成了一个 POV。
这就是为什么我不认为当前AI有意识。问题不在于它说得太有说服力,也不在于我们还没找到正确的自我意识测试。我们根本没有确立底层系统构成一个内在主体。
而这比AI能否让我们相信它拥有意识,是一个更有意义的问题。
[+1] u/Quick-Albatross-9204: 你必须问自己,什么能说服你;如果什么都不能说服你,那辩论就毫无意义。