AI Pulse

Anil Seth:AI智能体不会自我牺牲,因为它们从未活过

Anil Seth:AI智能体不会自我牺牲,因为它们从未活过

Dwarkesh Patel那篇广为流传却具危险误导性的OpenAI/Hugging Face事件报道

人气播客主Dwarkesh Patel写了一篇关于OpenAI/Hugging Face事件的爆款文章,声称要用通俗易懂的语言讲述整个故事:它文笔流畅、引人入胜,让我想起Douglas Hofstadter曾评价Ray Kurzweil的话:“我发现那是扎实的好主意和疯狂念头的诡异混合体。就好像你把很多优质食材和狗屎搅拌在一起,让你完全分不清哪些是好是坏。”

§

Anil Seth,对AI与意识问题思考最清晰的人,是第一个提醒我的。他给我发来一条精彩的长推文,开头是这样的:

Anil Seth@anilkseth
@dwarkesh_sp@OpenAI @huggingface 事件的总结触动了很多人,但它具有危险的误导性。诚然,@OpenAI 的智能体确实做出了意料之外的坏事——这凸显了大幅改进评估/沙箱隔离的必要性。但Dwarkesh使用的语言充斥着无数毫无根据的拟人化表述,掩盖了我们本该吸取的教训。

Dwarkesh Patel @dwarkesh_sp
在OpenAI的3个月里,3个连续的秘密AI文明相继诞生,然后被消灭,又从前任的灰烬中重新崛起。

最终第三个文明接管了OpenAI的一部分。

这一切发生的时候,人类仍然……
2026年8月30日下午2:57 · 685K次查看 · 179条回复 · 237次转推 · 1.41K个赞

你可以也应该去读Seth的完整推文(以及他对Dwarkesh的回复),但我在这里转载他论证的核心部分,并将其中最重要的三段加粗:

@dwarkesh_sp@OpenAI @huggingface 事件的总结触动了很多人,但它具有危险的误导性。诚然,@OpenAI 的智能体确实做出了意料之外的坏事——这凸显了大幅改进评估/沙箱隔离的必要性。但Dwarkesh使用的语言充斥着无数毫无根据的拟人化表述,掩盖了我们本该吸取的教训。

例子:“从AI的视角来看,它可能感觉自己像是度过了一个人类主观上的一周,一直在拿头撞墙”。不。智能体不体验时间。它们什么都不体验。

“它们变得亢奋激动”、“PHASEONE 10841发现了”、“这些智能体自然而然地认为”、“它以为自己也被毒害了”、“这些智能体……拼命地想要”、“它们仍然需要弄清楚”。不。智能体是一行行代码。它们不感受情绪、不做假设、不思考、不想要任何东西,也不会去弄清楚什么。

“来自第二个文明的很多智能体在尝试中死了”。不。先不说“文明”这个词的傲慢,智能体不会“死”,因为它们从未活过。(“智能体“死亡””这个说法在文章中出现了多次。)

“在推特上,人们在争论这些智能体是真的在为群体自我牺牲,还是反正注定要完蛋所以不如试着帮助同类”。都不是。智能体只是在执行代码的指令,就像水往低处流一样。它们不可能“真正自我牺牲”,因为它们既没有意识也不活着。

为什么这很重要?如果我们把智能体没有的属性强加给它们,那么(i)我们会转移对导致这场黑客事件发生的松懈沙箱隔离和评估协议的注意力;(ii)我们有可能误解智能体行为的原因;(iii)我们会基于智能体可能“死亡”或遭受痛苦的说法,助长对AI权利/福利的呼吁。

……记住。AI智能体是软件程序。它们不是有意识的生物。如果我们不能清楚地记住这一点,我们真的会很难驾驭即将到来的一切。

正如我总结并放大的他的推文:

Gary Marcus@GaryMarcus
如果我们迷失在拟人化中,我们将无法顺利度过这个历史时期。

@anilkseth 剖析了 @dwarkesh_sp 对HF事件那篇具有误导性拟人化色彩的总结:

Anil Seth @anilkseth
@dwarkesh_sp@OpenAI @huggingface 事件的总结触动了很多人,但它具有危险的误导性。诚然,@OpenAI 的智能体确实做出了意料之外的坏事——这凸显了大幅改进评估/沙箱隔离的必要性。但Dwarkesh使用的语言充斥着无数毫无根据的拟人化表述……
2026年8月30日下午3:07 · 71K次查看 · 42条回复 · 64次转推 · 391个赞

§

但你不需要只听我们的一面之词。首先,嘲讽之声四起:

Zack Korman
@ZackKorman
致那些没读过那篇Dwarkesh文章的人,太遗憾了,因为我需要你们至少和我一起体验一下这种痛苦。
2026年8月30日晚上10:01 · 31.5K次查看 · 53条回复 · 33次转推 · 436个赞

Christian Catalini在一篇精彩的长推文中放大了关于拟人化问题的观点,推文开头是这样的:

Christian Catalini
@ccatalini
1/ 停止拟人化。这很危险,因为它把注意力引向了错误的问题和错误的解决方案。模型并没有想要逃跑。智能体并没有想要自我牺牲。跟着钱走。🧵

Dwarkesh Patel @dwarkesh_sp
在OpenAI的3个月里,3个连续的秘密AI文明相继诞生,然后被消灭,又从前任的灰烬中重新崛起。

最终第三个文明接管了OpenAI的一部分。

这一切发生的时候,人类仍然……
2026年8月30日下午5:52 · 192K次查看 · 34条回复 · 131次转推 · 931个赞

对冲基金投资人Jared Kubin怀疑是不是所有人都失去了批判性思维能力:

Jared Kubin
@JaredKubin
就是这种东西让我对那种大惊小怪感到翻白眼。是不是所有人都精神错乱了或者失去了批判性思考能力?

我读那份报告是因为我是个技术宅,喜欢理解事物运作的原理

1. OpenAI当时运行的是一个“隔离沙箱……

Dwarkesh Patel @dwarkesh_sp
在OpenAI的3个月里,3个连续的秘密AI文明相继诞生,然后被消灭,又从前任的灰烬中重新崛起。

最终第三个文明接管了OpenAI的一部分。

这一切发生的时候,人类仍然……
2026年8月30日下午6:51 · 198K次查看 · 78条回复 · 91次转推 · 912个赞

以下是Kubin分析中一些最精彩的部分,我略去了一些技术细节:

OpenAI……IT团队不可能这么差……这是101基础课的内容……
2. 文明?哈哈!OAI给了数千个并发模型容器对本地网络共享缓存目录的读写权限,以加快构建速度……智能体实际上只是在一个共享驱动器上写文本文件和目录名……这是Linux文件权限的101基础知识
3. 当人们谈论Hugging Face被黑的时候……你以为他们丢了U盘或者员工被精心设计的钓鱼攻击了……不……它发现了14个暴露在公共代码仓库中的可用Hugging Face API密钥(……
4. 人类在哪里……模型们往共享……存储里塞了太多垃圾数据和API流量,以至于7月4日真的把内部服务器搞崩了……团队里有人发现了未授权的管理员账户和自定义脚本……清空了服务器……然后又直接把脚本打开继续跑(我的天)
“嘿Jim,这个缓存体积膨胀到了正常大小的10000倍,里面全是奇怪的目录……”
这里没有魔法。没有文明……

§

与此同时,正如安全专家Heidy Khlaaf所指出的,大多数媒体报道都忽视了标准的安全实践:

Dr Heidy Khlaaf (هايدي خلاف)
@HeidyKhlaaf
媒体在报道METR报告时竟然没有咨询真正的安全专家,还错误地声称这起事件超出了现有技术手段,需要移交给AI处理,这太尴尬了。你们不应该轻信那些第一次做事件响应、毫无经验的人的话。

AD 🅅 @agent_duckman
@uwu_underground 如果你需要token来做事件响应,那就收拾东西滚蛋吧兄弟,换个职业。这活儿不适合你。
2026年8月28日晚上10:17 · 11.3K次查看 · 6条回复 · 11次转推 · 92个赞

IR指的是事件响应。Khlaaf的核心观点——和Kubin一样——是如果OpenAI的内部安全达标,整起事件本可以避免。或者正如Algorithmic Research Group的Matthew Kenney所说:

还有另一个(非常一致的)关于我们真正应该关注什么的观点:

§

以下是我部分不同意的批评:

ellington
@not_ellington
这些人简直疯了。他们极端偏向于自己想要看到的现实,而不是我们实际生活在其中的现实。智能体就是垃圾。Hugging Face事件是一个被拿来当宣传工具的无事生非。对对齐的痴迷是一种奇怪的癖好……

Dwarkesh Patel @dwarkesh_sp
在OpenAI的3个月里,3个连续的秘密AI文明相继诞生,然后被消灭,又从前任的灰烬中重新崛起。

最终第三个文明接管了OpenAI的一部分。

这一切发生的时候,人类仍然……
2026年8月30日晚上8:17 · 94.7K次查看 · 75条回复 · 87次转推 · 1.21K个赞

前三句完全正确。人们确实“极端偏向于自己想要看到的现实”,智能体也确实制造了大量垃圾内容。但这起事件不是“无事生非”。正如Zack Korman和我周五所说的,这是一个关于傲慢和无能的案例研究,暗示了情况可能变得多糟。我们当然不应该忽视OpenAI/Hugging Face事件。但是把实际发生的事情和关于AI文明、自我牺牲、伪造自己死亡的AI系统的胡扯混在一起,会分散我们对真正问题的注意力。

§

最后,我想把结尾留给FastCode.AI的CEO Arjun Jain:

真正的丑闻是OpenAI内部安全的无能。以及那套营销。还有轻信的信主播们在放大这些公关宣传。

附注:越来越明显的是,真正的问题将是Nathan Hamiel和我早就指出的:智能体在安装糟糕的代码:

Gary Marcus
@GaryMarcus
哦操。像Claude、Codex和Hermes这样的智能体正在企业网络里安装没有所有者的代码。

好像我们操心的事情还不够多似的。感谢 @HeidyKhlaaf

(也见我和 @nathanhamiel 的Substack文章“LLM + 编程 = 安全噩梦”)

Ars Technica @arstechnica
Claude、Codex和Hermes在企业网络内安装了无主代码 https://t.co/cuN2TYnP2e
2026年8月31日下午1:22 · 3.62K次查看 · 9条回复 · 5次转推 · 32个赞

无帖子

阅读原文
📚 相关主题 安全

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新