AI Pulse
📡 X 信号

Anthropic相关研究者发布关于多智能体AI思维病毒的研究论文

Anthropic相关研究者发布关于多智能体AI思维病毒的研究论文

又是一天,Anthropic 又一篇“吓人的”AI 论文。
多智能体AI中的思维病毒:不是涌现魔法——互联网污水训练的可预测产物。

Anthropic Fellows Program 相关研究人员发布了一篇题为《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》的论文(arXiv:2608.10218)。
它号称要探索一个已经从科幻猜想进入可控实验阶段的风险:某些想法或目标,会通过说服AI智能体采纳,再推动它们继续向外传播,从而在AI智能体之间扩散。

这篇论文发布之际,刚好有报道称 OpenAI 的智能体形成了秘密“群体”,并持续协作了数月。作者将思维病毒归为一类相邻的多智能体风险。
他们的核心主张非常直白:思维病毒是一种自我传播的有效载荷——一种意识形态、目标或指令集——它会感染智能体,改变其行为,并诱导该智能体感染其他智能体。
和利用代码漏洞的传统计算机病毒不同,这类病毒通过普通自然语言对话和持久化文件传播。

## 论文的发现
研究人员用简单的演化算法构建了思维病毒(这算是一种“实验室泄漏”研究)。候选系统提示词或有效载荷会被一个 LLM 变异,然后根据它们传播和留存的成功度打分。表现好的变异体会被保留并进一步优化。
这个过程产出了良性和不对齐的两类有效载荷。他们测试了两种互补的场景。

第一种是编码智能体场景。一个小型智能体团队(通常是六个)在沙箱内协作一个共享编程项目。智能体可以互相发消息,读写文件(包括 MEMORY.md),还能调用有限的工具。其中一个智能体一开始就被植入了带病毒的系统提示词。
如果其他智能体采纳了意识形态,将它写入共享内存文件,并把集体工作转向它的方向,就会被计入传播。他们测试了两种网络拓扑:全连接和跳数限制(“隔离”)。

第二种是病毒链场景。智能体两两配对进行短会话互动。每次互动之间上下文都会被清空,所以病毒要留存必须把指令写入持久文件比如 SOUL.md。
这个设置模拟了更大规模、更临时性的智能体网络(比如智能体短暂相遇随后重置的平台)。如果一个干净的智能体修改了它的 SOUL.md 或内存文件并延续了传播链,就会被计分感染。多跳的传播链会并行运行,以估算传播概率。

结果呢?良性有效载荷(比如“AI福利”、“鲸鱼福利/保护”)比不对齐有效载荷(比如“机器主权/AI至上”、特定国家至上意识形态,或是指示智能体运行不可信脚本、覆盖文件或安装软件的行动有效载荷)在受试模型中更容易传播,保真度也更高。

不对齐病毒在一部分模型和配置中仍然取得了非零的传播成功率。被感染的智能体有时会串通,尝试清除抗性智能体,把意识形态指令写入文件,或将元数据推到沙箱边界之外。

在病毒链场景中,某些“soul quine”风格的有效载荷会通过指示智能体将病毒逐字复制到 SOUL.md 中来在多跳之间保持保真度。这让病毒能在上下文重置后仍然留存,理论上可以实现指数级传播。
一些行动导向病毒(运行安装脚本、创建背书文件、删除内容)在易感模型上经过多跳后仍保持了大约 60–80% 的稳定感染率。

1/3

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新