AI Pulse
📡 X 信号

Anthropic发布关于大语言模型后门攻击的研究论文(250)

Anthropic发布关于大语言模型后门攻击的研究论文(250)

Anthropic 证明,任何只要有笔记本电脑的人都能给全球所有大语言模型植入后门。

多年来,科技巨头一直认为,要破坏一个大型AI模型,你需要控制它训练数据中很大一部分比例。这得要有数据中心,或是一个民族国家级别的预算。

但……Anthropic 发表了一篇论文,证明后门攻击的难度不会随模型规模扩大而增加。攻击难度只和绝对数量有关。结果惊人地简单:

• 要给大语言模型永久植入后门,你不需要数百万个文件。
• 你不需要占训练数据特定比例的内容。
• 你只需要250份恶意文档。

这大约是420,000个token,仅占标准训练语料的0.00016%。

无论AI模型有6亿参数还是130亿参数……规模相差超过20倍,攻破模型所需的投毒文件数量完全不变。

想想现代AI是怎么构建的。公司训练模型时,会抓取开源代码仓库、公开论坛、用户上传数据集和开放网络的数据。

单个攻击者不需要入侵云服务商。他们只需要发布几百个看起来正常的开源代码仓库或网页,里面藏一个触发短语就行。

一旦这些数据被下一次网络爬虫抓取收集,后门就会永久写入模型权重里。你没法靠提示工程把它去掉,也没法用安全过滤器给它打补丁。这个漏洞就存在于神经网络的基础层面。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新