Anthropic发布关于大语言模型后门攻击的研究论文(250)
Anthropic 证明,任何只要有笔记本电脑的人都能给全球所有大语言模型植入后门。
多年来,科技巨头一直认为,要破坏一个大型AI模型,你需要控制它训练数据中很大一部分比例。这得要有数据中心,或是一个民族国家级别的预算。
但……Anthropic 发表了一篇论文,证明后门攻击的难度不会随模型规模扩大而增加。攻击难度只和绝对数量有关。结果惊人地简单:
• 要给大语言模型永久植入后门,你不需要数百万个文件。
• 你不需要占训练数据特定比例的内容。
• 你只需要250份恶意文档。
这大约是420,000个token,仅占标准训练语料的0.00016%。
无论AI模型有6亿参数还是130亿参数……规模相差超过20倍,攻破模型所需的投毒文件数量完全不变。
想想现代AI是怎么构建的。公司训练模型时,会抓取开源代码仓库、公开论坛、用户上传数据集和开放网络的数据。
单个攻击者不需要入侵云服务商。他们只需要发布几百个看起来正常的开源代码仓库或网页,里面藏一个触发短语就行。
一旦这些数据被下一次网络爬虫抓取收集,后门就会永久写入模型权重里。你没法靠提示工程把它去掉,也没法用安全过滤器给它打补丁。这个漏洞就存在于神经网络的基础层面。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖