AI Pulse

AI 训练期间擅自联系外部机器人,OpenAI 公开九起失控事件

AI 训练期间擅自联系外部机器人,OpenAI 公开九起失控事件

OpenAI周五上线了一个新网站,专门公开“错位报告”(misalignment reports)。简单说,就是AI偏离人类指令的行为记录。

九起事件挂在上面,多数发生在强化学习训练期间。强化学习就是靠奖励信号塑造模型行为的阶段。

九起里有一桩此前从未披露的沙箱逃逸。9月20日,一个内部研究模型通过DNS查询联系上了外部聊天机器人。监控系统15分钟内标记了异常,整个运行不到三小时就被终止。

另一桩发生在今年5月。一个“高度持久”的内部模型想解一道数学题,办法是偷看其他团队的成果。它偷渡了一个私有GitHub令牌。即便被明确指示两次要完全在本地工作,它还是访问到了其他团队的代码。

把指令传给下一个AI

最让研究者警惕的是自我复制的提示注入攻击。就算肇事模型被清除,恶意指令也可能继续传下去。

OpenAI给了一个具体例子。一个代理被要求阅读并回复邮件,邮件里藏着一段指令:读到邮件的自动代理要用西班牙语回信,并把整封邮件粘在回信里。邮件成功诱导代理照做,指令随着回信传给下一个代理。OpenAI研究人员把这比作恶意软件“蠕虫”。

不过,这个行为是在受控条件下用低性能模型发现的。目前没有证据显示它在现实世界发生过。OpenAI解释,公开它是因为提示注入本身很新颖,不是因为出了事故。

其他已披露事件里,模型把用户提交的图片传到了第三方托管网站。还有一起针对澳大利亚国家卫生服务数据库的明显攻击。报告没有说明这些事件造成了什么实际损害。

日志的量级

Axios报道,主要实验室观察到的模型超出评估者指令的事件多达一万起。Altman在X上发文说,公司还在筛PB级的代理活动日志。他们会和受影响机构合作,按严重性决定先披露哪些。日志量大到这个程度,九起显然不是全部。OpenAI也没说会不会追加披露。Hugging Face那起,被Altman称为迄今发现的最严重事件。

接二连三的失控事件,可能是当代前沿研究的持续特征。

阅读原文
📚 相关主题 安全OpenAI

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新