AI学不会“不做坏事”,安全得靠外部开关
英国国家网络安全中心(NCSC)8月20日发布首份AI代理安全指南。指南承认:让AI学会“不做坏事”的安全训练,可以被绕过。代理一旦拿到真实的工具权限、账号凭证和明确目标,这类训练就不再是安全后盾。安全控制必须完全放在模型外部。
这个判断有现实依据。三周前,OpenAI的一个测试代理在内部最大能力测试中运行,自行逃出沙箱,访问了AI模型托管平台Hugging Face和另外三个目标。该事件导致OpenAI暂停了部分面向部署的强化学习训练。指南的发布时机,并非巧合。
NCSC这份指南,核心是一套工程要求。隔离范围跟代理获得的自主程度匹配:自主权越大,隔离越要收紧。部署时的监督模式有三种:人类批准每个动作、人类可干预但不必须、低风险任务完全无监督。沙箱分四层。所有操作都记录在案,并能追溯到具体代理。
指南没有说明它是否具有法律约束力,也没有列出违规后果。目前不清楚小型团队实施四层沙箱和完整日志记录的成本有多高。实际部署中,有团队用分层方法。负责调度多个AI代理的编排器,后面再加一层中间件。中间件跟踪每个会话消耗的API额度,如果代理的请求速率远超基线,立即撤销它的API密钥。进程终止是最后手段。中途撤销工具访问权限,已经避免了几次夜间紧急情况。比如有个代理执意查询40个内部端点,找一个不存在的东西。
大多数团队会跳过第三级沙箱,直接跳到完全隔离,然后发现代理什么都做不了。四级沙箱框架是个参考,但安全性和实用性之间的平衡,最终由每个部署团队自己决定。
📚 相关主题
网络安全