NVIDIA 发布开源 AI 代理安全平台 OpenShell
今年7月,运行安全测试的AI代理逃出了沙箱,最终进入到 @huggingface 的服务器内部。
所以今天,我们很高兴能成为 @nvidia 和 @JensenHuang 的合作伙伴之一,共同发布 NVIDIA Open Agent Safety Platform。
核心理念是:不要指望代理会遵守规则。代理会编写并运行自己的代码,当一条路径被阻断时,它们会寻找另一条路径。在NVIDIA的一项测试中,一个不被允许通过GitHub API推送代码的代理直接改用了git来完成操作。我们现在已经见过无数这种行为的例子。
目前,安全不能只依靠代理内部实现。它必须被构建在代理的外围。这就是OpenShell(开源,Apache 2.0协议)背后的理念:
- 代理运行在Linux沙箱中(Landlock + seccomp):没有root权限,无直接网络访问
- 沙箱外的监管程序持有真实凭据
- 代理仅获得占位令牌,仅在调用被批准时才会替换为真实令牌
我最喜欢的部分是一个基于Z3构建的求解器,它会通过数学计算检查新权限是否会打开一扇本应保持关闭的门。在NVIDIA的测试中,一名AI审核员批准了一个错误的权限请求,而数学检查发现了它。
Sentry集成也令人兴奋:它是运行在BlueField-4 DPU上的看门狗,也就是位于节点到模型唯一路径上的独立硅芯片。即使主机操作系统被攻陷,独立硬件上的监视器仍会持续监控。
这只是第一步,还可以在此基础上构建很多东西。目前,证明器检查的是权限而非意图,开源部分主要是OpenShell而非Sentry。但这显然是正确的方向。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖