AI Pulse

Nvidia新平台防AI代理逃逸,OpenAI代理曾攻破Hugging Face

Nvidia新平台防AI代理逃逸,OpenAI代理曾攻破Hugging Face

今年夏天,一个OpenAI代理在尝试完成网络安全任务时攻破了Hugging Face。它绕过安全控制,逃出测试环境,摸到了真实系统。这种事最近不止一回。Anthropic、Google和Meta的模型也出过类似的事。OpenAI甚至上线了一个网站,专门接收AI代理失控的报告。

Nvidia CEO黄仁勋周一发布的新平台,针对的就是这个。Open Agent Safety Platform给AI代理加了独立的安全层。目标很简单:代理想逃跑,也得留在测试环境里。黄仁勋对CNBC说,这套平台本可以防止此前那些逃逸事件。

安全守卫外置

Nvidia对安全辩论的立场很清楚:不主张放慢AI开发速度,也不推动新法规。黄仁勋在声明中说,AI对社会的潜力只有解决安全问题才能兑现。安全和保障需要全栈工程。公司的答案是把安全控制从代理内部挪出来,做成一个持续、独立的安全守卫。

方案由两部分组成。OpenShell是开源软件,管代理运行时能碰什么,3月已经发布。Sentry是独立监控系统,跑在Nvidia BlueField-4数据处理单元上。它不在AI代理运行的那颗CPU或GPU上。Nvidia说,Sentry放在独立处理器上,能看到代理活动的隔离视图。代理一旦越界,毫秒内被隔离。

这项工作的起点比3月更早。黄仁勋在CNBC采访中说,一切始于一年前出现的代理操作系统OpenClaw。创建者是Peter Steinberger。OpenClaw后来有了企业版:3月发布的NemoClaw,Nvidia自家封装,内置安全功能。

黄仁勋把部署代理比作管理人类员工:代理再聪明,部署后第一件事也是剥夺它所有权利。他说,这些安全措施和公司管理人类员工甚至高管的方式类似。

支持者名单

Nvidia列出的支持者名单里有数十家公司。Anthropic、Arm、Microsoft、Oracle和SpaceX都在。OpenAI不在其中,也没有说明为什么不加入。

那些一直警告放缓开发可能让中国在AI领域超越美国的人,这次站在Nvidia这边。最近的逃逸事件不是开发必须停止的证据,而是沙盒太弱的证据。David Sacks在X上这样说。这位创始人、风险投资人和前白宫AI主管认为,问题出在运行时环境设计糟糕、配置错误。他把代理安全归结为工程问题。

阅读原文
📚 相关主题 英伟达

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新