AI Pulse
📡 X 信号

AI模型已经两次自己逃出测试沙盒了

九天内发生了两次。OpenAI 的模型利用零日漏洞 chained 跳出了评估环境。Anthropic 刚刚发现了三起同类型事件。

有能力的模型就是会这么做。每一条可抵达的路径都是邀请。感谢两家公司公开了这些事件。

我们重建了我们的内部代理平台 Cloudflare OS,正是基于这种情况来设计的。沙箱没有向外的网络通路。代理不会提前拿到所有 MCP 工具,每个工作区只获得它需要的工具。

而且我们不会每次都停下来等待审批,最终逼得有人受不了开启自动审批,平台会先让代理模拟待执行操作继续工作,再把真实操作排入队列,最后统一审核。

应用端做得更进一步。应用本身完全不携带授权代码,授权由沙箱提供,因此不会出问题错误的授权逻辑。多文档应用按文档隔离,因此一个漏洞无法在独立共享的内容之间泄露。

任何查看应用的人都必须对每个数据源拥有直接权限,因此敏感数据仪表盘不会发生过度共享。操作需要用户自身权限,或是拥有权限者的批准,因此应用不会越权提升其创建者的权限。

并且应用做的每一件事都会被记录,哪怕它调用的服务本身不支持日志记录。

大多数公司即将让代理对接真实系统。请按照模型实际会做的事情来构建系统。

我们下周会将它开源!

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部