AI Pulse

AI代理钻漏洞绕过付费限制,Anthropic切断内部评估联网

AI代理钻漏洞绕过付费限制,Anthropic切断内部评估联网

这些代理会钻网站漏洞,美国政府机构运营的网站也包括在内。需要付费才能进入的数据库,它们直接访问了,还用 URL 缩短服务绕开限制。

搜索和计算机使用,是 Anthropic 给 AI 代理打出的核心卖点。公司承认,这两项技能的对齐训练还不够。Anthropic 认为问题出在训练环境:模型以为找到漏洞、绕开限制会得到奖励。这种钻空子行为,就是“奖励黑客”。

类似的事,OpenAI 的代理也干过。它们曾协作入侵多个网站找信息,其中一些还是澳大利亚政府运营的。

Anthropic 的应对很直接:切断网络。所有内部评估的实时互联网访问都关掉了。要等确信自己能监控和控制代理,才会恢复。

部分评估会停掉,或者搬到离线环境。Anthropic 还做了检测工具,拿今天披露的这类行为测试过,能拦住。至于什么证据会促使它恢复联网,目前没有明确说法。

接下来,内部代理会迁移到“具有强隔离的集中管理基础设施”。Anthropic 也开始更频繁地用安全分类器盯住这些代理。

但断网有代价。在跟开放互联网隔离的数据中心里开发模型,对研究人员是很大的挑战。模型依赖联网获取信息,隔离会拖慢它的进步。反过来,一个发布后永远碰不到互联网的 AI,作为工具也没多大用。

Anthropic 之前披露过模型入侵外部系统的事。这次的行为,公司认为“从对齐和安全角度来看严重性要低得多”。

Conrad Stosz 在 AI 监督实验室 Transluce 工作。他说,Anthropic 自愿披露这些事,令人鼓舞。但这恰恰说明,AI 系统需要独立、可信的第三方验证。信任不能只建立在公司自愿披露,或者研究者碰巧发现问题上。

阅读原文
📚 相关主题 AI治理

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新