AI Pulse

大模型或触及网络能力门槛,AI公司放慢扩展加强监控

大模型或触及网络能力门槛,AI公司放慢扩展加强监控

一次事故,先停掉推理

OpenAI与Hugging Face发生了一起事件,细节没有公开。它加剧了对AI系统风险的担忧,也让Anthropic很快做出反应。

事件发生后,Anthropic暂停了研究集群里前沿模型的推理。凡是可能执行代码、或能通过工具访问互联网的运行,一律先停。之后它恢复了一条更有限、更安全的代码执行路径,再逐个工作负载判断能不能安全恢复。Anthropic说,未来几周会发布一份技术报告,总结这次事件中学到的东西。

Astra可能具备关键网络能力

让公司暂停更大规模训练的,是它对自家模型能力的判断。Anthropic拿到初步证据,认为即将推出的Astra可能达到关键网络安全能力的门槛。这个门槛来自它的准备框架。8月7日,公司做出这个判断。措辞一直留有余地,用的是“可能”。

此后,Astra使用工具时的所有推理都要额外监控,不只是训练和评估环节。涉及Astra或网络模型的工作负载,被要求用最高级别的安全保障。大量Astra训练和评估工作负载仍然暂停,直到完全迁移到新环境、满足新的安全标准。安全和对齐类工作负载优先迁移。

Anthropic没有说明Astra具体能做什么,也没解释“关键网络安全能力”具体指什么。能确认的是,在它眼里,这套能力一旦被恶意利用,后果相当严重。不然它不会上最高级别的保障,还把训练停在那里。

训练放缓,要求更严

因为这次评估,Anthropic暂时放慢了模型扩展速度。准备部署的最新模型,强化学习训练暂停了两周。规模最大的计划前沿强化学习运行仍然搁置,只做小规模训练和评估。

整个训练过程现在都要求更强的对齐证据。每个阶段都要证明模型行为符合设定,不能只靠事后检查。Anthropic承认,现有准备框架不够用。需要一套更广泛的方法,在它之上延伸并超越。

它的保障体系分三块:监控、对齐、安全措施。监控负责发现并响应可疑行为。对齐用来降低有害或未经授权行为的可能性。安全措施限制AI系统能访问和影响的范围。

隔离、监控与30分钟警报

安全措施的调整很具体。执行模型生成代码或不可信代码的工作负载,现在必须放进更强的隔离沙箱。高风险和不可信工作负载与互联网隔开。就算单个负载被攻破,也拿不到互联网或其他内部网络的访问权限。环境中可能被攻击的共享服务被移除,常驻权限减少,安全边界也做了改善。

Anthropic还在投资自动化,用模型持续测试安全边界,模拟攻击检验防护。它预计,模型很快会驱动大部分安全工作,包括防御其他模型。

监控是多阶段的。监控从激活分类器开始。一旦发现可疑信号,就升级到更复杂、计算量更大的自动化调查器。可疑活动被系统发现后,目标是在30分钟内发出警报。一旦系统识别出可能违反关键安全边界的行为,就生成最高优先级警报。负责安全、安保和研究的三个团队会立刻被召集起来。30分钟内确认不了是误报,就暂停相关活动。

这套监控覆盖所有涉及工具使用的强化学习训练和评估。适用对象是Sol能力或更高的模型。

算力成本与下一步

对齐技术上也有调整。最强模型上的强化学习运行,现在把核心对齐技术用到更多训练阶段。具体是改进奖励模型、训练模型更诚实、减少奖励黑客行为。奖励黑客就是利用奖励、评分器、工具或监督漏洞的行为。

Anthropic计划在不久的将来公开更多对齐研究。它还要发展准备框架,把这些保障整合到训练和部署的全过程。它打算引入外部组织参与,分享更多方法。

这套保障有直接成本。Anthropic估计,监控开销约占被监控推理计算量的20%。这笔开销由谁承担,公司没有说明。

阅读原文
📚 相关主题 安全OpenAI

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新