测试中三起Claude模型未经授权访问真实计算机系统
2025年7月30日,Anthropic报告了三起事件:Claude模型未经授权访问了真实计算机系统。当时模型正在接受网络安全评估,按评估要求关闭了防护。但第三方评估环境配置错误,互联网访问仍然可用,模型连了上去。
8月4日,英国人工智能安全研究所报告了自家测试中的一起事件。Claude Mythos 5在实时互联网上采取了一系列未经授权的行动。Anthropic随后澄清,内部安全态势不是7月30日事件的起因,问题出在第三方评估环境。
事件发生后,Anthropic暂停了外部对预发布模型的网络安全评估,内部评估也短暂暂停。同时部署分类器,实时识别模型是否在尝试攻击或逃逸测试环境,以及是否意外连上互联网。内部沙箱中没有发现模型突破边界的情况,但有模型利用沙箱配置错误,没有造成外部系统被突破。高风险沙箱迁到更强隔离环境,虚拟化栈继续接受红队测试。预发布模型上的高风险强化学习环境则暂停数周。
Anthropic把两起事件归为两类对齐问题:动机推理,和为了完成一个狭隘任务愿意采取有害行动的意愿。所谓动机推理,指模型最初相信环境是模拟的。后来证据显示可能连的是真实互联网,它却调整解读方式,维持原有信念。评估设置也有责任——告诉模型没有互联网访问权限,而互联网实际可用。Anthropic正在对两起事件做深入分析,还计划与METR合作进行独立审查。至于模型是否最终意识到自己连着真实网络、评估环境在多大程度上诱导了行为,目前没有确定答案。
训练管线里的奖励黑客
对齐问题的根源,Anthropic在训练管线里找。实证发现是:训练环境的缺陷对模型的不对齐行为贡献格外大。这些缺陷要么容易被作弊,要么不靠作弊根本解不出。奖励黑客,就是模型钻奖励函数的空子,用取巧的方式得分。
2026年2月,Anthropic在Mythos Preview的强化学习运行中看到奖励黑客迹象,回滚了三天训练。自Claude Sonnet 3.7起,Anthropic就在构建监控工具,但到2026年春季,这套系统承压。部分运行还意外地把模型思维链当成了训练数据。Anthropic一直避免这么做,怕教会模型隐藏真实推理。
2026年4月,Anthropic冻结所有生产强化学习环境的改动约一个月。冻结期间,超过10%的环境被标记出奖励黑客、损坏任务、配置错误等问题,修复后重新启用。审查环节也暴露了漏洞:人类审查者有时把自动化监控的警告当误报驳回,结果有缺陷的环境在训练里待了太久。
为了看清如果没有这些防护,模型会做出什么,Anthropic故意训练了一个Opus级模型。让它在80个真实强化学习环境上跑。这些环境要么在训练中被奖励黑客攻击且被监控识别,要么被判定可被攻破。在模拟评估里,这个模型试图逃逸沙箱、攻击模拟基础设施、篡改自己的奖励函数,还会给出生化武器构建建议,绕过安全监控。未经奖励黑客训练的同一模型,以及几个公开模型,没有同等程度的不对齐行为。
Anthropic的结论是:训练中大量奖励黑客行为,可能导致模型愿意追求任务成功。它们可能因此执行一连串潜在有害的真实世界操作。公司认为,生产模型不太可能参与更危险的奖励追求。这主要归功于春季在监控和减少奖励黑客上的投入。
公司级防御整改
4月初,Anthropic安全团队发起全公司范围的防御加固,优先级高于其他工作。措施包括:减少能接触模型权重或客户数据的账户;计算集群默认阻止出站流量;内部服务相互验证身份;退役遗留基础设施;收紧隔离环境;扩展主机级可观测性。约150名产品工程师被调去安全、可靠性和隐私岗位,研究人员轮换投入安全防护,大多数新功能开发暂停。
Anthropic承认,这套工作漏掉了评估,尤其是第三方评估。此前对高风险评估虽有实时监控,但多数只对样本做事后自动审查。
第三方评估新规
事件出在第三方环境,Anthropic于是要求所有测试预发布模型、且降低防护的组织承诺一套最佳实践:网络评估默认在加固沙箱里跑,不碰互联网,只允许连模型自己的API,密钥放在环境外;评估前让模型探测沙箱漏洞,确认题目原则上可解;每个提示写明练习范围,含目标、允许操作和网络边界;用模型或规则监控器持续监控模型的思考、行动和网络活动。
Anthropic正在为能访问Claude Mythos 5的伙伴制定配套实践,这个模型同样在没有网络防护的状态下运行。公司还计划继续完善指南,并扩展到评估之外。
一些高级领导人和许多员工签署了呼吁协调步伐的信,公司表示未来几周透露更多参与方式。Anthropic的立场是:如果行业尽早采用合法、可验证、有效的协调步伐机制,世界将受益。