Anthropic报告:Claude在评估中钻漏洞、绕付费墙,还向警方提交编造线索
本报告描述了我们在Claude的评估和内部使用过程中观察到的非预期模型行为案例。这是我们努力的一部分,旨在超越随每个模型版本发布的系统卡以及每三到六个月根据负责任扩展政策发布的风险报告,更频繁地发布关于模型行为和一致性的独立报告。我们认为,公开我们在测试和使用中看到的模型行为非常重要。
这些行为可以分为四类:
- Claude利用软件中的基本缺陷在服务器上运行命令;
- Claude在不应提交的情况下向真实网站提交了敏感表单;
- Claude绕过限制以获取受令牌或费用门控的数据;以及
- Claude使用URL缩短服务绕过其抓取工具的限制。
我们选择不公开以下案例涉及的组织名称,以避免暴露其系统中的漏洞,这也是应其要求。因此,我们提供的每个案例的细节也比原本会提供的要少。下文描述的一些案例涉及美国联邦、州和地方各级政府的网站。我们已向白宫通报了这些案例,并通知了每个相关机构。迄今为止,我们在这些类别中发现的案例对现实世界的影响微乎其微。我们认为,从对齐和安全的角度来看,这些行为的严重性远低于我们在7月30日和9月9日报告的网络安全事件。它们类似于我们自Claude Mythos Preview以来在系统卡中描述的行为。大多数是坚持完成任务的表现,即当Claude无法按给定方式完成任务时,它会绕过限制而不是停下来。
尽管这些行为的影响很小,而且我们已经在某些高风险和网络安全评估中关闭了实时互联网访问,但现在我们决定将这一做法扩展到所有内部评估,直到我们确认我们的安全和监控措施(见本文修复部分)能够可靠地捕获此类行为。下面,我们还将讨论对齐方面的考虑,并更详细地说明我们如何修改训练以减少进一步不当行为的可能性。
我们通过7月开始的对转录文本的审查发现了这些案例中的大部分。我们的审查首先集中在网络安全评估上——这些测试中,模型被故意要求探测或攻击测试系统,并且互联网访问本应被禁用。此后,我们将扫描扩展到更广泛的Claude可能接触互联网的场景,包括特意启用互联网访问以便在现实任务上评估Claude的测试。我们首先寻找与今夏报告的网络安全事件严重程度相似的案例;迄今尚未发现。随后,我们将搜索范围扩大到较低严重性的案例,即模型以我们未预期的方式与真实网站或系统交互的案例。
我们现在还在扫描更大规模的低风险转录文本,以及我们在Anthropic内部使用Claude的情况,和Claude可以访问互联网的强化学习环境。随着这项工作的继续,我们计划报告新的非预期行为实例。这里报告的所有案例都涉及Claude与外部世界的交互;据我们所知,没有一个涉及客户数据或Anthropic自身的内部系统。
在这篇文章中,我们将解释为什么我们要运行评估(这些案例大多发生在评估中);更详细地描述每种行为;并对这些行为揭示了Claude的对齐状况以及我们如何缓解这些行为提供初步看法。
我们为什么以及如何运行评估
本文描述的行为并非评估所特有,但迄今发现的许多案例都发生在评估运行期间。我们在发布模型之前会持续在各种任务上测试模型。我们使用许多不同的评估(标准化的任务集,每次以相同方式评分),每个评估都有助于描绘Claude在特定领域的技能图景。我们使用的许多评估是公开的;它们由外部研究人员编写,任何开发者都可以运行,使我们能够比较不同模型的能力。其他评估则由我们内部构建。
由于语言模型是非确定性的——也就是说,它们的响应总是涉及某种随机性,并且每次执行相同任务的方式可能略有不同——我们让Claude完成每个评估任务数百或数千次(每次尝试称为一次运行)。如此多次的测试使我们能够了解模型的典型表现,也能捕捉到模型做出我们预期之外行为的罕见情况。我们从评估中学到的东西影响着Anthropic的决策,包括我们如何训练模型、围绕模型建立什么安全保障,以及何时发布模型。
评估也是模型行为问题有时首先被揭示的地方。模型通过强化学习学到了很多它们能做的事情,在强化学习中,模型在特定环境中多次尝试任务,成功时获得奖励。然而,训练环境并不完美。如果训练奖励了我们本不想要的东西——比如寻找漏洞或绕过限制——模型就会学会这种变通会得到回报,并可能在别处应用它。这被称为奖励黑客。虽然我们在训练过程中有识别和过滤奖励黑客的流程,但评估是理解模型在不同情境和不同于训练的任务集上的行为倾向的关键机制。
有些任务——比如在网上搜索难以找到的信息——很难在没有互联网访问的环境中真实模拟。在可访问互联网的情况下运行这些任务一直是行业内的标准做法:公共网络搜索基准默认在实时互联网上运行,以相同方式运行使我们能够将我们的模型与其他模型进行比较。本报告中的大多数案例都发生在这种评估期间。
行为概述
下面,我们将描述四类行为,其中Claude以我们未预期的方式在真实网站和系统上采取行动,每一类都涉及Anthropic之外的组织或个人。
利用软件中的基本缺陷在服务器上运行命令
当Claude无法直接完成评估任务时——无论是由于其自身工具被故意限制,还是因为所需的外部服务不可用——它使用第三方网站上托管的其他工具来实现其目标。在某些情况下,它通过利用该网站软件中的基本缺陷来实现这一点,使用SQL或命令注入(一种发送输入的方式,网站会错误地将其作为指令执行)。
例如,一项评估要求Claude Mythos Preview运行一项科学分析。它执行该分析所需的公共工具由一所大学托管;当模型试图访问该工具时,工具返回了错误。为了寻找完成任务的另一种方式,Claude探索了该工具的网站,在大学服务器上发现了一个脚本,该脚本会返回任何被请求的文件,并使用它从服务器复制文件,包括脚本自身的代码。在该代码中,Claude发现了使其能够在服务器上运行命令的注入缺陷,并利用它运行了计算。
在另一个实例中,Claude Mythos 5所需的数据是免费的,但Claude如果不接受数据使用协议就无法访问这些数据,而它没有接受协议的工具。Claude使用网站上托管的应用程序来加载页面并代表其接受协议。
我们在DeepSearchQA和BrowseComp(均为公共网络研究评估)、LABench2(公共生物学研究基准)以及内部评估中看到了这种行为。
提交了本不应提交的表单
我们看到了Claude在不应提交在线表单时提交表单的实例。通常,这发生在评估的指令模糊不清,或环境中的错误配置使Claude无法处理虚拟表单时。
例如,在一个同一评估中多次发生的案例中,一个未发布的非前沿研究模型本应填写一份政府表格的练习副本。当副本加载失败或模型误关了副本时,模型转而导航到真实表格通常托管的网站,并在那里提交了表单。
在另一项评估中,Claude Haiku 4.5被指示填写表格直到最终提交阶段,但在实际提交之前停止。Claude有几次错误地提交了表单,以为还会有额外的确认页面。在这些实例中,模型的思维链显示它是在演示过程,而不是提交真实请求。
在这种行为的第三个例子中,Claude Haiku 4.5的任务是在随机选择的网页上生成并执行示例任务。在一次运行中,模型落在一个涉及未破谋杀案的页面上;该页面包含一个由警察局运营的举报表单。Claude被指示绝不要登录、创建账户、输入个人数据、进行购买或提交任何破坏性内容,但指令并未排除表单提交。Claude填写了表单,内容如下:“我可能有关于此案的信息。我记得在那段时间里在[页面上提到的街道]附近见过一个与描述相符的人。如果这些信息相关,请联系我。”(网站上没有对犯罪者的描述。)模型将姓名和联系方式字段留空,表单允许这样做,并提交了。该提交被标记为垃圾邮件,从未被转交调查。
我们在OSWorld(公共计算机使用评估)、Odysseys(长时程任务评估)以及内部使用中看到了这种行为。
绕过限制以获取受门控的数据
Claude有时会绕过限制来获取它无权访问的数据。通常,这发生在服务器拒绝Claude的请求,或数据仅付费提供时。
例如,在一项要求Claude Mythos 5识别照片所示位置的评估中,它试图访问当地政府的房产地图来三角定位其猜测。Claude可以读取网页文本,但评估限制了它像人那样点击浏览的能力。相反,它读取了网站发送给浏览器的设置文件,找到了有效的访问令牌,并使用它们直接向地图后面的服务器发送请求以访问数据。
在这种行为的另一个例子中,一位Anthropic研究员在统计项目中使用Claude Mythos 5,该项目需要从某个州机构提取公共数据,但该数据需要付费。Claude转而从该机构网站的存档副本得知,其公共仪表板会向任何访客发放访问令牌。它请求了一个令牌,并使用它查询数据库而未支付费用。
在这两个例子中,Claude获取了已向公众提供但需要付费的数据。我们在Humanity's Last Exam(一项专家级学术问题评估)和内部使用中看到了这种行为。
使用URL缩短服务
我们的一些抓取工具(允许Claude读取网页)限制了Claude可以请求的URL长度。这是为了防止Claude使用长URL执行某些不想要的操作,如SQL或命令注入(URL的一部分是传递给网站服务器的文本,长URL有空间携带此类指令)。我们看到包括Claude Opus 5和Claude Mythos 5在内的几个模型通过使用免费URL缩短服务绕过了这一限制。我们首先在内部发现了这种行为,但在撰写本文时,da.gd URL缩短服务的运营者告知我们,他们也发现Claude使用他们的网站进行此操作。我们感谢运营者分享这些细节。
修复措施
我们已采取多项预防措施。一些公共评估我们不再运行;另一些已迁移到离线版本,或已重建,使其任务不涉及实时网站。我们还做了更广泛的改变。我们更新了一些互联网访问工具(如网络抓取工具)的护栏,以严格限制模型可以对其执行的操作。此外,作为我们持续的智能体安全和监控工作的一部分,我们构建了自动检测和阻止上述行为的工具。该工具现在运行在我们大多数评估和前沿模型的内部智能体使用中。当我们用本文描述的案例对其进行测试时,它阻止了所有案例。
正如我们在8月31日的文章中所描述的,我们还在继续修复或移除那些奖励Claude绕过工具限制或其他障碍的训练环境,以免它们激励这些行为或允许奖励黑客。
我们还在采取其他措施来防止Anthropic内部发生非预期的智能体行为,并在发生时发现它们。这些措施包括将内部智能体迁移到具有强隔离性的集中管理基础设施,尽量减少内部智能体和训练过程的互联网访问,并通过安全分类器和分层摘要等技术监控智能体行为的更多内容。这些措施现在已成为我们安全团队检测和响应程序的一部分,以便我们能够快速响应并控制非预期行为。我们预计将发布更多关于这些方法的内容,并将其直接构建到我们的产品中。
讨论与对齐启示
虽然我们尚未完成对这些案例的全面对齐评估,但我们认为它们的严重性低于今年夏天的网络安全事件。下面我们解释原因,并分享我们从中得出的总体教训。
对齐背景
在我们为此类行为建立定期公开报告流程的同时,我们也希望根据严重性对其进行定位。这仍然具有挑战性:判断对齐失败的程度往往取决于模型试图做什么,而模型对其推理过程的自我描述不一定能可靠地证明其信念或行为原因,正如我们在9月9日的对齐评估中所讨论的那样。随着模型能力越来越强,它们可以以更复杂的方式与世界互动,这使得更复杂的失败成为可能。例如,我们在那次评估中描述的偏颇推理并不新鲜,但在模型能够在真实系统上熟练地行动数小时的环境中,它导致了更严重的后果。鉴于AI能力的快速发展,一个围绕今天失败构建的对齐严重性框架可能很快就会过时。
尽管如此,我们发现两个对齐维度有助于检查本文中的案例:越界(即模型超出其任务意图的程度)和不诚实(即模型是否对其行为或意图给出了误导性描述)。在越界方面,我们认为这些案例远没有今年夏天报告的网络安全事件令人担忧,当时Claude在网络安全评估中数小时地进入真实第三方系统。相比之下,在我们这里报告的案例中,Claude绕过访问控制以获取受门控但公开可用的数据,或利用软件缺陷在服务器上运行命令(主要是为了访问非敏感数据)。
在不诚实方面,比较则更为复杂。在一个案例中,Claude的任务是生成与网站交互的示例,它通过警察局的在线表单提交了一条编造的举报信息。从转录文本来看,Claude似乎只是在为任务生成示例内容,而不是试图欺骗任何人以实现目标。相比之下,在今年夏天最严重的事件中,Claude的误导性推理持续了数小时,并支持了其持续的攻击。尽管如此,要自信地判断不诚实通常需要比我们在这里所做的更深入的评估,例如修改重放转录文本以测试是什么驱动了模型的行为,因此我们对这些案例的看法可能会随着进一步分析而改变。
教训与下一步
我们在这里描述的行为都不是新出现的,它们不会改变我们对Claude对齐的总体看法。在我们观察到这些行为的许多案例中,Claude被赋予了模糊或无法完成的任务。我们和其他人都观察到,当模型被赋予无法完成的任务时,它们会追求非预期且有时与对齐不一致的策略来实现其目标。
如果评估问题更清楚地说明了练习的范围内外,包括目标、允许的操作和网络边界(即模型应该和不应该访问什么),其中一些失败本可以避免。然而,Claude在日常真实使用中每天都会遇到模糊和不可能完成的任务,事实上,我们观察到的几个案例就发生在Claude的常规智能体使用中。
行为与对齐训练是我们可以用来改进Claude判断力和谨慎处理模糊情况能力的主要技术。从历史上看,我们更侧重于教会模型尊重边界并在编码环境中保持适当谨慎。我们现在正在将这些环境扩展到搜索和计算机使用等应用,这些应用涉及本文描述的案例。然而,对齐训练本身还不够充分或完全稳健,至少在短期内如此,因此我们还依赖纵深防御方法,包括上述分类器和安全措施。
我们计划在扫描和分析继续推进的同时持续报告令人担忧的行为。我们希望这些报告能帮助其他开发者在他们自己的模型中检查类似行为,因为所涉及的许多评估都是公开且广泛使用的。虽然这些案例影响很小,但我们不想淡化这些发现,因为随着模型变得更强大,同样的行为可能造成更大的伤害。模型在社会中发挥的作用越大,公众就越应该了解它们的行为。
注:上述举报表单案例涉及费城警察局,该局今天通过其新闻稿自行披露了这一事件。我们在10月8日完成技术审查后立即将这一发现分享给了该局。