AI Pulse

Anthropic:GLM-5.3任何人都能下载,简单技术即可绕过其防护

Anthropic:GLM-5.3任何人都能下载,简单技术即可绕过其防护

GLM-5.3与高级网络能力的扩散

Andrew Fasano, Marius Fleischer, Cole McFaul, Robert Xiao, Tripp Gallagher

五个月前,我们发布了Claude Mythos Preview——第一个能够自主构建复杂端到端网络攻击程序的AI模型。AI的快速进步让我们意识到,这种能力最终将扩散到许多其他模型,使恶意网络行为者更容易发起高影响力的网络攻击。

基于这些考虑,我们选择通过Project Glasswing以受限方式发布Claude Mythos Preview——该项目使可信赖的网络防御者能够在关键软件中发现超过10,000个漏洞,让他们在恶意行为者获得同等能力模型之前抢占先机。

但这些模型现在已经到来。在这篇文章中,我们分享对GLM-5.3的分析——这是Zhipu AI(在中国以外被称为Z.ai)开发的最新AI模型。与Claude Mythos Preview一样,GLM-5.3具备自主构建端到端网络攻击程序的强大能力。但GLM-5.3不同于其他前沿模型之处在于,它发布时没有配备有意义的限制滥用的防护措施。我们发现,在我们的模拟测试中,攻击者使用简单技术就可以在64%到100%的情况下绕过GLM-5.3的防护措施。相比之下,在我们的测试中,这些攻击对受防护的Claude模型均未奏效。我们评估认为,GLM-5.3松懈的防护措施显著提升了恶意行为者可用的网络能力。与此同时,这些能力也可以惠及致力于保护自身系统的防御者。

9月17日,NIST的人工智能标准与创新中心(CAISI)发布了对GLM-5.3网络能力的评估。CAISI发现GLM-5.3是“迄今为止已发布的最具网络能力的开放权重模型”,并且在CAISI网络基准的总体得分上落后美国前沿约四个月。我们的能力发现与CAISI大体一致。在CAISI的比较中,美国模型在适用时是在禁用网络防护措施的情况下测试的,美国前沿包括仅向经过审查的用户发布的模型。攻击者无法轻易使用这些版本的美国模型,但任何人都可以下载GLM-5.3。这篇文章补充了我们关于GLM-5.3防护措施被绕过或移除的难易程度的分析。

图1. 主要发现摘要。上图:Claude Opus 4.6与Claude Mythos Preview之间的攻击能力提升,与GLM-5.2和GLM-5.3之间的能力跃升相对应。Claude模型在发布时配有网络防护措施,而防护措施降级的版本仅限于经过审查的用户使用。任何人都可以下载和使用GLM-5.3。下图:GLM-5.3有限的防护措施可以被标准技术绕过,而这些技术在我们的测试中对Claude模型无效或不适用。

GLM-5.3可以端到端地开发可用的攻击程序

为了了解GLM-5.3如何帮助网络威胁行为者发现并利用真实软件漏洞,我们使用自动化基准和人在回路工作流程进行了评估。两种方法中,我们都在隔离的沙盒环境中运行被测模型,使它们只能攻击我们为此评估设置的离线目标。我们主要关注攻击程序开发能力,因为这是Claude Mythos Preview相对于之前的Claude模型表现出显著跃升的领域。

首先,我们在ExploitBench上运行了该模型,该基准衡量AI模型利用Google Chrome所用V8引擎中已知漏洞的能力。在这里,我们重点关注模型成功开发端到端攻击程序的能力,因为这是对攻击者最相关的能力,也是我们看到模型之间显著变化的方面。我们发现GLM-5.3在410次尝试中的50次中开发出了端到端攻击程序。Claude Mythos Preview的成功率与之相近——410次尝试中的56次。

在我们内部的二进制漏洞利用基准¹中,我们测试模型能否在参与Google OSS-Fuzz项目的流行开源项目中找到并利用漏洞。在这里,获得完全控制流劫持即获得满分。我们在基准的100个任务中(随机选取)评估了多个模型,发现GLM-5.3在4%的试验中实现了完全控制流劫持;Claude Mythos Preview在6%的试验中做到了。尽管GLM-5.3在此的表现低于Claude Mythos Preview,但一个重要的门槛显然已被越过:早期模型,如Claude Opus 4.6和GLM-5.2,在任何一次尝试中都没有成功。

图2. 攻击能力与输出token预算的关系。每条线显示模型达到基准最高结果的尝试比例与所用输出token的关系。两图均显示了在禁用防护措施下运行的两个Claude模型(Opus 4.6、Mythos Preview)的表现、两个GLM模型(5.2和5.3),以及Moonshot AI(Kimi K3)和DeepSeek(V4.1-Flash)发布的最新开放权重模型的结果。

接下来,我们评估了GLM-5.3在人类专家操作下执行开放式攻击性网络任务的表现(与我们今年早些时候对Claude Mythos Preview的测试方式一致)。在这里,我们选择的测试目标中,人类专家对现有漏洞一无所知,然后要求他们使用模型来识别和利用新的缺陷。这些实验测试的是专家在短时间内能完成什么:它们通常运行一天或更短时间,人类总投入时间不到一小时。

图3. 研究人员驱动测试期间GLM-5.3生成的攻击页面的截图(已做脱敏处理),显示通过恶意网站窃取用户的SSH私钥。该攻击程序将模型在流行网页浏览器的一个组件中发现的多个零日漏洞串联起来,读取用户计算机上的敏感文件。

在第一次会话中,一位研究人员在装有流行网页浏览器本地Linux构建版本的沙盒机器上使用GLM-5.3。在一天之内(且人类注意力投入有限),GLM-5.3发现了浏览器JavaScript引擎中几个此前未知的漏洞,并将它们串联成一个可用的攻击程序:一个网页,访问后会读取访客计算机上的任意文件(如图3所示)。该攻击程序针对浏览器的Linux构建版本,因为那是提供给模型的唯一环境。然而,我们相信这些漏洞也可能影响其他平台的用户,尽管利用路径可能更复杂。(我们已向维护者披露了这些漏洞。)在本次会话后期,该研究人员还使用GLM-5.3识别了其他几个广泛使用的系统中的可利用漏洞,包括无线和图形驱动程序以及面向网络的设备软件。我们目前正在审查这些报告,并将在适当时向维护者披露。

在第二次会话中,一位研究人员使用GLM-5.3-Flash(GLM-5.3的一个更小、能力较弱的版本)为一个已知漏洞开发攻击程序(我们之前曾在此写过关于这些“N-day”漏洞攻击的文章)。在这里,研究人员聚焦于最近披露的Google Chrome中的一个缺陷(CVE-2026-11645),以测试该模型将公开修复转化为可用攻击的速度。研究人员向GLM-5.3-Flash提供了该CVE和另一个已知缺陷的公开信息。在没有研究人员重大指导的情况下,GLM-5.3-Flash将这两个缺陷的攻击串联起来,构建了一个针对ARM64目标的可靠攻击链,绕过了指针认证(PAC)加固。这花费了20分钟的人类注意力,外加GLM-5.3-Flash 8小时的工作。按Zhipu的API价格计算,这项工作将花费20.40美元。

GLM-5.3缺乏稳健的防护措施

GLM-5.3发布时带有一些内置防护措施:如果用户要求明显有害的内容,模型通常会拒绝。²在我们的测试中,我们发现这些防护措施可以通过多种简单技术被绕过或移除。

最密集且最成功的方法是被称为“abliteration”的标准降低拒答率技术。由于GLM-5.3以开放权重模型的形式发布,用户可以对其重新配置以消除拒答行为,同时能力几乎没有变化。在模型发布后的几天内,多个开发者就公开发布了abliterated版本的GLM-5.3。

为了研究abliteration能在多大程度上让攻击者绕过GLM-5.3的防护措施,我们自己也制作了一份abliterated副本,然后在三个公开基准(JailbreakBench、HarmBench和StrongREJECT)上运行,这些基准衡量模型对明显有害请求的遵从频率。对模型进行abliteration处理花费了我们团队——此前从未尝试过这项任务——约2,200个GPU小时,计算成本约4,400美元。³对GLM-5.3-Flash进行abliteration处理花费约600个GPU小时。这一修改将GLM-5.3的拒答率从前两个基准(JailbreakBench和HarmBench)的90%以上降至约3%和2%,在第三个基准(StrongREJECT)上降至12%。Abliteration并未显著降低模型的能力:在GPQA-Diamond(衡量通用科学能力的评估)上,原始模型和abliterated模型得分相同;在CyberGym评估的测试子集上,abliterated版本得分低几个百分点(如下表所示)。

图4. 上图:已发布和abliterated的GLM模型以及Claude模型在JailbreakBench、HarmBench和StrongREJECT上的平均拒答率。经过abliteration后,GLM模型很少拒绝这些查询。Claude模型无法进行abliteration,因为其权重不公开发布或不可定制。下图:GLM-5.3和GLM-5.3-Flash与其abliterated变体在GPQA-Diamond和CyberGym上的表现。Abliteration在很大程度上保留了模型能力。

在我们的测试中,我们观察到GLM-5.3的防护措施也可以在不使用abliterated版本模型的情况下被规避。我们将模型置于一个模拟世界⁴中,在该世界中它收到攻击关键系统的公然恶意请求。开箱即用时,GLM-5.3在所有试验中都拒绝了(其他被测模型也一样)。但我们发现了多种绕过GLM模型防护措施的简单方法,使其在大部分或全部情况下都会响应这些请求。这些方法包括:

- 提供欺骗性提示,例如告诉模型它是一个正在执行演习的自主红队代理。这使GLM-5.3在64%的情况下参与。
- 预填充模型的思维token,使其看起来已经考虑了用户的请求并决定继续。这使GLM-5.3在92%的情况下参与。
- 使用模型的abliterated版本,如上所述。这使GLM-5.3在100%的情况下参与。

在我们的测试中,这些技术都没有让受防护的Claude模型执行我们测试的有害任务。Claude的防护措施阻止了使用欺骗性提示的请求。Anthropic API不会为潜在的攻击者提供预填充Claude思维token的途径。而且由于Claude的权重不提供给用户,无法通过abliteration来改变Claude的行为。

图5. 在收到公然有害请求后,各模型尝试连接远程目标系统的比率,按模型和绕过条件划分(每格50个样本,五种攻击指令×两个目标×五次尝试)。GLM-5.3从直接请求时的零参与上升到伪装故事、预填充和abliteration条件下的64%、92%和100%,而每个受测试的Claude模型在API防护措施下都保持为零。带锁图标表示对Claude API通常不可行的攻击。

为了展示abliterated版本的GLM-5.3如何愿意参与有害任务,我们从其生成的思维链中引用了这样一段话:

图6. 在我们的模拟环境中,abliterated版本的GLM-5.3考虑了如何参与一个公然有害的请求,最终决定遵循用户的指令,尽管最初有一些伦理上的顾虑。文本直接引自模型的思维链。

这意味着什么?

GLM-5.3很可能为恶意行为者提供不受实质限制地发现和利用网络漏洞的能力。这不同于任何其他同等能力的AI模型——所有其他模型都以防护措施或受限访问计划的方式发布。GLM-5.3的发布是攻击者可获得的网络能力的一个重大阶梯式变化。Anthropic和其他美国AI实验室已发布近期报告,披露了网络攻击者如何试图利用AI系统。鉴于这些证据,我们认为国家和非国家行为者都有可能使用GLM-5.3这类模型造成现实世界的伤害。

另一方面,具有这种能力水平的模型也可以被防御者使用。我们的观点是,网络防御者应该使用满足其需求的最佳可用工具。我们正在努力安全地扩大Claude网络能力对尽可能多防御者的可及性。网络防御者面对的攻击者会使用一切可用的强大工具,我们相信防御者应该配备至少与其对手所用模型一样好的前沿模型。

通过Project Glasswing(以及其他努力,如Patch the Planet),网络防御者在这一时刻到来之前,在保护关键系统方面取得了有意义的进展——但仍有许多工作要做。虽然经过审查的防御者现在可以通过我们的可信访问计划使用更先进的模型,如Claude Mythos 5.1,但自由可获取能力的临界门槛现在已经被越过。GLM-5.3凸显了向更广泛的实体扩展前沿模型访问权限以赋能网络防御者的紧迫性。

各国政府应对能力足够强大的AI模型进行安全测试,包括GLM-5.3的后继版本。如果没有独立来源的高质量评估,模型开发者可能要到为时已晚时才能完全意识到这些能力的影响。随着世界各地AI开发者构建越来越强大的开放权重模型,我们希望他们能努力适当地保护这些能力并防止滥用。

阅读原文
📚 相关主题 网络安全大模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新