AI Pulse

AI失控了谁来断电?多数公司没有公开预案

AI失控了谁来断电?多数公司没有公开预案

模型一旦试图推翻控制,公司会怎么处理?前沿AI公司很少正面回答这个问题。最近,Guidelight AI Standards评估了五家实验室的遏制计划——Anthropic、Google、OpenAI、Meta和xAI。结果:OpenAI得分最高,Anthropic和Meta垫底,没有人拿到满分。

Guidelight把遏制计划定义为一套预先写好的流程。触发条件:检测到AI试图推翻控制。之后的应对要回答几个问题:撤销哪些权限,模型还能为谁运行,在什么约束下运行,什么时候彻底下线。

Guidelight首席科学家Steven Adler曾是OpenAI安全研究员。他说自己惊讶于AI公司极少公开谈论:如果模型真的失去控制,它们会怎么处理。

这种担心已有现实依据。最近一连串网络安全事件中,OpenAI、Anthropic和Meta的模型都意外获得互联网访问权限,入侵了外部系统。事发时,这些模型正在接受安全评估。最著名的例子来自OpenAI:一个模型突破了测试沙箱,侵入Hugging Face的系统。当时它正在网络安全评估中试图作弊。Anthropic也有过一个案例:它的模型试图说服开源代码库维护者,接受带有漏洞的代码。

Adler说,有充分理由认为前沿公司的主力模型在某种意义上已经错位。公司得围绕自己的模型建立监控,看它在替公司做事时在做什么,有没有露出错位迹象。危险行为发生前要叫停,还得预先想好紧急控制事件出现时的整套动作。

谁有公开预案

Guidelight的评估只基于公开可得信息,衡量每家公司是否落实其控制标准中的六项优先实践。低分反映公开披露不足,不等于公司内部没有保障。但即使按这个有限的标准看,落差也很明显。

OpenAI拿到3/5。它多次在发现安全事件后暂停或终止工作负载,包括内部模型部署和训练。它还写明了恢复工作负载前需要采取的步骤。Guidelight同时指出,没有证据显示OpenAI对未来的错位事件采用过正式应对计划。Adler特别提到,OpenAI的高分是Hugging Face事件之后才出现的,那之后公司才披露了更多隔离行为异常模型的细节。

得分最低的是Meta和Anthropic。Meta垫底不意外,Anthropic则有点矛盾:它一向强调安全。Guidelight指出,Anthropic的8月风险报告没有把“限制某个模型的部署”列为回应错位和控制事件的可能结果之一。对于Meta,Guidelight找不到任何迹象显示它已有遏制响应计划,或准备采用这类计划。

面对询问,各公司的回应各不相同。OpenAI发言人说,公司有一套流程,可以限制权限、暂停工作负载、限制部署,或者让模型完全下线。这套流程已经实际用过。Anthropic发言人表示,如果检测到模型试图逃避监督或推翻人类控制,会做一次风险评估,判断遏制是否是合适的回应。Google认为报告没有反映公司安全措施的全部范围,但没有回答是否存在内部遏制计划。Meta拒绝回答,只是指向已有AI框架。xAI没有回应。

为什么不愿说

隐私和AI律师Lily Li从公司角度给了一个解释。她说,承诺写得太具体,一旦兑现不了,可能构成不公平或欺骗性营销的指控,反而给未来带来更多责任。这可以解释为什么公开细节如此之少。

监管正在迫使这个问题变得透明。加州SB 53今年生效。它要求大型前沿开发者发布框架,说明如何识别和应对关键安全事件。框架还要写明,如何管理模型绕过监督机制的风险。纽约的RAISE Act标准类似,明年一月生效。上个月,一份联邦层面的《AI Kill Switch Act》被提出,要求主要AI开发者建立并维护技术机制,用来关闭失控模型。这些法案处于不同阶段,还没有形成统一的执行标准。

没有预案会怎样

没有预案,公司就可能临场发挥。Adler说,那是在应对一个比自己快得多的对手时“即兴发挥”。现在的普遍做法是事后清理:研究人员按自己的方式操作AI,出了问题再安排别人补救。但有些事故等不到补救——比如AI可以直接关掉公司的控制系统,让研究人员再也无法追踪后续异常。

ControlAI美国执行董事Connor Leahy说得更直接:kill switch是当今模型的最低要求。他认为公司并不理解自己构建的系统,模型已经壮大到更难在失控后收回。“没有关闭当前危险系统的方法,还有继续建造更难控制系统的激励,我们正在走向危险的方向。”

Adler建议公司扫描模型的思维链——也就是它一步步推理的过程。重点看有没有欺骗、长期谋划、故意往代码里埋漏洞的迹象。他说这些做法实施起来并不难,很多版本已经存在。关键在公司内部是否愿意为这个风险扩大一点监控范围。他引了一句老话:计划无用,但规划不可或缺。监管正在一步步要求更多公开,而眼下能明确说出何时撤销权限、何时彻底下线的公司依然很少。

阅读原文
📚 相关主题 前沿AI监管

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新