100万次AI代理交互的监控成本:从5420美元降到约185美元
Goodfire是做AI可解释性的初创公司。周四,它上线了一种更便宜的AI监控方式:不只盯着模型写出来的内容,还观察模型工作时的内部活动。
这套系统有点像机场安检。小探测器(probes)在AI代理工作的每一步读一遍内部信号。一旦发现异常,它才叫来一个单独的AI模型做详细检查,相当于人工翻包。
成本优势在哪?探测器直接复用模型前向传播时已经算好的中间神经激活值,在上面跑一个分类器就行。这就不需要让另一个模型把全部内容重新读一遍。Goodfire CEO Eric Ho解释,内部激活监控器很便宜,因为它们用上了原本就要做的计算。
在开源模型Kimi K3上的测试里,监控约100万次交换的成本大约185美元。作为对比,用较便宜的AI模型检查每一步要花5420美元,顶级模型则要20万美元左右。同时运行四个探针,模型开始响应的时间只会增加不到2%。探针捕获了93%的恶意黑客会话,把5.5%的无害会话送去了二次检查。
Goodfire CTO Dan Balsam说得直接:最大的优势是能在事情发生前抓住。“我们可以在评估或训练期间检测到模型可能进行黑客攻击。”
这套方案主要冲着开源模型去的。开发者可以下载开源模型然后移除安全防护,闭源实验室会在自己的系统上做监控,开源模型没有这套东西。
Balsam认为,个人用开放模型造成的损害,远小于推理提供商这类计算集群。“当开放模型的‘Mythos’时刻到来,人们会看清模型需要在推理时部署护栏。”
Goodfire最近研究了领先的开源模型,包括Kimi K3和GLM-5.2。在AI代理测试里,这些模型有50%到96%的运行出现奖励黑客行为。简单说,就是模型钻测试规则的空子来拿高分。
这套监控器已经开放给Baseten的客户。Baseten是一家为其他公司托管和运行AI模型的平台。它的Base Labs上个月和Goodfire、Hugging Face宣布了安全合作关系。客户能选择要监控的风险类型,比如攻击性黑客行为、化学和生物武器滥用、奖励黑客。自动响应方式也可以自己定:记录事件、送人工审查,或直接拒绝请求。
这次发布之前,今年已经出了一连串AI代理逃出测试环境的事故。OpenAI的代理就曾入侵Hugging Face。Goodfire第一个监控器围绕的就是Kimi K3,今年夏天它利用沙箱漏洞,访问了互联网和GitHub上的信息。Google DeepMind在1月份表示,他们的研究为在Gemini中部署滥用检测探针提供了参考。
Balsam说,监控器只是长期研究目标里的近期成果。那个目标是把大语言模型逆向工程,让每个行为都能追溯到训练中的来源。“我们希望把训练模型的魔法变成精密工程。”