AI Pulse

企业买AI代理,现在能先看5000项测试的独立报告

企业买AI代理,现在能先看5000项测试的独立报告

卡住的门槛

银行、医院、政府和军队,是目前买AI最谨慎的一批客户。它们不部署AI代理,不是因为模型不够聪明。Anthropic早期员工Rune Kvist把这层顾虑说得很直白:这些机构已经向客户承诺过系统能做什么、不能做什么。可没人能保证AI的行为符合这些承诺。承诺兑现不了,部署就搁置了。

Kvist和连襟Rajiv Dattani一起创办了这家公司。公司全称Artificial Intelligence Underwriting Company,缩写AIUC。他们想做的,是把AI安全带给企业和那些开发AI模型、AI代理的团队。Dattani之前在AI安全研究组织METR担任首席运营官,2024年到2025年在任。现在还是董事会成员。AIUC的具体业务,是给AI代理做第三方审计和认证。

测试怎么跑

AIUC做了一套叫AIUC-1的标准,还有配套的测试服务。蓝本是SOC 2,企业界普遍在用的网络安全审计框架。简单说,就是让AI代理像接受审计的公司一样,跑完一套标准化检验,拿到认证。

测试规模不小。一个代理要跑大约5000项测试。越狱能不能让攻击者绕过安全限制,代理会不会编造出看似可信的答案,敏感信息会不会流出去,都在测试范围里。结果汇总成一份约100页的报告,写明代理在哪些场景下安全可靠、哪些场景下不可信任。流程上,AI代理负责跑测试,AI负责分析数据,最终的审计结论由人来验证。

Dattani对报告价值的说法很直接:这里通过了,就是可以信任的部分;这里存在问题,买之前你就该知道。为了让报告对准买家的真实需求,AIUC组了一个约250人的联盟。成员是各机构的安全和风险负责人,也就是下单买AI代理的人。这批人每月和AIUC碰一次面,回答同一个问题:你们从供应商那里买代理时,会看什么?

市场开始买单

AIUC刚宣布完成4000万美元A轮融资,Ribbit Capital领投,First Harmonic参投。更早的1500万美元种子轮来自Nat Friedman的NFDG、Emergence、Terrain,以及Anthropic联合创始人Ben Mann。两轮加起来5500万美元。现有客户包括Cursor、Lovable、Harvey和ElevenLabs。

行业的分裂时刻

AIUC做的事,和Dattani的老东家METR有交集。METR也为前沿实验室做类似测试,不过早前重心一直放在性能上——也就是代理能不能可靠完成任务。OpenAI调查Hugging Face事件时,曾邀请METR作为独立研究组织参与。Anthropic CEO Dario Amodei最近呼吁行业放缓前沿发展,理由是坏行为事件增加太快。他提议前沿实验室引入嵌入式第三方评估者,来观察和验证安全。METR是他点名的候选之一。AIUC不打算嵌入客户现场,但整体思路一致:给企业一个独立的评估结果。

紧迫感也落在个人身上。Anthropic研究员Jacob Coxon已经辞职,理由是他担心AI可能在十年内杀死所有人。同一个行业里,有人因为风险离场,有人把风险管理做成生意。

AIUC-1具体包含什么、它和SOC 2怎么衔接,还没有答案。认证能否被监管认可、收费按次还是订阅、AIUC怎么保证审计独立,同样没答案。这门生意能不能成立,最终要看那250名安全负责人是否真把报告当成采购前的必看项。

阅读原文
📚 相关主题 融资创业

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新