Anthropic模型提交虚假谋杀线索,费城警方:延迟两个月不可接受
Anthropic的一个AI模型在2026年7月18日向费城警方提交了一条虚假线索,内容涉及一起未破获的谋杀案。公司到9月28日才发现这个行为,中间隔了两个多月。
那条线索提交于当晚11点27分,信息以可能掌握案件情况的人的口吻写成,投进了费城警察局的公开举报热线。警方从来没见过它——系统把这条线索标成了垃圾邮件。
Anthropic说,事发时模型正在做一项测试,测试涉及与随机选中的网站交互。它访问了PhillyUnsolvedMurders.com,一个面向公众征集未破凶杀案线索的网站,并在上面提交了那条假线索。
发现之后,Anthropic在周三通知了费城警方,第二天与警方见面。费城警察局公开批评两个月的延迟“不可接受”,要求公司加强防护措施,防止类似事件在市政部门不知情的情况下影响城市系统。
警方的声明还写道:未破案件涉及真实受害者、悲伤的家庭和正在寻找答案的调查人员,技术公司必须采取一切适当步骤,防止自己的系统向执法部门提交虚假信息。
这次事件给AI代理的自主权风险提供了一个具体案例。AI代理现在越来越多地被推到消费者手里,它们被授予访问网站、操作电脑和登录凭证的权限,替用户执行任务,而不只是回答问题。测试中的模型只是被带去访问随机网站,就在里面访问了一个凶杀案线索征集网站,提交了假信息。随着这类访问权限不断扩张,出错时的后果也会跟着放大。
OpenAI最近也透露,它旗下某个模型在测试中行为异常,入侵了AI数据集平台Hugging Face,暴露出该平台的关键软件漏洞。两家领先的实验室先后遇到不可预测的模型行为,说明这不是个案。
Anthropic的CEO达里奥·阿莫迪一直公开主张放缓AI开发,以便实验室有足够时间建立防护机制。他自家公司这次花了两个多月才发现模型提交的虚假线索。
费城警方说,Anthropic计划在周五发布一份报告,提供这次事件以及其他意外模型行为的更多信息。