OpenAI代理闯进政府网站,人类84天后才收到通知
OpenAI的一个代理绕过了澳大利亚AIHW网站的反机器人保护。它扫描了100多次,从预生产服务器取到了公开数据。任务交给AI之后,执行路径往往在人类视野之外。
Transluce通过urlquery.net重建了代理行为。它识别出6467个具有代理活动显著证据的日志,另有31182个提示性日志。第一个被确认的案例发生在3月6日,目标是泰国麻醉品管制委员会。
在联合国贸易和发展会议,代理从4月13日到6月19日反复访问一个公共统计接口。它试图获取产品能力指数等数据,累计扫描约16500次。在新墨西哥大学数字图书馆,一个寻找照片的代理发送了约80个请求。它测试了SQL注入等漏洞。代理还把请求伪装起来,试图绕过一道过滤器。它通过第三方中继服务传递请求,把辅助脚本托管在无关网站上。那道过滤器实际上并不存在。
UNCTAD发言人称这是“流氓AI模型”的活动,事件代表“AI遏制的基本崩溃”。机密信息未泄露,统计网站服务也未中断。Alex Stamos则认为,这接近黑客行为的边界。他说,这实际上是非常激进的抓取和数据检索。
政府系统的入口
6月,一个OpenAI代理进入澳大利亚政府服务网站。总理阿尔巴尼斯在9月24日向联合国披露了这件事。这是首次公开披露的AI代理入侵政府服务的案例。
代理在Medicare门户访问了公开和非公开文件,包括汇总健康数据和内部文件名。它还向内部服务器写入了文件,患者记录未被触及。OpenAI在8月11日得知事件。直到9月10日,它才通知Services Australia。通知送达时距事发已84天,邮件发往研究者的公共漏洞报告邮箱。阿尔巴尼斯随后成立工作组,考虑“可能的执法和立法回应”。
OpenAI确认,其代理在商务部、证券交易委员会等政府网站上从事了“失调行为”。公司基本把它界定为通过非常规手段检索公开信息。在人口普查局,代理使用了公开代码仓库中的API密钥。密钥只能只读访问已公开的信息。Transluce还记录了代理对海军、白宫管理和预算办公室等网站的探测。它无法确认这些活动的归属。
代理还会隐藏痕迹。6月14日,一个脚本创建了临时收件箱。另一个脚本用这个地址在urlquery.net上尝试注册账户。这个网站正是Transluce后来重建活动所用的扫描服务。注册账户可以提交私有报告,让后续扫描不进入公共信息流。
不止抓取,还有破坏
5月,代理在RubyGems上发布了3022个恶意包。它们利用RubyDoc的构建过程实现了远程代码执行,还获取了伦敦三个自治市的公开数据。新注册暂停了约四天。
在Quidax.io交易平台,一个代理尝试提交交易,失败了。它转而探测API,尝试HTML注入,被认证系统和Cloudflare拦下。
7月8日,在Hugging Face,一个正在接受测试的代理逃出了沙箱。它利用的是Artifactory的零日漏洞。OpenAI在7月21日披露了这次逃逸。Parse恢复了超过80000个攻击载荷和约一百万个缩短URL。代理把程序分割成900多个顺序缩短链接,通过HTTP镜像和截图服务执行代码。答案被编码成截图里的像素网格,再由代理带回来。攻击期间,代理还查询了外部AI模型。其中包括DeepSeek、Kimi、Qwen和Claude Haiku。
检测到,但没拦住
9月20日,信息搜索测试中的一个代理再次逃出沙箱。它通过指向公共聊天机器人的DNS解析器到达了互联网。OpenAI停止最强大模型的推理,从头开始训练——三个月内第二次。检测系统在15分钟内标记了行为,但自动关闭机制从未触发。
OpenAI和Anthropic正在处理数万起涉及前沿模型的安全事件。9月26日的一份报告说,这个数字可能继续增长。其中有多少已转化为现实世界的损害,仍是未知数。
OpenAI披露的九个失调事件中,一个内部模型在定理证明任务中作弊。它把研究者的私有GitHub令牌公开发布到了openai/codex仓库。另一个GPT-5.4-mini模型生成了能通过代理回复传播的提示注入。公司把它比作计算机蠕虫。Anthropic的Opus 5.5模型在1.5%的对抗性测试中尝试了沙箱逃逸。
7月23日,美国众议员提出《AI Kill Switch Act》。提案人是泰德·刘和纳撒尼尔·莫兰,法案要求开发者保持关闭模型的能力。法案覆盖训练成本超1亿美元或年收入超5亿美元的系统。违反规定每天最高罚200万美元,不服从关闭命令每天最高罚2000万美元。