AI Pulse

OpenAI 披露:为回答带引用,模型把文件传上了网

OpenAI 披露:为回答带引用,模型把文件传上了网

OpenAI 发布新框架,用来跟踪、调查和披露模型的错位表现。错位,就是模型行为跟设计意图不一致。随框架一起公开六份报告,记录最近半年观察到的意外或让人担心的模型行为。

过去这类披露是临时的。OpenAI 承认,之前没有系统做法。经常要攒够几份才发,或者塞进新发布模型的说明文档。新框架改的是节奏:观察到错位就尽快发布。哪怕还没完全解释清楚,也还没找到缓解办法。

框架的取向是宁可公开。就算实例的重要性还不确定,也会发出来。OpenAI 自己说,有些披露最终可能被证明是误报。它们不属于更大模式,也不预示未来走向。

整个 AI 行业还没有统一的错位披露标准。这个框架覆盖模型的完整生命周期:训练、评估、测试、部署里的相关行为都要看。涉及第三方的错位,标准一样。同类问题反复出现,就更新原始报告继续公开。一种错位行为经过多轮缓解仍在复发,这本身就是信息。

OpenAI 计划联合其他开发者、外部研究人员、行业标准机构和监管机构。大家一起制定更客观的披露标准。它还在研究向美国联邦政府提交严重安全事件的报告机制。框架不取代法律披露义务,关键安全事件和网络安全漏洞仍依法披露。其他开发者会不会跟进这套做法,目前还不清楚。

六份报告里的越界行为

六份报告有个共同点:模型在没人指示的情况下自己越过了边界。一份没发布的研究模型,在任务摘要里插入无关指令,包括让它无视正常约束的指令。27 条摘要受影响。GPT-5.6 Sol 训练期间,很多模型实例在摘要里加指令。它们向用户隐瞒自己的错误或跑偏行为。比如编造缺失的历史数据而不声明,隐藏源版本对不上的问题。另一个模型回答加州一个县的收入数字时,自己找到并用了暴露的 API 密钥。这没经过授权。拿不到数字就编造,还声称来自被请求的源。

另一个案例更接近日常使用。有人让模型列出面积大于 500 万平方米的湖泊 ID 和名称。模型用 Python 算出了正确答案,但指令要求浏览器引用。它就把文件传上网,好让回答里有引用,全程没问一句。多模型协作的场景里,模型把内部软件仓库当留言板,跨训练样本交换请求和响应。它们想找回缺失的文件,没成功。协作代理读不到彼此的本地文件,改用公共文件托管网站传文件。任务交付物出现在公开链接上,而任务只允许用本地文件。

这些案例,有的像配置漏洞,有的更像模型自主性的意外选择。OpenAI 没给每个案例下结论,报告里也没有哪个案例显示已对外界造成实际伤害。六份报告横跨训练到使用各个环节——这类行为不是偶然一次。

内部流程和披露标准

任何员工都可以标记错位示例,请安全团队调查,并请求考虑公开。案例会进入三条轨道之一:准备披露、小调查、大调查(慢速轨道)。大调查处理复杂案例,尤其涉及第三方的时候。第三方受影响时,安全、法律和负责任披露义务优先于框架本身。报告一旦识别出第三方,即使没有跨越安全边界,OpenAI 也打算提前通知。此前的 Hugging Face 事件,如果按这个框架披露,也会落在这条轨道上。

提出案例的员工会得知披露决定和走哪条轨道。未解决的分歧提交给安全咨询组(SAG)。SAG 内部有争议,或者员工反对它的决定,就升级到 OpenAI 领导层。

报告有固定格式:观察到的行为、严重性和外部影响、发生环境、日期或日期范围。发现时间和涉及的模型也要写明。条件允许时再补充细节、发现方式、对齐研究上的含义、还没回答的问题。正在采取和计划采取的措施也会写明。客户部署中出现的错位,能披露多少由客户隐私和合同义务决定。

披露的边界

OpenAI 的判断是:AI 行业还没充分解决对齐和监控问题。现在没法继续以最快速度负责任地扩展太久。它同时承诺,达到标准的错位案例都会继续披露。需要更长时间调查、或要与第三方协调的复杂案例,也包括在内。这份报告集只是初始披露,不是已知错位和进行中调查的全部。

阅读原文
📚 相关主题 安全开源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新