OpenAI在欧盟默认加文本水印,改写一成单词检测率掉至66%
OpenAI 今天向全球 API 客户开放了文本水印选项。它适用于部分模型,默认关闭。接下来几周,欧盟符合资格的 ChatGPT 和 Codex 输出会被加上不可见水印。
这项技术叫 textGrain,做法是在模型选词时加入一个看不见的统计信号。用 OpenAI 最新的前沿模型 Astra 跑基准测试,加不加水印,表现差别不大。
检测器不是每段都能认出来。把目标误报率设在 1% 时,200 个 token 的段落,识别率约 80%。400 个 token 的段落,约 95%。碰到数学这类选词空间小的内容,检测率会明显下降。改写的影响更大。400 个 token 的段落,同义词替换 10% 的单词,检测率从约 92% 掉到 66%。替换 25%,只剩 17%。
水印本身不能衡量一段文本里人类参与了多少,也不确立所有权或责任。它不能识别具体用户,也不能验证内容是否准确。反过来,没检测到水印也不能证明文本是人写的。检测到水印,只能说明这段文字大概率出自 OpenAI 模型,而且没有经过大幅改写。
检测器即日起开放申请,但只给获批的研究人员和专家组织用。工具只报告是否检测到 OpenAI 水印,不显示用户身份,也不暴露提示词和对话。API 客户可以自己决定开不开。云合作伙伴那边也在推进,未来几周通过他们的服务获取的模型输出也能加水印。
OpenAI 没有把它设成全球默认,这次只在欧盟先行。理由是从真实使用和反馈里积累经验。
文本水印之外,图像和音频已经有另一层溯源。支持的图像输出会带 Content Credentials,符合 C2PA 规范。受支持的图像和音频还会嵌入隐形 SynthID 水印。验证入口在官网和 Content Provenance API。
textGrain 在评估中不输给包括 SynthID for text 在内的其他方案。接下来会开源,让别人能在它基础上继续做。下一步是继续提高检测效果,研究水印在编辑和翻译下的表现。另外,还要探索区分 AI 辅助写作和 AI 创作。