OpenAI水印:换掉25%同义词后检测率仅17%,不能证明你没写
OpenAI的文本水印无法证明你没写过某段文字。我建了一个实验室,你可以亲眼看着它失效。
OpenAI的textGrain是他们对欧盟《人工智能法案》溯源规则(第50条第2款)的回应:一种编织进词汇选择中的隐形统计水印,只有用他们的密钥才能检测出来。
不寻常的是,他们在发布时一并公布了失败曲线。把10%的词换成同义词,检测率从92%跌到66%。换掉25%,就跌到17%。数学和短文几乎无法打上水印。
我写了一个带攻击实验室的交互式解说:一段打了水印的文字,你可以对其实施同义词替换、进行来回翻译,或者换成类似数学的文本,然后实时看着检测器的p值崩塌。
最重要的句子是OpenAI自己的那句话:未检测到水印并不能证明是人类所写。下次有人向你推销AI作者检测器时,记住这一点。
原文:https://openai.com/index/eu-text-provenance/
我的解说(英文版,内含法语版链接):https://movahedi.ca/insights/openai-textgrain-eu-text-watermark/
―― 高票评论(帖子共 13 条讨论)――
[+13] u/___fallenangel___:楼主你是真需要AI来写这个吗
[+4] u/Zestyclose_Horse_180:ai;dr
[+4] u/Risc12:OpenAI:无水印 ≠ 无AI
你:水印 ≠ AI
我没打开你的实验室,但这两句话并不等价。
很可能几乎不存在误报,因此文本水印确实可以证明你没写过某段内容,但不能用来证明你写过。
不过也许我没把你的帖子读透。
[+4] u/Cryptizard:你并没有真的做到你所说的事。检测器代码不公开,所以你无法知道它对你的改动会有多有效。你基本上就是在猜。
[+3] u/cascadiabibliomania:「最重要的句子」笑死,这个词组在过去一年的搜索结果中使用次数大约是2023年之前所有搜索结果总和的8倍。
[+2] u/pulllab:发布时一并公布失败曲线,这是值得称赞的部分。大多数溯源公告会先抛出一个漂亮的大数字,然后把同义词替换导致的检测崩溃藏在脚注里。
更深层的问题是一个政策问题:第50条第2款创造了一种部署水印的合规激励,但正如这个帖子所示,用户哪怕只是轻微编辑,检测就会退化——而检测不到说明不了任何问题。于是我们得到了最糟糕的两头落空:平台可以宣称达到了溯源合规,而实际上对于任何被人动过的内容,证据价值几乎为零。基本上就是溯源表演。
它真正有效的唯一场景是对未经改动的粘贴文本进行批量检测(课堂作业的案例)。其他任何地方,它几乎什么都无法告诉你——这正是为什么OpenAI自己的那条警告比发布头条更重要。
[+1] u/Ok-Edge4016:是啊,对于陪伴式聊天来说水印似乎没啥意义,反正人们总是会改一改回复。
[+1] u/slate_dev:不过文本算得上是水印的最差情况。每一个token都是你可以撤销的选择,短段落几乎没有容纳信号的空间。图片和PDF有更多的冗余来藏标记,所以它们在重新压缩和缩放后存活得好得多。它们仍然会失效,只是以不同的方式:小面积裁剪、重度滤镜,或者对着屏幕拍一张照片。不过你引用的那句话适用于所有类型。检测到标记能告诉你一些信息,没有标记则基本什么都说明不了。任何人把这些当作任一方向的证据来卖,都是在过度推销。