AI Pulse

AI文本水印并非大事,不必大惊小怪

AI文本水印并非大事,不必大惊小怪

人们对于Anthropic最近宣布计划在Claude模型输出中加入隐藏水印一事感到相当不满。这会导致用户大规模离开Anthropic模型吗?引入水印会对用户产生有意义的改变吗?

不。AI文本水印不是大事。它不会让文本变得更糟,它不会让AI输出在实践中更容易被检测,它不会侵犯用户隐私,而且无论如何,到2027年每个人都会这么做。

带水印的文本并非质量更低

带水印和不带水印的文本在质量上没有有意义的差异。我在这里写过更多相关内容,但两种主流做法——Google的SynthID-Text和Meta的TextSeal——对用户完全透明。它们的工作原理是用一个不同的伪随机logit采样器替换原来的伪随机logit采样器。

假设你和朋友用抛硬币赌博,但你们决定不抛硬币,而是这样做:查看自午夜以来的当前时间(秒);在《大英百科全书》中向前数那么多词;判断你落到的那个词的字母数是偶数还是奇数。这仍然足够随机,可以用来赌博,对吧?但是,就像水印一样,只要记录了每次“抛硬币”的确切时间,理论上你可以事后回去确认使用了那个方法。文本水印的工作原理相同:它选择一种可以在事后被检测的“随机性”方法。带水印的模型不会比不带水印的模型能力差。

那模型引用某段内容、给出数学问题答案,或做其他输出基本由预设决定的事情时怎么办?在那里强制加水印不会让输出变得更糟吗?确实会,所以没有哪个AI实验室会这么做。文本水印方法只替换logit采样器中现有的随机性:在模型总是选择相同token的情况下,基本上没有随机性可以利用,所以这些token中不会有可检测的水印。

我认为这一切源于一种担忧:以前你得到的是最佳token,现在你得到的是满足水印要求的较低质量token。例如,Anthropic的公告暗示水印体现在类似“overcast”和“grey”之间的选择上。可以预见,许多人站出来说,这样的决定对好写作真的很重要,只有不识字的科技狂人才会认为这些词是相同的。

这是对Anthropic立场和水印工作方式的误解。具体来说,之所以是误解,是因为它暗示不带水印的模型会选择“overcast”,而带水印的模型会选择“grey”。事实并非如此!如果Claude Fable在特定语境中更喜欢“overcast”而非“grey”(比如80%对20%),那么无论带水印还是不带水印的模型,你都有20%的时间得到“grey”。模型已经包含了相当数量的随机性以促进创造力。文本水印只是引入了一种让这些随机选择在事后可被检测的方式。

AI输出本身就已经是“带水印的”

不必担心AI水印的另一个重要原因是,AI文本内容实际上一直都是有水印的。大多数细心的读者都能看出自己在读AI输出,因为语言模型往往倾向于某些语言习惯:破折号、修辞对立、短小精悍的俏皮话、“克劳德语”(claudese)等等。事实上,完全有可能训练出可靠区分AI和人类写作的分类器模型。

据我所知,对水印的一些强烈反对来自那些购买AI推理服务以将其冒充为自己作品的人,他们担心水印会让他们更难这样做。对这些人来说,水印公告类似于Anthropic在说:“嘿,与其让你看起来聪明,我们要公开给你打上AI用户的烙印,让你看起来很蠢。”

但当然情况一直如此!目前能把AI输出冒充自己作品而逍遥法外的人,不会因为水印而被抓住。在大多数情况下,对于任何读到这种垃圾内容的人来说,发生了什么已经一目了然。对于那些避免“风格雷同”的精明AI用户来说,任何怀疑的读者如果愿意把他们的内容粘贴到Anthropic的水印检测器中,早就已经可以把它粘贴到Pangram里了。

像Pangram这样的工具只会给出一个输出由AI生成的概率估计。水印难道不是更可靠的确认吗?不见得。文本水印也是概率性的,因为SynthID选择的任何token在理论上都可能由人类选择。我想Anthropic的水印页面可能会被认为比Pangram更可信,因为它直接来自源头,但在某些情况下,Pangram可能实际上比水印更擅长识别AI生成的文本,这也不是不可能的。

AI文本水印不侵犯隐私

我还看到一些流传的理论,认为水印会将秘密内容编码到你的输出中,或以某种方式用你的个人信息标记输出。我认为AI实验室没有用水印将数据编码到你的输出中。文本水印很难:就像我刚才说的,当模型只能用相同的词回答时,你无法加水印;它对很短的回复不起作用;即使在长回复中,也只能提供概率性的指纹。而这只是编码了单个比特的信息!

我并不是说把更长的消息编码进水印在技术上不可能——有论文描述了可能实现的方法——但任何实验室都不可能在这样做。如果他们那么想把你和你的回复关联起来,他们只需秘密存储他们生成的每一个模型回复。

AI文本水印不可避免

不要对任何一家AI实验室因水印而过于愤怒的另一个原因是,今年每一家AI实验室都会做文本水印。不只是Anthropic。另一种选择是彻底停止在欧盟开展业务,因为欧盟《人工智能法案》。那是一个目前价值六百亿美元的市场。我不是律师,但在我看来,一个AI实验室是否能在法律上只对欧盟的回复加水印,这确实不清楚:除非有一个完全不同的claude-eu.ai服务,否则该法案的明文似乎适用于任何在欧盟提供的服务,而不仅仅适用于该服务专门输出给欧盟公民的内容。

如果人们真的足够讨厌水印,一些实验室可能会建立一个完全独立的欧盟服务,或者对欧盟《人工智能法案》做出激进的解释,看看法律战如何进行。当我试图对反水印的情绪最大化地持善意理解时,我采用这样一种解读:人们说水印侵犯隐私、使输出更糟等等,不是因为他们相信这些,而是因为他们试图施压AI实验室,将欧盟AI法规隔离在一个完全独立的界面之后。在这种情况下,这也许无关紧要——文本水印不是大事——但我能理解一个美国消费者担心未来更激进的监管,并希望尽早划下坚定的界线。

阅读原文
📚 相关主题 大语言模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新