AI Pulse

读者无法识别带水印的AI文本

读者无法识别带水印的AI文本

过去几周,我一直在抱怨大家对AI水印的看法都错了:它其实并不反消费者,也不会让输出质量变差。水印论文[1]已经证明了这一点,但我认为实际测试一下可能会更有意思。面对同一提示词的水印与非水印回答,读者能分辨出哪个是哪个吗?

为了找到答案,我临时搭建了 https://sgoedecke.github.io/watermark-quiz/,一个供读者测验的静态网站。我使用租来的H200上的Qwen3-30B-A3B-Instruct-2507模型生成了30个回答:每个问题三个回答,其中一个秘密地使用了SynthID-Text水印。租用GPU的费用大约两美元。为了统计结果,我只是将用户根据得分发送到不同页面,并在我的分析工具中汇总每个页面的访客数[2]。如果有人刻意为之,这很容易被篡改,但作为一次非正式测试,我认为可以接受。

第一轮测验流量(278名参与者)得到了以下略显令人困惑的结果:

得分 | 参与者数
0 | 6
1 | 15
2 | 36
3 | 64
4 | 54
5 | 39
6 | 51
7 | 10
8 | 3
9 | 0
10 | 0

随机选择下的平均得分应为3.33/10。然而,这里的平均分是3.92。确实如预期在3/10处有一个峰值,但还在6/10处出现了第二个奇怪的峰值。这是为什么呢?原来十个问题中有六个问题的SynthID回答是选项A,因此如果用户每次都选择第一个答案,就会得到6/10。哎呀。

我重新打乱了问题顺序,得到了以下结果:

得分 | 参与者数
0 | 1
1 | 3
2 | 14
3 | 21
4 | 20
5 | 11
6 | 2
7 | 1
8 | 0
9 | 0
10 | 0

现在平均分是3.4/10,更接近预期的3.333。6附近没有峰值。重新打乱问题后,只有73人参与了测验——大多数人在我发布到LinkedIn和Hacker News后立即看到并参与了——但鉴于之前的结果,我认为这仍然足以确信人们只是在随机猜测。

所以,人们确实无法识别AI水印的存在。显然这并非严格意义上的科学研究,但仍具有相当的说服力。如果水印真的选择了模型永远不会选择的随机词汇,那么从三个并列回答中,理论上你有时能看出哪个走上了奇怪的水印之路,对吧?我还希望类似的东西能成为一种说服工具:如果你担心水印会带来什么影响,而你的直觉又不受数学解释的动摇,那么阅读一下水印和非水印回答,可能会让你相信质量上确实没有差别。

[1] 一句话解释为什么:AI模型已经会从几个最高概率的token中随机选择,而水印只是用可预测的、但同样“随机”的偏差替代了这种随机选择:举个简单的例子,与其“从前三名token中随机选一个”,不如“统计前十个token的字母数,取模3,然后选择那个token”。

[2] 搭建过程中的一些笔记:GPT-5.6-Sol在我的页面上添加了多余的文本,我不得不去除;它选择了现在非常容易识别的样式,我不得不重新设计;它构建了一个奇怪的、由JavaScript驱动的静态网站,而不是我自己会手工搭建的纯HTML交叉链接页面。整个过程大约花了我一个小时(尽管我实际只做了大约十分钟的工作)。

[3] Umami,托管在PikaPods上。对于我的博客,我确实也付费使用Netlify分析,因为我发现基于JS的分析工具会遗漏超过50%的技术用户,但对于这类测试,Umami就足够了。

阅读原文
📚 相关主题 AI水印研究

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新