AI Pulse

网上AI文字将藏数字指纹,你读不出但系统能识别

网上AI文字将藏数字指纹,你读不出但系统能识别

Anthropic周五发布一篇博客文章,解释Claude文本水印的工作原理。本周早些时候,公司透露,这是为了符合欧盟AI法案的透明度规范,该规范要求AI公司使用能识别AI生成内容的系统。

具体做法是在低风险选择中制造模式。比如描述天气时用“overcast”还是“grey”,Claude可以做出一个隐蔽的规律——读者察觉不到,持有密钥的人却可以检测到。Anthropic说水印不影响输出质量,带水印和不带水印的回复,肉眼分辨不出来。

方案来自Google DeepMind团队2024年提出的SynthID-Text。Anthropic计划发布一个检测API。这跟Pangram之类的检测公司思路不同。Pangram靠寻找写作中的固定特征来判断AI,比如爱用“不是……而是……”这种转折。Anthropic认为,捕捉这类模式与检测水印是两回事。

水印是可以去掉的,但要看怎么改。轻度编辑大概无法完全移除,把每个词都替换掉的彻底重写可以做到。重写到那种程度,文本还能不能算“AI生成”,本身就值得争论。

如果只是拿Claude来校对或编辑人类作者的文章,情况有些微妙。水印是否可检测,取决于文本长度和Claude修改的程度。轻度编辑过的文字里,几乎所有词都出自人类作者之手,“水印几乎没有可以附着的地方”。

代码的情况不同。模型必须生成能运行的程序,没有在多个同样有效的选项之间自由挑选的空间,所以代码中的水印会比普通文本少。在确实存在任意选择的地方,比如代码注释,水印就能派上用场。按Anthropic的说法,水印对实际代码本身的影响可以忽略不计。

Anthropic不是唯一在做这件事的公司。其他主要模型开发者已签署同一份行为准则,将实施各自的水印方案。

X上的用户反应分裂。有人把水印描述成针对无辜Claude用户的阴谋,也有人反驳说,不想要水印的唯一理由就是想骗人。Business Insider报道,已有“数十名”用户在X上声称因此取消了Claude订阅。

阅读原文
📚 相关主题 大语言模型内容安全

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新