Anthropic发布AI生成文本检测公开API(190)
每个悄悄把 Claude 生成文本当作自己产出提交的自由撰稿人、营销人和顾问,现在只需要一次 API 调用就能被检测出来。Anthropic 即将推出公开的检测 API。你的客户可以直接用它检测你的交付成果。
这不止是 Anthropic 一家的动作。OpenAI、Google、Meta、Microsoft 和 Mistral 都签署了同一份欧盟行为准则,总共有大约 190 个签署方。
在过渡期结束后,基本上所有前沿模型生成的文本都会带上水印。换模型逃不掉,想删除也逃不掉。
这一点几乎没人想明白:因为没有额外内容被添加到文本里,所以没有东西可以让你清除。水印信号就藏在选词本身——藏在模型选了哪个同义词、而不是另一个同样正确的同义词这个选择里。
已经有工具声称能移除水印,但对于统计水印来说,你永远没法验证它是不是真的被清除了。你提交作品的时候,根本不知道它到底还带不带标记。
真正能破坏水印的是你自己的编辑。每一句你用自己的话重写,都会把带标记的选词替换成你自己的。大量修改比任何清除工具都有效。
这意味着水印歪打正着,刚好 enforce 了客户从一开始就想要的东西。
反过来的问题更讨厌。如果只是 Claude 编辑或翻译了人类写的内容,水印也会触发。检测只能回答「Claude 有多大可能参与了创作」,回答不了「是谁写了初稿」。
你写了每一个词,只是让 Claude 帮你改语法,检测工具现在就会把你的原创作品标记为 AI 参与创作。
所以接下来两年会是这样:学校和雇主会把概率性的「可能」当成定论。自己写完全文的人,仅仅因为做了一遍清理修改就被冤枉。
而唯一安全的做法,其实从一开始就是对的:用模型辅助思考,只提交你亲自重写过的文字。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖