AI用你的书训练大概率合法,但抢你饭碗时可能就不行
ChatGPT、Gemini、Claude 这类聊天机器人的训练数据里,藏着数亿本书、文章和论文。大多数作者在不知情、也未经同意的情况下,成了 AI 的训练材料。这些 AI 工具反过来可能威胁他们的生计。
2023 年,法官 William Alsup 裁定 Anthropic 向一群作家支付 15 亿美元版权和解金。表面看是作者赢了,Alsup 的实际判决却认定 Anthropic 的 AI 训练本身合法。他罚的是盗版:Anthropic 从非法的在线影子图书馆里拿走了这些书,而不是训练本身。他在判词里打了个比方:大语言模型吸收数万亿词句,就像想成为作家的人阅读文学作品。训练的目的,是创造出不同的东西。
律师 Cathy Gellis 认为,这个裁决对 AI 公司更有利。Anthropic 自己预计,到 2028 年,年收入约 2000 亿美元。15 亿美元的罚款放在这个数字面前,微不足道。Gellis 说,版权法专注于复制,不关注使用、体验、消费或阅读一部作品。
目前 AI 版权官司的核心问题是合理使用。它允许在批评、模仿、教育等情形下,未经许可使用受版权保护的材料。法官会衡量使用的目的与性质、使用量,以及对原作品市场的影响。争议焦点在于,AI 训练的使用是否足够“变革性”。
律师 Jason Henderson 说,现在各方都很担忧,法律还没有真正跟上这个变化。他观察到一种趋向:训练冲着直接竞争去,法院会反对;不构成竞争,法院倾向于放行。
有一个典型案例。媒体与科技公司 Thomson Reuters 起诉了研究公司 Ross Intelligence。Ross 复制了 Thomson Reuters 的内容,搭建一个竞争性的 AI 法律平台。去年,法官 Stephanos Bibas 裁定 Ross 的使用不具有变革性。它没有超出 Thomson Reuters 目的的“进一步目的或不同特征”。
照这个逻辑,作者可以主张:聊天机器人用他们的作品生成新的合成书,直接跟原作者竞争。但这个论点还没有在法庭上赢过。
AI 生成内容的版权是另一个难题。在 Thaler v. Perlmutter 一案里,法院裁定完全由 AI 生成的作品不受版权保护。创作者不能对这样的作品主张版权。如何证明一部作品由 AI 生成、AI 参与了多少,成了新的难题。Gellis 举过一个例子。你在 Word 里写小说,运行拼写检查,大家通常接受 Word 并不拥有你的小说。AI 正在迫使人们重新审视那些长期被忽略的决策。
美国版权法自 1976 年以来没有更新过。法官只能拿着 50 年前的规则,去处理可能塑造 AI 行业未来的法律问题。目前大多数 AI 公司还陷在未决诉讼里,短期内不会有明确答案。Gellis 说,早期的裁决正在产生影响。但如果其他法院做出不同决定,这种影响也可能被推翻。要等后续诉讼阶段,才能看出哪个方向胜出。在结果明朗之前,这些裁决正影响着一切,AI 公司忽视它们并不明智。