AI公司收旧书扫完训练数据就把实体书毁了
AI公司正在大量收购二手、珍稀和绝版书籍,将它们扫描制成训练数据,并且在很多情况下扫描后会销毁实体书。
随着各大实验室开始寻找不包含AI生成内容的高质量人类手写文本,这种做法的速度已经加快。当下公开互联网上绝大部分内容都已经被AI生成内容填满。
记录最完备的案例是 Anthropic 内部代号为巴拿马项目(Project Panama)的行动。版权诉讼的法庭文件显示,该公司从 Better World Books 这类二手书商和批发商手中收购了数百万本实体书。
工人用液压切割机切掉书脊,将松散的书页送入工业高速扫描仪,然后丢弃或打成纸浆。一份内部规划文件将目标描述为「大规模破坏性扫描书籍」。
一名联邦法官后来裁定,购买书籍、通过这种方式制作内部数字副本、销毁原件的行为,属于美国版权法下的转换性合理使用,部分依据了首次销售原则。
类似的活动如今已经非常普遍。包括 ISBNdb 在内的专业中介公开向AI实验室推销批量收购服务,订单范围从几千本到多达一百万本。他们把老旧印刷书宣传为「结构干净」的训练数据。
美国和欧洲的书商报告称,混合随机选书的批量订单突然激增,其中就包含珍稀和绝版书籍。其中部分书籍可能已是现存最后容易获取的实体副本。
尽管涉及的书籍中,有相当一部分原本就会被削价处理、回收或送去填埋,但收录稀版本的做法遭到了档案工作者、收藏家和旧书商的批评。他们指出,现有更温和、非破坏性的扫描方法,只是速度更慢、成本更高。
整个过程基本不对外公开,因为中介服务向他们的AI客户承诺匿名。公众关注主要是通过诉讼披露和调查法庭记录、采访书商的媒体报道才逐渐增加的。
这种做法凸显了大规模AI开发中的现实矛盾:对巨量可靠人类文本的需求,与老旧印刷品有限的实体供给,以及保护珍稀副本的文化价值产生了冲突。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖