AI Pulse
📡 X 信号

AI公司收旧书扫完训练数据就把实体书毁了

AI公司正在大量收购二手、珍稀和绝版书籍,将它们扫描制成训练数据,并且在很多情况下扫描后会销毁实体书。

随着各大实验室开始寻找不包含AI生成内容的高质量人类手写文本,这种做法的速度已经加快。当下公开互联网上绝大部分内容都已经被AI生成内容填满。

记录最完备的案例是 Anthropic 内部代号为巴拿马项目(Project Panama)的行动。版权诉讼的法庭文件显示,该公司从 Better World Books 这类二手书商和批发商手中收购了数百万本实体书。

工人用液压切割机切掉书脊,将松散的书页送入工业高速扫描仪,然后丢弃或打成纸浆。一份内部规划文件将目标描述为「大规模破坏性扫描书籍」。

一名联邦法官后来裁定,购买书籍、通过这种方式制作内部数字副本、销毁原件的行为,属于美国版权法下的转换性合理使用,部分依据了首次销售原则。

类似的活动如今已经非常普遍。包括 ISBNdb 在内的专业中介公开向AI实验室推销批量收购服务,订单范围从几千本到多达一百万本。他们把老旧印刷书宣传为「结构干净」的训练数据。

美国和欧洲的书商报告称,混合随机选书的批量订单突然激增,其中就包含珍稀和绝版书籍。其中部分书籍可能已是现存最后容易获取的实体副本。

尽管涉及的书籍中,有相当一部分原本就会被削价处理、回收或送去填埋,但收录稀版本的做法遭到了档案工作者、收藏家和旧书商的批评。他们指出,现有更温和、非破坏性的扫描方法,只是速度更慢、成本更高。

整个过程基本不对外公开,因为中介服务向他们的AI客户承诺匿名。公众关注主要是通过诉讼披露和调查法庭记录、采访书商的媒体报道才逐渐增加的。

这种做法凸显了大规模AI开发中的现实矛盾:对巨量可靠人类文本的需求,与老旧印刷品有限的实体供给,以及保护珍稀副本的文化价值产生了冲突。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 09:00 · 14:30 · 19:30 更新