AI Pulse

微软高管内部称AI训练是“人类历史上最大规模的劳动盗窃”

微软高管内部称AI训练是“人类历史上最大规模的劳动盗窃”

微软自己的数据显示,Copilot“答案引擎”让纽约时报网站的点击率比传统Bing搜索下降了93%。过去要点进网页才看得到的内容,聊天机器人在对话框里直接给完了,新闻网站丢了绝大部分流量。

微软应用科学总监Brent Hecht把这种衰退叫做“厄运循环”。他在2024年1月的内部演示里解释,新闻机构活不下去、不再生产内容,模型就失去训练原料。整个网络的质量也跟着垮掉。微软另一份文件说得更直白:“最终产品威胁到其核心供应商的经济基础,这是极不寻常的,但这就是我们的LLM业务对”内容供应链“做的事情。”

内容是怎么拿到的

这起诉讼打了三年。纽约时报最初指控OpenAI和微软未经许可,用它的内容训练生成式AI模型。新解封的文件首次披露了内容是怎么到手的。

OpenAI员工涉嫌制定计划,绕过付费墙而不被发现。研究员Nick Ryder告诉OpenAI总裁Greg Brockman一个“绕过纽约时报付费墙的黑客方法”,Brockman回复:“啊,不错。”

文件还写明了双方如何从Bing索引里抓内容。OpenAI把整个GPT-3训练数据集交给微软,评估怎么在自己的商业产品里使用这些模型。微软则通过Project Taxi和Project Mango两个计划向OpenAI供数据。Project Mango的数据被组装成一个训练集,包含至少160,903份来自新闻出版机构的独特作品。

规模远不止这些。OpenAI的中期训练数据集里,来自纽约时报、每日新闻和调查报道中心的受版权保护作品超过91,692份。另一个源自Common Crawl的数据集,仅nytimes.com一个域名的文档就超过200万份。研究人员还特意剥掉训练数据中的版权声明,因为内部人“不希望模型向用户输出版权声明”。

内部人怎么看

Hecht在2023年1月的内部备忘录里,把这件事称为“史无前例的惊人盗窃”、“人类历史上最大规模的劳动盗窃”。

OpenAI自己人也有过类似判断。ChatGPT负责人Nick Turley在内部沟通里写道,出版商面临来自聊天机器人的“生存威胁”。这类产品“在很大程度上具有替代性”,而且会随着改进“变得越来越有替代性”。Brockman把模型描述为“擅长新闻”。

微软CEO萨蒂亚·纳德拉今年早些时候在证词里承认,聊天机器人确实“替代”了直接访问网站的行为。他还说,“任何付费墙后的内容,任何人想用于接地或训练都应该获得许可”。如果早知道OpenAI抓取并训练了付费内容,他会行使微软的权利,要求OpenAI重新训练模型。言下之意,这些具体操作当初没有让他知情。

纽约每日新闻的律师Steven Lieberman说:“这里首次揭示的证据表明,OpenAI和微软知道他们所做的是错误的。”

法律还没给出答案

AI公司到底能不能用受版权保护的材料训练模型,目前没有明确答案。法官们大多站在AI公司一边,认为训练构成“合理使用”。

本月早些时候,特朗普政府提交简报,为OpenAI未经许可用受版权保护材料训练大语言模型辩护。政府公开站队,天平又歪了一截。

微软自己的文件也承认,生成式AI存在“真实风险”,可能“显著扰乱那些生成训练数据的人的就业”。靠内容吃饭的人,正被自己产出的内容喂养出的东西挤压。

OpenAI和微软没有回应置评请求。

阅读原文
📚 相关主题 法律版权

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新