Anthropic同意为盗版书籍训练模型赔15亿美元
Dario没有理由因为Kimi蒸馏Claude而生气。
Anthropic自己刚刚才同意为盗版书籍训练模型一事,向相关作者支付总计15亿美元赔偿。平均下来,每一本被侵权的书大约赔偿3000美元。
更有意思的是,Dario自己也承认,在百度工作的一年让他意识到,数据隐私并没有那么重要。当时他主要从事语音识别研究,而很多训练数据都是未经授权直接拿的。这段经历进一步强化了他对Scaling Law的信念。因此,自己干Anthropic之后,他们同样尽可能收集各种数据用于训练模型。
我认为,他真正气的并不是知识产权,而是这从根本上破坏了前沿AI实验室的商业模式。
历史上,每一代最先进大模型的训练成本通常都会比上一代增长约4到10倍,甚至更多。例如,GPT-2的训练计算成本约为10万美元,而GPT-3已经达到约1000万美元,GPT-4的计算成本则约为1亿美元。这些数字还仅仅是算力成本,并没有包括研究人员薪酬、数据获取以及其他研发支出。
因此,即使没有开源模型竞争,仅靠API收费模式,要获得正向投资回报也变得越来越困难,因为模型性能提升正在放缓,而训练成本却持续飙升。
如今,开源模型通过蒸馏技术,大约只需要6个月就能追赶到最先进闭源模型的水平。这意味着OpenAI、Anthropic等前沿实验室,实际上只有约半年的时间,依靠最新模型尽可能创造收入。半年之后,就会出现性能达到其90%,但成本只有10%的开源替代方案。
越来越多的美国企业也已经意识到,最顶尖模型带来的那一点性能优势,并不足以支撑其高昂的价格,因此开始转向成本更低的中国开源模型。就连Sam Altman的铁哥们儿Brian Chesky,公开说在Airbnb的部分AI开发中也采用了阿里的千问,而不是ChatGPT。