AI Pulse

被起诉的AI创业者:为什么最好的开放权重模型是中国造?

被起诉的AI创业者:为什么最好的开放权重模型是中国造?

美国在20世纪90年代对加密管制做了一场实验。它输了,然后退让了。这一次,没有人能在撤销令上签字。

1995年,一位名叫Damien Doligez的法国研究生,用大约120台工作站,在八天内破解了网景浏览器的加密。他并不是天才密码分析家。他也用不着是。他破解的浏览器,是网景被允许在美国境外销售的那个版本;而美国要求这个版本必须薄弱。

我很幸运。我当地的图书馆很早就接入了互联网,我小时候就在那里开始了上网。这就是我做现在这些事的原因:我联合创立了法律搜索引擎ROSS,然后是健康数据公司Flexpa,还创立了Maniac Ventures。如果你在90年代中期上过网,你会记得这场战斗。那是技术宅之间的谈资。Clipper芯片。密钥托管。邮件列表里争论政府能否禁止数学。印着RSA算法的T恤,被标记为不能离境的军需品。我像别的孩子跟踪棒球赛一样关注着它,而我当时并不明白我看到的是什么:一条规则只约束我们国家的公司,却把它们的海外客户拱手让给所有其他国家的公司。

如今,这种模式在开放权重AI模型身上重新出现了,这也是最优秀的开放权重模型之所以不是美国造的原因之一。我和这个结果利益相关。2020年,汤森路透就我们训练法律搜索引擎的方式起诉了ROSS。我们在即决判决中输掉了合理使用抗辩,第三巡回法院在6月审理了我们的上诉。我也是Harvey的投资者,这家法律AI公司基于一个中国模型构建了它的Tenet模型。这里其他一切都来自公开文件。你可以核实我。

40位浏览器

在1990年代的大部分时间里,美国将高强度加密作为军需品进行管制。按照与导弹部件同法管制的法律,出口它需要国务院的许可证。国务院会给40位密钥发许可证。一个40位密钥大约有一万亿种可能值,这正是Doligez用120台工作站八天遍历的数量。任何更强的加密都需要逐案申请许可证。

于是网景卖两种浏览器。美国版用128位密钥。国际版用40位。同一家公司,故意暴露了密钥中的88位,使出口版本达到要求。Doligez找到了剩下的40位,并发布了结果和警告:“别把你的信用卡号托付给这个协议。”

1996年6月,网景CEO Jim Barksdale告诉参议院,这个规则对他的公司意味着什么。出口版本“已经被法国和加州伯克利的大学生攻破。外国客户想要……128位,或更高。”他还说:“美国的出口管制不仅让美国公司失去销售,最终还帮助了海外竞争者。”他点名了一家公司,一家南非公司,它把128位加密软件宣传为“不受美国ITAR法规限制”。Marc Andreessen是网景联合创始人。Ben Horowitz于前一年以产品经理身份加入,后来负责安全产品。他们从内部目睹了这条规则让他们失去销售。

该规则的影响不止于浏览器。Phil Zimmermann写了PGP,一个免费的邮件加密程序,并在1991年发布它。当它离开这个国家时,政府以出口军需品为由对他展开了刑事调查。调查持续了大约三年。1995年,麻省理工学院出版社将完整的PGP源代码作为一本书出版,因为出口规则覆盖软件但不覆盖书籍。Zimmermann在序言中写道,这本书是对调查的直接回应。美国检察官在1996年1月结案,“拒绝就原因置评”。伯克利研究生Daniel Bernstein起诉要求获得发布自己加密代码的权利。1999年,第九巡回法院的一个合议庭裁定源代码是受第一修正案保护的言论。全院撤回了该意见以待重审,后来规则改变,案件也就不了了之。

这里是要紧的部分。这个规则约束美国公司,不约束任何其他公司。国外的买家仍然能得到高强度加密。他们只是不能从美国公司那里现成买到,而外国公司走进了这个空档。德国公司Brokat进入了网上银行业务,凭借提供给德国银行比网景或微软浏览器中更强的加密。到1998年,总统自己的出口委员会小组委员会报告称它占据了“50%的欧洲网上银行市场”。爱尔兰的Baltimore Technologies。以色列的Check Point。芬兰的Data Fellows。加拿大的Entrust。南非的Thawte,就是Barksdale点名的那家。1999年乔治华盛顿大学的一项调查统计了美国以外35个国家制造的805种加密产品,并发现外国广告暗示美国的加密“由于出口管制可能不够强”。小组委员会的结论是:“管制对美国工业的不利影响是显而易见的。”

1996年底,克林顿总统通过行政命令将加密从军需品清单移交给商务部。1999年9月,政府宣布将在许可证例外下允许高强度加密出口,2000年1月发布了规则。商务部部长的陈述理由是:政府正在“调整我们的法规,以适应美国公司在海外销售产品时面临的市场现实。”国会研究服务处记录了这个行业的论点:管制“阻碍了美国的技术发展,因为为国内和国外市场开发不同的产品是不切实际的”,而且无论怎样,国外强加密都能得到。隐私只得到了一句话条款。给出的理由是市场。规则把近十年的销售交给了外国竞争者,政府因为竞争力而放松了它。

无人通过的规则

历史不会重复,但会押韵。这句话常被归功于马克·吐温,尽管人们找到的最早近似说法是1965年一位精神分析学家写的。下面就是押韵之处。

看看排行榜。本周的Artificial Analysis Intelligence Index,一个独立基准,前十名都属于美国闭源模型:Claude和GPT。最有能力的开放权重模型,也就是你可以下载并自己运行的那个,是北京智谱AI的GLM-5.3。它下面:月之暗面的Kimi K3,深度求索的DeepSeek V4.1 Flash,阿里巴巴的Qwen 3.8。该指数上开放模型前六名都是中国的。第一个美国模型来自Thinking Machines,排在第九。Meta的Llama 4和OpenAI的gpt-oss没有进入开放模型前十。

美国实验室打造最好的模型,然后发布“40位版本”。Meta和OpenAI都提供开放权重。但它们发布的开放权重远落后于前沿,前沿保持闭源。中国实验室发布了开放前沿,美国公司正在其上构建。起诉我的汤森路透,用Qwen构建了它的Thomson-1.0-Small模型。Harvey用Kimi构建了Tenet。与1996年同样的形状。美国的开放版本是弱的,中国的开放版本是开放领域中最强的。客户会去产品所在的地方。

安德森和霍洛维茨,将近三十年后,在《Little Tech Agenda》中写下这样一句话:“现有企业往往还有另一个巨大优势——能够调动政府来对付初创竞争者。”1996年,没有现有企业需要调动;政府自己做了。2026年,调动经由法院进行,其中一只手属于一家法律出版商,它的案件名单上有我公司的名字。

为什么美国前沿保持闭源,而中国前沿却在发布?除了这些公司内部的人,没有人能对这些原因进行排序,我也不假装可以。我可以列举它们。闭源模型通过API销售,开放权重与这部分收入竞争。Anthropic认为开放权重比闭源模型带来更多滥用风险,因为在一个任何人都能下载、没有人能监视的模型上,护栏很难保持。开放权重可以被任何人蒸馏,而蒸馏意味着用另一个模型的答案训练你自己的模型;Anthropic本月报告中国实验室用欺诈性账户蒸馏Claude,如果模型是开放权重,这本来是没有必要的。诉讼是要花钱的,针对Anthropic的作者集体诉讼Bartz案让它花了15亿美元;这样的账单从闭源模型的收入中支付,因为开放权重不产生收入,而且没有中国实验室在美国法院支付过账单。另外,斯坦福团队去年认为,美国版权法可能对开放发布比闭源发布更严厉。

前三点适用于任何国家的实验室。后两点只落在美国法院能够触及的实验室身上,而第五点就像1996年的出口规则。美国实验室仍然可以在其下发布开放权重。它给每次开放发布加上一个闭源发布不承担的价格。它们发布的版本因此成了“40位”。

开放权重才是重税所在

Andreessen Horowitz在2023年10月告诉版权局,“将实际或潜在的版权责任成本强加给AI模型创作者,将扼杀或严重阻碍它们的发展”,并且将训练视为侵权“将有利于最大的科技公司——那些最有财力、最有动机让AI模型避开竞争的封闭者”。它警告说结果“可能让美国输掉全球AI主导权的战斗”。那是在Bartz和解和上面这个排行榜之前。压力最重地落在开放发布上。

闭源模型隐藏了它大部分的学习来源。开放权重则给每个原告的专家一份可以探查的副本。2025年5月,一个由斯坦福领导的团队,包括Mark Lemley、Daniel Ho和Percy Liang,发表了一项研究,测试了17个开放权重模型是否记住了受版权书籍的段落。他们能够这样做是因为权重可下载。闭源模型也会泄露;2023年研究者从ChatGPT中提取了训练数据,纽约时报也从中取回了自己的文章。但在法庭之外,闭源模型只能通过前门探测,一次一个提示,受供应商速率限制,供应商过滤器背后,供应商一旦注意到就可以关门。开放权重你可以带回家。你可以运行测试一百万次并直接读取模型的概率。没有人能修补你已经下载的东西。

斯坦福测试发现Qwen 2.5 72B很可能训练过Books3中的至少部分书籍。那是将近20万本书的盗版合集,Meta的第一篇Llama论文将其列为来源,也是Anthropic下载的第一个盗版库。同样的测试对Google的美国开放模型Gemma 2也得出了同样结论。

斯坦福的作者们自己得出了结论。我让他们来说:“这些版权规则的效果可能是让公开分发的模型比封闭系统背后的模型受到更差的待遇,因为分发的模型包含某些受版权作品的潜在副本或衍生作品。但是,没有好的政策理由在版权法中比专有模型更苛刻地对待开放权重模型。”他们给风险标了数字:每部作品最高15万美元的法定赔偿,以及可能的法院销毁模型命令,他们称之为“对训练这些模型的公司的生存威胁”。

威胁不是理论上的。Bartz诉Anthropic案以15亿美元和解,大约40万本书,每本约3000美元,7月最终批准。Alsup法官已经裁定训练本身是合理使用。账单是针对盗版库的。而且那是一个闭源模型。证据开示在没有任何权重公开的情况下就触及了Anthropic的库。这正是前一篇的要旨:美国公司无论怎样都会被质询。开放权重只是增加了一扇永远关不上的门。实验室留下了一件值得注意的事:他们停止说出的东西。

Meta的第一篇Llama论文,2023年2月,列出了它的训练来源,包括“ThePile的Books3部分……一个用于训练大语言模型的公开数据集”。图书作者于2023年7月7日提起Kadrey诉Meta,其修改后的起诉状引用了Llama论文中的这句话。Meta的Llama 2论文在11天后,即7月18日发布。其数据部分写道——这就是该部分关于来源的全部内容:“来自公开来源的新数据混合,不包含Meta产品或服务的数据。”没有提到任何来源。OpenAI的GPT-4报告,在那年3月,在这些诉讼之前,拒绝说明任何细节:“鉴于竞争格局和GPT-4这类大模型的安全影响,本报告不包含关于架构(包括模型大小)、硬件、训练算力、数据集构建、训练方法或类似内容的其他细节。”

我不会告诉你他们为什么沉默。我已经把日期排列在一起。你自己连线。

现在看太平洋的另一边。阿里巴巴在自己网站上表示,Qwen列出的第一个训练来源是“公开可用的互联网数据”,数据集“可能包含受版权、商标或专利保护的内容”。斯坦福的测试说Books3中的书籍很可能在里面。阿里巴巴仍然发布权重,一个版本接一个版本,没有美国法院给它开过账单。没有美国案例能到达杭州,也没有曼哈顿的判决会在那里得到执行。我上周写过为什么你无法质询阿里巴巴。这个事实对市场的作用就是这样。美国实验室为它构建的一切支付诉讼税。在开放发布上它支付附加费,而下载不会给它带来任何收入。中国实验室则不用在美国法院支付其中任何一项。你不必相信证据开示风险是美国前沿保持闭源的原因。它只需是边际上的一个原因,就足以让前沿开放模型最终成为中国造。边际正是市场移动的地方。

这就是1996年规则重建后的形状。它约束美国法院能够触及的公司,而至今还没有美国法院触及发布开放前沿的实验室。在它建立的过程中,开放权重排行榜被中国模型填满。没有立法机构通过它。它是由起诉状、证据开示、一份针对我公司的即决判决和一份15亿美元和解协议拼凑而成。原告中包括一家法律出版商,它自己的Thomson模型就是建立在Qwen上的。

这次的不同

上次规则由政府书写,所以政府可以放松它。1996年一个行政命令,一次公告,一份联邦公报通知,网景就能向法兰克福出口128位密钥。这花了90年代大部分时间,终究还是实现了。

这一次没有联邦公报通知。规则存在于地区法院的意见和和解协议之中。国会可以重写它。在国会这样做之前,能缩小规则的是法院正确把握合理使用:当模型不向公众提供原告的表达时,训练就是合理使用;如果模型输出了某人的文本,那个输出就按它本身来评判。司法部在9月1日告诉法院,重要的是“显著的替代竞争”,而不是泛泛的竞争。第三巡回法院有第一个关于训练的上诉案件,即我们的,6月已辩论。时报案和其余OpenAI案件将在纽约南区、第二巡回法院,也许后面还有最高法院。2000年的撤销用了近十年。法院可没有这么多时间。

与此同时,实验室有自己的时钟。OpenAI设定了在2028年3月实现完全自动化AI研究员的目标,并在今年9月推出AI研究“实习生”。其首席科学家称这是“我们最重要的目标”。Anthropic联合创始人Jack Clark认为AI在2028年自主改进自身的概率为60%。前OpenAI研究员Daniel Kokotajlo在他的AI 2027情景中认为时间更早,他说人们私下告诉他他的时间表太保守了。不是所有人都相信这些时间表。上个月报道的一项普林斯顿研究发现,今天的智能体缺乏开放端研究的判断力。Clark自己也称这是“对短期递归自我改进时间表的看空信号”。就算站在怀疑者一边,把每个日期加倍,它仍然比最高法院早。

因此,活生生的可能性是这样的:AI在法院确定训练它是否合法之前开始构建AI。任何人都能带回家并在其上构建的模型是开放模型。而前沿开放模型是中国的。美国给自己的实验室加税,开放发布则提高账单。中国实验室还没有付过。

1995年,一个法国学生八天攻破了美国浏览器,因为美国法律使它可被攻破。规则在它仍然重要的时候被撤回。2026年,一家美国公司想要一个确实可以下载的前沿模型,它只能从中国获得,而背后那条规则没有人能签署掉。这是不会重复的部分。它押韵,而且韵脚更糟。法院在问题失去意义之前只有一次机会把合理使用做对。在他们把握机会期间,任何美国产品能下载到的最好开放模型都是中国的。

阅读原文
📚 相关主题 商业版权

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新