AI Pulse

我核对了AI怀疑论者Ed Zitron的预测,几乎全错

我很好奇,我们最常被引用的AI怀疑论者(Ed Zitron)的预测表现如何,于是我考察了他的预测结果。先说我的立场:我从来没有特别强烈的支持或反对AI进展的立场。比如,在2022年,我对未来学家(包括像Kurzweil这样受人尊敬的人物)的预测做了全面考察,发现他们在预测结果和推理上基本都是错的。另一方面,在2015年,我写过文章说人们正在低估AI取代人类工作的能力,并且我多次公开表示,很多人低估了AI取代人类工作的能力。我对AI的立场非常无聊,基本上是:“如果某件事正在发生,那么那些说它永远不可能发生的人可能是错的。”我见过很多AI怀疑论者在对AI的回应中会说,所有说AI不是假的的人都是出于私利的骗子。就我个人而言(显然对我自己不利),我在AI公司没有特别的经济利益。我通过无聊的指数基金持有一些标准份额。我也有一些种子期投资,但只是因为时机和大涨的领域,我投资组合中AI的比例偏低。我不在AI实验室或为AI实验室供货的公司工作。我之前提到过我在面试方面糟糕得可笑,几年前我确实面试过一家AI实验室,然后在电话筛选环节挂了,表现之糟糕一定是启发了Jeff Atwood那篇著名的《为什么程序员……不会编程?》(Why Can“t Programmers… Program?),他在文中得出结论,一定有很多假程序员,因为如果会编程,不可能在编程面试中差到那种程度。如果AI发展得好,我并不特别受益,最多只是像所有持有宽基指数基金的人那样受益,但我确实在乎准确性。

2024年:Meta、Google和Microsoft正在消亡

由于预测结果有很多,让我们在看完整列表之前先详细看一个,了解一下Zitron的推理方式。我们随便看看这个2024年11月的演讲,Zitron在其中说,主要科技公司(如Meta和Google)正在消亡,它们在AI上乱挣扎是因为不知道怎么增长。Zitron特别指出Meta是一家正在消亡的公司(”这是一个垂死的产品,也是一种垂死的公司“)。Meta的收入和利润(GAAP营业利润)为:

期间收入金额收入增幅利润金额利润增幅
2023$135B16%$47B62%
2024$165B22%$69B48%
2025$201B22%$83B20%
2026上半年$117B30%$42B10%

当他谈到公司不知道怎么增长时(”这些公司都不再真正知道如何增长……在绝望地试图重新点燃一个垂死生态系统中的增长的过程中,科技行业会把AI硬塞进一切东西里“),他点名了Google和Microsoft。Alphabet(Google的母公司)的收入和利润如下:

期间收入金额收入增幅利润金额利润增幅
2023$307B9%$84B13%
2024$350B14%$112B33%
2025$403B15%$129B15%
2026上半年$230B23%$80B30%

Microsoft的数据如下(注意,为了保持一致性,所有数字都是日历年而不是财年数字):

期间收入金额收入增幅利润金额利润增幅
2023$228B12%$101B21%
2024$262B15%$118B17%
2025$305B17%$143B21%
2026上半年$173B18%$79B19%

虽然这不是Zitron陈述的精神,但有人可以说Meta确实在消亡,只是还没有死透。然而,Zitron这里论证的推理是错误的——Meta、Google和Microsoft的生态系统并没有在消亡。鉴于这些公司增长如此之快(按收入和利润计),看起来AI并不是像Zitron暗示的那样,是它们因为”不知道如何增长“、黔驴技穷之下才抓住的某种绝望之举。我认为不值得对每个预测都花这么多篇幅,但Zitron在这里使用的模式是有代表性的。为了论证这些公司正在消亡,他抓住了一些次要问题,这些问题并不足以导致他暗示的即将发生的巨大变化。对于Meta,他引用了某种所谓的Facebook MAU下降。他没有使用Meta自己公布的MAU数据或任何收入或利润数字,而是似乎用了Similarweb的数据。我对这类第三方追踪数据的经验是,它们相当不准确,除了粗略的量级比较外基本没用,因此Zitron引用的下降毫无意义。FB在2023年12月停止公开报告MAU,但大多数估计显示FB MAU随时间在增加,Meta报告的数据也显示其产品的使用量在总体增长;Zitron挑选了一个异常的偏低估计来证明他的观点。对于Google,他引用了Prabhakar Raghavan,称其”真正邪恶“,是”站在管理咨询派一边的计算机科学阶级叛徒“,对Google搜索造成了某种严重损害。在他对Raghavan的咆哮中,他从未可信地确立Raghavan正在对Google搜索造成严重伤害,而评论过他咆哮的Google搜索工程师似乎也不同意Raghavan是搜索问题唯一或主要原因的假设^1^。但即使我们假设Zitron是对的,反派Prabhakar Raghavan击败了英雄Ben Gomes,给Google搜索造成了某种问题,这仍然不足以说明Google的收入增长总体上陷入困境,因为它们还有一系列其他主要产品(如YouTube和Google Cloud),即使搜索不增长,这些产品也能推动增长。这里推理链条的每一个重要环节不仅不正确,而且如果你对Google或大公司的运作方式有所了解,它根本不成立。我会第一个说Google搜索质量存在一些严重问题,而且Google一直在提高收入相对于用户体验的优先级。2013年我在Google的时候,这对许多以用户为中心的工程师来说是一个令人恼怒的问题。对于Zitron引用的一个问题,即广告让用户困惑,2013年我问过一位搜索工程师,Google为什么把广告背景色改得更像搜索结果,因为之前有研究表明,广告越像搜索结果,用户就越困惑某个结果是广告还是真正的搜索结果,我听说Google故意让广告看起来不像搜索结果以避免用户困惑。那位搜索工程师说,因为有些人不想让用户困惑,所以不可能通过一次改动就让广告变得几乎与搜索结果一模一样,因为那太明显了。实现方式将是每次A/B测试把广告调整得更像搜索结果一点,你都会赚更多的钱,所以这种变化会在多年里分多个小步骤进行,每一步都小到让想反击这种事情的人难以找到理由。事情正如那位工程师预测的那样发生了,但无论最终是不是Raghavan主管搜索,这种事都会发生。当然,这类事情的发生并不会导致Google增长空间耗尽,变成一个绝望地想在垂死生态系统中重新点燃增长的公司。无论你认为Google应不应该这样做,这都是让Google赚更多钱的事情。

人们如何引用Zitron?

据我所知,人们引用Zitron的方式是把他当作权威,这样他们就可以说:这位看了数据的人做出了这个断言,所以他们的说法有数据支持。事实证明,如果你看了看Zitron的断言并了解一些相关话题,那些断言根本不成立,但我认为这不是重点。重点是人们可以说有人看过数据。另一个重点似乎是,这家伙很愤怒^2^,这是驱动参与度的好方法。但当人们提起他时,他们当然通常不是引用他的愤怒;他们说,这有个看了数据的人,如果你对AI感到愤怒,他和你一样对AI感到愤怒,而且他有数据支持。^3^ 就像我上面说的,我不想对每个断言都这么详细;这只是关于下面的断言看起来是什么样子的一个说明性例子。在我读过的他的任何文章中,虽然到处扔数字,但数字并没有真正连成一个连贯的论证。在很多情况下,正如我们上面看到的,数字甚至不真正支持他的论点(比如Facebook MAU下降导致Meta财务问题,然后导致Meta虚假地把AI插到不属于它的地方)。我怀疑他依赖的是人们看到数字就两眼发直,不思考数字意味着什么。对于下面的预测,有人可以有完全相同的预测记录,但理由完全合理,只是没有应验。或者有人可能每个案例都对,但也是错的,因为他们的理由全都是错的。像后者这样的人可能有些说不出的直觉,或者也许只是运气好。幸运的是,我们不需要做这个困难的判断,因为Zitron在预测上是错的,在推理上也是错的。

对Zitron有细致关注的人

因为我多年来一直与世隔绝,最近才跟上AI讨论,所以我实际上没有读过或看过Zitron或任何大型AI评论员的任何东西,但当我查了那些有良好判断力的人怎么说时,他们也觉得Zitron对数字的使用只是障眼法,比如Juho Snellman的这个评论:

> 他的写作当然浮夸,但攻击性和脏话更多是针对那些已经相信他写的东西的人进行煽动,而不是为了让人们改变想法。他找到了反科技欺诈(anti-tech grift)这个利基市场,现在正在尽其所能地利用这个利基。但你可能真的应该核实一下他说的几个让你信服的事情,因为至少在他的书面文章中,基本上一切都是编造的或被歪曲的。当然有很多来源链接,但如果你顺着它们找到原始出处,它们所说的和Zitron暗示的非常不同。

这里有个例子,评论者似乎出于某种原因假设Zitron的分析很好,Juho Snellman对此回复:

> 关键问题在于他的经济分析完全是垃圾。我曾经以为他只是完全无能,但考虑到错误的偏向性,这显然是故意的欺骗。但这往往很难回击,因为他写的每篇文章都是一万字的”滔滔不绝的废话“(gish gallop)。我几次试着在HN评论中驳斥他犯的其中一个故意错误,人们抱怨回复太长。比如,当Timothy B. Lee查看Zitron用来制作Anthropic收入预测的电子表格时,他发现:
>
> 他不计算2月1日至10日,3月1日至10日算了两遍,8月21日至10月21日算成一个月而不是两个月,也不计算10月21日至11月1日。[另一位评论者指出他的电子表格还有2月30日]……Ed声称他试图计算Anthropic 2025年的收入,得出36亿美元,暗示有什么猫腻[但修正错误后数字就对上了]

一些Zitron的预测

- 2024年2月:”我相信我们正在触及生成式AI能做什么以及其输出能有多准确的极限。“ 错误^4^
- 2024年3月:”我们是否已经到了AI巅峰?“;另一个预测,即幻觉意味着AI进展被限制在当时的水平。错误
- 2024年4月:”正如我之前警告的,人工智能公司正在耗尽数据……“;另一个预测,即因为没有更多数据,模型无法改进。错误^5^
- 2024年6月:OpenAI的增长正在停滞(暗示会继续停滞),这将导致OpenAI某种崩溃。错误(OpenAI有可能崩溃,但如果是这样,也不会是因为2024年的增长停滞)
- 2024年7月:”生成式AI,就像我在3月说的那样,正在见顶,如果还没有见顶的话。它现在做的事情已经差不多到极限了,除了用一些新的输入更快地做更多同样的事情。“ 错误
- 2024年7月:”生成式AI模型并没有变得更节能,也没有变得更“强大”,从而增加其功能“ 错误(模型继续变得更强大)^6^
- 2024年8月:”生成式AI是一项已经见顶的死胡同技术“ 错误
- 2024年8月:重申AI泡沫有3个季度来证明自己(从2024年3月起),否则就会崩溃 错误(Bartek Ogryczak指出,可以说正确,因为AI已经证明了自身,但Zitron也声称没有改进,所以按Zitron自己的说法,还是错误)^7^
- 2024年9月:”o1表明OpenAI既绝望又没有想法“,并重申模型因缺乏数据而无法改进的观点 错误
- 2024年10月:OpenAI预测2024年收入37亿美元、2025年116亿美元、2029年1000亿美元是荒谬的,”如此离谱的声明,让我惊讶于把它说出来居然不算某种金融犯罪“ 错误(2025年目标已超额完成,2029年待定,但并非离谱到金融犯罪级别的不可信)
- 2024年10月:”[OpenAI收入]增长已经在放缓,进入新的一年将急剧放缓“ 错误(OpenAI超过了预测并继续快速增长)
- 2024年12月:”我在3月也警告过你,生成式AI已经见顶了。“ 错误(而且奇怪的是,暗示自2024年3月以来没有任何进展)
- 2025年1月:”我相信我们正处于AI巅峰“ 错误
- 2025年1月:”DeepSeek已经把LLM商品化了“ 错误(OpenAI和Anthropic当时和现在都有显著的定价权,可以将价格维持在远高于DeepSeek的水平)
- 2025年2月:Anthropic在2027年实现345亿美元收入”在很多层面上都很可笑,最主要的是,OpenAI在2024年的收入大约是Anthropic的两倍,同年API调用收入勉强超过10亿美元。“ 错误(无论他们2027年能否做到,其2026年的ARR远超此数,使得2027年的估计并不可笑;还要注意,Zitron认为对AI的投资永远不可能有正回报,这取决于这些估计是假的,但到目前为止这些估计都被超过了,尽管Zitron自信地认为连达到估计都不可能)
- 2025年2月:”Sundar Pichai希望Gemini“在2025年底前拥有5亿用户”,“这个数字太不现实了,Google应该有人被解雇,而那个人就是Sundar Pichai”。“ 错误(Gemini达到了7.5亿用户)
- 2025年2月:”Sam Altman把Orion从GPT-5降级为GPT-4.5,这表明OpenAI在开发下一个模型时遇到了瓶颈,迫使他降低预期“;可能正确?(GPT-4.5确实不出彩,但如果他的”碰壁“框架是他关于模型永远无法改进的论点的一部分,那仍然是错误的,因为GPT-5是一次重大改进)
- 2025年2月:”我会继续写这些东西,直到我被证明是错的。“ 错误(Zitron在被反复证明错误后仍继续写)
- 2025年3月:”在我写这份通讯的这些年里,我很少遇到像CoreWeave这样腐烂的公司……“Zitron接着说,这家公司除了靠融资外活不过六个月,虽然筹集40亿美元可能能给它买到一年时间 错误(CoreWeave仍然存在,而且本文写作时股价是IPO价格的两倍多;CoreWeave在IPO时只筹集了15亿美元)
- 2025年4月:Zitron再次喊泡沫,并说”我们即将知道我是对是错。“ 错误(Zitron暗示即将发生重大事件来证明他是对的,但没有发生)
- 2025年4月:”同时,在这一点上,相当明显的是,生成式AI不会比今天做得更多。“ 错误
- 2025年5月:”我不知道你如何从这个故事里得出Cohere不会死的结论。他们的预测与现实相差太远了。“ 技术上不可证伪,因为没有截止日期,但隐含的说法是错误的
- 2025年7月:”我不是想戏剧化,但很容易得出Cursor要完蛋的结论“ 错误(Cursor以600亿美元退出)
- 2025年8月:”这些模型显然撞上了墙,训练进入收益递减阶段“ 错误
- 2025年8月:Zitron说Cursor正在死亡,并预计它会以跳楼价出售;高达100亿美元的价格都不太可能:”Cursor值100亿美元吗?不!无论其产品好不好,都不足以卖出一个不需要Cursor烧掉数亿美元且看不到头的价格。“ 错误
- 2025年10月:在回答”如果你必须猜,AI泡沫破裂的时间线是什么?“时,Zitron回答”不晚于2026年第二季度“ 错误(注意Zitron加了”不晚于“,这使得这是一个上界而不仅仅是最佳猜测的更强断言)
- 2025年11月:”我们正在耗尽高质量训练数据,在训练范式下正撞上缩放定律的墙,这些模型并没有变得更好。我们今天看到的东西基本上就是它们永远的样子“ 错误

在这之后,我看到的进一步预测大多要么不可证伪,要么在未来才能见分晓。注意,我没有尝试去记录那些无意义或当时就只是事实错误的陈述,比如他在2024年12月声称”生成式AI的产品实际上已经被封存在琥珀里一年多“,或者他在2026年1月声称”[模型]基本上和一年前一样。它们的效力相同“。Zitron不仅做出了AI能力不会提高的前瞻性声明,他还一贯做出能力没有提高的回溯性声明,这些声明当时虽然明显是假的,但似乎对他的基本盘很有效(连同他的其他虚假陈述)。如果你把他所有的陈述连在一起,暗示的是AI在2026年1月的能力与2023年12月相同(如果你把后来的一些陈述也连起来,实际上暗示的是2026年8月的能力与2023年12月相同,不过公平地说,Zitron经常自相矛盾,并且也在2026年年中承认了有限的改进)。平心而论,我们可以说Zitron在口语化地说话,所以当他说”实际上被封存在琥珀里一年多“之类的话时,并不意味着2023年12月以来真的没有变化,所以这些陈述不是传递性的。如果我们谈论的是100年的进步,有人说一年内没有变化,意思是只有1%的变化,但这仍然可能意味着100年内有100%的变化。然而,我们这里谈论的是三年。即使你假设一种口语化的不严谨,这些陈述的集合仍然暗示,从2023年12月到2026年8月,改进是非常微小的(也许,如上所述,除了一些他自相矛盾并承认某些领域有有限改进的情况)。

与受人尊敬的未来学家的比较

如果与我们在未来学家分析中的表现进行比较,在风格上,Zitron比我们考察过的任何未来学家都更依赖愤怒。在推理质量上,他可能比那些未来学家平均略好一点或差不多。尽管几乎在所有事情上都是错的,他并不比Buckminster Fuller更不讲道理,后者认为我们可以通过无线电发送人,因为原子有频率,无线电波有频率,所以有可能收集我们所有的频率并通过无线电发送。在推理风格上,在被考察的未来学家中,他可能最接近Kurzweil,因为他用数字来营造一种可信度的光环,但如果你了解他讨论的话题或看看数字,推理就垮掉了。Zitron的推理并不比Kurzweil差,后者(例如)不断做出未能应验的极快进步的新预测(比如2001年预测到2011年实现无限寿命)。不断因为错误的原因预测AI进步将停止,只是站在了进步赌注的另一面。不是无限的进步,而是完全没有进步。每次这个预测被证明是错的,你都可以再做一个类似的预测,然后把日期稍微往后挪一点(双方的粉丝也使用同样的技巧;Zitron的粉丝只是声称他的预测是真的,就像Kurzweil的粉丝引用他86%的预测准确率,即使如果你真的去看看他据称86%准确的那些具体预测的实际结果,他的真实准确率是7%)。

Michał Zalewski(lcamtuf)对为什么会发生这种情况有一些想法:

> 建立大量追随者最可靠的方法是阐述清晰、强烈、不容置疑的立场。你不可能从”嗯,市场可能涨也可能跌"、“两党都有道理”、“AI有些优点也有些炒作”中获得太多播客或电视露面。或者,借用帖子里那个例子,“哈利·波特是一本还行的书”。事实上,这里有一个正反馈循环。如果你采取一个挑衅性、前卫的立场,你会得到更多关注和点赞,于是你有点……自我激进化?在某个时刻,这不再是一个可以改变的观点。这是一种身份,一个个人品牌。这就是……为什么Ed Zitron有一个爆款博客,说这一切都是一个大骗局。如果你采取更细致的观点,你最好的结局是没人回应,最坏的结局是招来双方的白眼。^8^

对于寻找推理良好的反AI观点的人,我觉得whitequark相当不错(不是说我都同意,但我认为推理是扎实的,我可以理解如果前提略有不同,有人会同意),但当然whitequark没有Zitron那样的大受众。

你能把错误立场维持多久?

我很好奇,在一系列关于进步的预测失败之后,人们会怎么做。对于未来学家,即使是那些几乎完全错误的人(这里考察的每一个都是),他们仍然可以提出某种说法,比如“我预言的事情有四分之一发生了,只是花的时间比我预期的长两到二十倍”,如果他们不那么死磕准确性,他们可以把这个四舍五入成“我预言的事情发生了”,这通常就是他们所做的。这似乎对他们很有效,因为反正没人在乎细节,这就是Kurzweil所谓的86%预测准确率如何成为一个既成事实的原因;人们实际上并不在乎预测结果如何,尽管我在2022年已经驳斥了86%的说法。

但是像Paul Ehrlich这样的人呢?他预言迫在眉睫的灾难,而他写作的时候那件事显然没有发生,后来也没有发生。只要看看Ehrlich的维基百科页面,我们有:

一个常见的批评是Ehrlich的预测经常没有应验;例如,《Reason》杂志的Ronald Bailey称他为“一个屡教不改的末日论者……据我所知,他那些迫在眉睫的灾难预言一次都没对过。”[41] 在1970年第一个地球日,他警告说“[十]年内,海里所有重要的动物生命都将灭绝。大片海岸线将因为死鱼的恶臭而不得不疏散。”[41][42] 在1971年的一次演讲中,他预言:“到2000年,英国将只是一小群贫困的岛屿,住着大约7000万饥饿的人。”“如果我是一个赌徒,”Ehrlich教授在上飞机前总结道,“我愿意赌英国在2000年将不复存在。”[41][42] 当这种情况没有发生时,他回应说:“当你预测未来时,你会出错。错多少是另一个问题。如果我打了赌,我就输了。但是,如果你仔细看看英国,我能说什么呢?他们有各种各样的问题,就像其他所有人一样。”[41] Ehrlich在《人口炸弹》中写道,“印度不可能在1980年前养活两亿多人口。”[27] 1967年,Ehrlich呼吁切断对印度的紧急粮食援助,称其“无望”。[43] 这一立场后来受到批评,因为印度的粮食产量随后通过印度绿色革命飞速增长,其人均卡路里摄入量在接下来的几十年里显著上升,即使其人口翻了一番。[44] 自20世纪60年代以来全球粮食生产的大幅增长和人口增长的放缓,在当前不可再生资源持续枯竭的背景下,避免了Ehrlich夫妇所预言的那种规模的粮食短缺、饥荒和灾难。加拿大记者Dan Gardner在他2010年的著作《Future Babble》[45]中认为,Ehrlich在承认自己犯下的错误方面不够坦诚,同时在为他声称“正确”的事情邀功时又不诚实或含糊其辞。例如,他很少承认他在预测物质短缺、大规模饥饿死亡(在《富足时代》中多达十亿人)或对特定国家的灾难性影响方面犯下的错误。同时,他很乐意声称自己“预测”了艾滋病或全球变暖的增加。[13] 在疾病方面,Ehrlich曾预测基于过度拥挤或饥饿人群免疫系统减弱,一种疾病会增加,所以“把这一点看作预测了20世纪80年代艾滋病的出现是一种牵强”。同样,全球变暖是Ehrlich描述的情景之一,因此声称对此有功,同时又不为失败的情景承担责任,是双重标准。Gardner认为Ehrlich表现出典型的认知失调迹象,他未能承认自己判断中的明显错误,使他对当前的想法也变得可疑。[13] Barry Commoner批评了Ehrlich 1970年的声明:“当你到达一个意识到进一步努力将是徒劳的节点时,你不如照顾好自己和朋友,享受你所剩不多的时间。对我来说,那个节点是1972年。”[46] Gardner批评Ehrlich认可William和Paul Paddock在《Famine 1975!》一书中提出的策略。他们提出了一种“分诊”系统,将终止对印度和埃及等“无望”国家的粮食援助。在《人口炸弹》中,Ehrlich建议“在粮食分配方面,除了采用某种形式的Paddock策略外,没有理性的选择。”如果这一策略在当时依赖粮食援助的印度和埃及等国实施,它们几乎肯定会遭受饥荒。[13] 相反,埃及和印度都大大提高了粮食产量,现在在没有粮食援助的情况下养活更多的人口。

令人惊讶的是,在Ehrlich于1968年撰写《人口炸弹》期间和之后做出了一系列错误预测之后,他在1990年又写了《人口爆炸》,并继续表示我们存在全球人口过剩,正在导致或将导致严重危机,除非我们削减全球人口。他在本世纪甚至这十年里都在说同样的话。他今天不再说这些的唯一原因似乎是他今年早些时候去世了。如果我不查一下,我会猜测他最近的立场会是“嗯,我有些事情搞错了,但那只是因为受我工作启发的行动避免了危机”,或者“虽然危机被避免了,但那是侥幸,在大多数宇宙中,避免了我预测的大规模饥饿死亡的农业进步不会发生”,而不是“你等着瞧,危机正在发生,我马上就要被证明是对的”;2015年,在谈到他1968年那本错误的书时,他说“[我]今天的语言会更加末日化”。这就是我们从Zitron身上看到的模式,但我没想到我查的这个人会把这种状态保持50年。也许我们会有50年的Zitron来预测AI进步的终结。

对Zitron的一些反应

在上面引用的Juho Snellman的话中,Snellman说他写了大量的“滔滔不绝的废话”(gish gallop),这是一个术语,指某人向你倾倒大量廉价的(生产成本很低的)胡说八道,以至于没有人愿意花时间去驳斥。在详细讨论Zitron演讲的一小部分时,我们花了超过1000字来解释为什么Zitron对公司如何运作有错误的理解,以及Zitron是如何在推理上出错的。有人可以读了这些然后说,“但你没有谈到演讲中的X”,这是真的。当我第一次看那个演讲时,我实际上在90秒后就关闭了标签页,因为有太多胡说八道,似乎不值得继续花时间。我可以就视频的前90秒写5000字。因为Zitron只是在说一堆胡说八道,他可以非常廉价地这样做,而如果我手头有所有事实,驳斥他90秒的胡说八道需要30-60分钟。如果有时间查找确切的信息,可能需要两倍或三倍的时间。当一个有良好判断力的人看到这样的东西时,他们倾向于立即把这个人划掉。举个例子,我告诉我一个朋友我正在写这篇文章,他说:

> 我在听一档播客,里面有这个家伙,我听不下去。我的心率在上升,因为他会说一些假话,然后采访者——他很讲道理——会追问,“那X呢?”,然后我们就跳到另一个假话上……在我退出之前,他谈到了LLM在过去一年里没有变得好很多,采访者说人们在使用它们,它们在过去一年里确实好多了,Zitron否认并说“是吗?”,采访者就说“是的……”在那一刻,我就想,我为什么要听这个对话?

我们主要讨论的是预测,而不是关于过去或现在的错误陈述,但我读过或看过的Zitron的所有内容也都充满了这样的东西。很多人看到这样的东西会觉得这家伙是个怪人,然后不再关注。但也有很多其他人看到这样的东西,看到有人驳斥了一系列观点,然后说,“但你没有驳斥X”,一般来说,驳斥者可能会回应其中几个,但最终会放弃,因为“滔滔不绝的废话”方法具有与放大式拒绝服务攻击相同的属性。产生新的胡说八道非常廉价,但驳斥它需要一些努力。

顺便说一下,我很好奇那个采访是什么,所以我把上面的引文放进ChatGPT,请它找到那个采访。它能够识别出包含相关对话的采访(实际上它识别出了多个,因为这似乎是Zitron的一个常见问答模式),以及每个相关陈述在采访中的时间戳(一般论证的开始在这里,一个“是吗”的回应在这里。在“是吗?”评论之前,采访者试图建立一个基线,即智能体的能力已经提高。Zitron否认了这一点,然后当采访者指出使用这些东西工作的人时,Zitron用“是吗?”否认了这一点(他实际上在这个序列中做了多个相互矛盾的陈述)。

这里要注意的另一件事是Zitron极其高的信心水平。我们注意到的一些例子包括,OpenAI的预测是“如此离谱的声明,让我惊讶于把它说出来居然不算某种金融犯罪”(到目前为止他们已经实现了),以及他声称Google对Gemini用户的预测是“一个如此不现实的数字,Google应该有人被解雇,而那个人就是Sundar Pichai”(当Zitron声称他们完全不可能达到这个数字时,他们超额完成了50%)。我做过不少预测,其中不少是错的。当我真正做预测时,我会为自己记录一个置信水平,这样我可以回顾并看到预测的校准程度。我从来没有在信心水平接近Zitron给出的一些预测的预测上错过一次。考虑到声明的信心水平,即使是一个错误的预测也表明极度过度自信。一个人实际上不应该在那种信心水平下犯错,但Zitron在他以修辞上几乎最高可能的信心水平做出的预测上经常犯错。

顺便说一句,关于Gemini达到5亿用户“如此不现实,Google应该有人被解雇,而那个人就是Sundar Pichai”的一个有趣之处是,Zitron还(错误地)说Google不知道如何增长,因此他们把AI塞得到处都是。Dennis Snell指出,如果Zitron认真对待自己的说法,Google可以通过做Zitron所说的他们会做的事情——把AI塞得到处都是——让Gemini的用户数达到任何它想要的数字。你不能认真对待Zitron关于Google缺乏增长导致AI绝望的说法,同时又认真对待他说Sundar提出5亿用户这样的数字是某种严重渎职。这是在看他的演讲或读他的文章时立即就能发现的另一件事。有一堆互不关联、无法拼凑在一起的陈述,除了它们都是关于AI公司和AI公司及使用AI的公司如何邪恶和坏的陈述之外。陈述的实际数字和逻辑是矛盾的。似乎是想到了什么就用什么来把反派描绘成邪恶的。而且,有趣的是,Gemini达到的7.5亿用户数字表明Zitron的两个说法都是错误的。如果Google像Zitron声称的那样绝望地试图粉饰数字,他们可以轻松地把Gemini塞到任何地方把数字推到10亿以上,当然7.5亿>5亿。

顺便说一下,我第一次停止观看那个演讲的点是:

> 一个痴迷于同比收入增长的市场。而这种演变是自然的。这很糟糕。你可以怪Marc Andreessen。他是个可怕的人。你可以怪很多可怕的人。此刻有太多值得生气的人。

最后这句话真的总结了Zitron的立场。“此刻有太多值得生气的人”。在这个演讲中,他对Andreessen进行了这样的攻击,并把Meta、Google和Microsoft追求增长归咎于Andreessen。实际上,如果Marc Andreessen从未存在过,Meta、Google和Microsoft几乎肯定仍然会试图增长,所以我们当然不能真的把这些公司试图增长归咎于Andreessen。只是有个事情他说是坏的,然后以他一贯的风格,拉出某个人说这是该为此负责的邪恶反派,然后跳到下一个不连贯的话。

人们怎么能认真对待这个?

因为我是一个受虐狂,我实际上跑去读了一大堆Zitron讨论(我相信我读了HN和lobsters上的每一个主要讨论,还有其他一些),看看那些认真对待Zitron的人在说什么。一个常见的辩护就是上面那种:当然,你驳斥了一些观点,但你没有涉及X。一个更常见的辩护是,泛泛地说,人们因为Y攻击Zitron(通常是他风格),但他们从不回应他的观点,“这告诉了我我需要知道的一切”(或类似的话)。根据消息的时间戳,仅限正在讨论的那些故事,通常已经有评论在讨论Zitron的实际错误,但Zitron的辩护者会忽略这一点,只是声称人们无法指出Zitron犯的错误。这是一个非常Zitron式的举动,喜欢他风格的人也会使用这一举动是有道理的。毕竟,谁会认为Zitron有说服力呢?那些认为这类东西是有效推理的人。

下一个最常见的“举动”是直接否认Zitron说过某句被驳斥的话。当人们提到Zitron在2024年和2025年反复公开说过LLM因根本原因无法进一步改进时,Zitron的辩护者会说他从没说过,对之前的预测或事实错误的陈述也是如此。

我看到的另一类辩护是“但是那些AI鼓吹者呢,他们也错了?”之类的评论。就像我之前说的,我写了一篇34k字的文章,讲许多最受尊敬的未来学家如何错了,不仅是因为他们做出了错误的预测,而是他们的方法和推理是错的。但一群吹捧未来的人错了,并不会让Ed Zitron或Paul Ehrlich之流少错一点。Zitron和Ehrlich仍然完全像那些未来学家从未存在过一样错。

一个朋友还指出了这一点,关于人们在指出Zitron关于模型从2023年到2026年没有改进的错误时的评论(是的,这特别是指在讨论Zitron关于能力没有改进的被推翻的陈述的故事或评论上):

> 令人难以置信的是有这么多人会说:“Zitron没有错,他只是太早了!”我猜这意味着我们最终会意识到2026年的模型实际上并不比2024年或??年的更好。

关于发布这篇文章的一个有趣的事情是,相当一部分给我发消息说我错的人说,我错是因为在今天2026年,模型实际上并没有——模型自2023年或2024年以来并没有变得更好。我的猜测是,大多数说上面那种话的人只是在做那种“不读实际内容,用一段对任何真正读过他们回复对象的人来说都毫无意义的套话回应”的举动,但事实证明有很多人真的相信Zitron那串暗示模型自2023年或2024年以来没有改进的陈述。如果有人真的看了正在发生的事情,我不认为你能做任何事情去说服一个在那个层面上否认现实的人,但任何只是没见过事情如何变化的人,要直观地看到那段时间的改进,这里有一个2023年和2025年视频生成的比较,还有这里有一个2026年8月的例子。视频不是一个很好的例子,因为模型在编程方面的改进要大得多,例如,用大约几分钟的人类时间,就可以创建一个带解释器和本地代码编译器的新正则表达式引擎,然后fork ripgrep使其在我的机器上对codex的实际ripgrep调用更快,这个项目在LLM出现之前如果要给具备该专业知识的人付费,可能要花费七位数。但视频是一个很好的例子,因为在上面链接的采访中,在“是吗?”的交流之后,Zitron的“反驳”是“你不会用它拍电影吧?”。人们现在正在“拍摄”相当多的AI生成的数字镜头,这正在颠覆大量低端视频工作。基于历史模式,一个简单的预测是这将随着时间的推移继续向高端市场移动,但仅基于人们今天使用AI视频的方式,Zitron可能应该找一个新反驳,即使他只是在对那些不相信模型自2023年或2024年以来有所改进的信徒们说话。当然,这个话题不能涉及数学或科学,那里的改进非常迅速,其他许多领域也是如此。

未来预测

虽然Zitron过去的预测通常都是错的,但也许他将来会对某件事是对的。也许这些公司中的一些会因某种原因估值下降。但是,即使有某种大规模AI崩溃,OpenAI和Anthropic归零,就社会影响而言,如果在此基础上,还发生了其他事件阻止了模型能力超越AI实验室目前内部拥有的水平,这仍然会导致相当多的变化。哪些公司会成功将改变谁致富,但特定公司的失败不会阻止从当前或下一代模型能力中产生的变化发生;它只是移动了谁受益最多。就个人而言,一家公司的人致富还是另一家致富对我来说无关紧要。如果一家公司在某个(抽象意义上的)方面比另一家做得更好,我有点兴趣,但我对任何特定公司声称会比另一家公司做更多“正确的事情”持一定怀疑(我可能被说服,但我发现我所知道的公开声明不太有说服力)。如果Zitron最终在某家公司或另一家崩溃这件事上是对的,这对我来说远不如能力如何发展以及将如何发展有趣,而他到目前为止在后者上是错的。碰巧的是,他迄今为止所做的财务预测也是错的,而且其推理也是有缺陷的,但这并不是我真正感兴趣的,虽然我为完整性包含了一些财务预测。

感谢Yossi Kreinin、Juho Snellman、Dennis Snell、Nick Bergson-Shilcock、@blueblimpms、Bartek Ogryczak、Jamie Brandon和Shriram Krishnamurthi的评论/更正/讨论。

附录:Ed Zitron谈为什么人们不喜欢Ed Zitron

在寻找关于Zitron工作的讨论时,reddit上的第二热门结果是Zitron的这篇评论:

> ……有些男人不喜欢我,因为情感诚实和内省对他们来说很难。情感是男人被告知要压抑或压缩的东西。我拒绝这样做,当任何人告诉我要这样做时,我觉得这很恶心……让我们从情感开始,因为它是最明显的。人们真的很不喜欢我是我现在的样子,认为我是“把愤怒当成一种表演”,甚至进一步把我描述为精神病、失控,等等等等。我发现这是一种常见反应,来自任何自己情绪压抑的人,尤其是在他们自己的工作中。很难有情感且有充分论证的观点……我也没有走“应该走”的路线来到达这里。你“应该”是来自大媒体的建制派作家,或分析师,或在金融业,或任何其他不同的“真正道路”,在那里你“配得上”你“应该”得到的东西。我没有在传统意义上“挣得我的地位”,而那些挣得的人认为我没有挣到我的路……我的工作也是彻底的,这会让那些不做彻底工作的人感到沮丧。我思考过我的每一个观点,我非常努力地去了解主题。注意有多少人仍然声称“这就像Uber”或“这就像互联网泡沫”。假设一些东西而没有检查它是真是假要容易得多!有个混蛋带着彻底和热情出现是令人沮丧的。它对你的工作产生了不好的影响……我拍好照片,我做好采访,我利用事件,我不卑躬屈膝,因为我通常带着几千字的思想或一集关于某事的节目出现。我相信有些人想要这种级别的关注或声望,但他们不想做得到它的工作,这让他们感到恼火……我爱得大,我爱得狠,我就是我,我从来没有被任何“圈内”群体欢迎过。我拼命工作,我写得比任何人都多,我出现了。用我创造的任何空间,我都会反击“圈内”群体或小圈子。我恨他们,他们也恨我。而且我根本知道我为什么相信我所相信的。这困扰着那些不知道自己为什么相信的人。

我不知道他说那些话是不是认真的(如果这篇关于Zitron和他经营的公关公司的Wired简介是准确的,人们会倾向于认为不是),但Zitron似乎非常擅长说他的受众想听的话,所以这可能对他的受众提供了一些洞察。关于小圈子和“圈内”群体这一点,有一点值得注意:如果你在reddit上搜索他的名字,评论者会注意到,如果你在他的subreddit上发任何表明AI已经改进的东西(比如链接到基准测试),你会被禁言,导致一个高度小圈子化的回音室。我公开说过METR的进步基准没有意义,你最好靠感觉而不是靠有误导性的分析,而且被广泛引用的AI评估经常有缺陷,所以并不是我认为基准通常都是好的,但我从阅读评论中得到的印象是,如果你不符合党内路线,你会很快被禁言,这与上面描绘的画面相反。这不是Zitron独有的;不久前在查另一个网红时,如果你在那个网红的reddit上不同意,他们会写一条评论感谢你的评论,说他们多么喜欢收到人们的反馈,世界如何是一个伟大的和平与爱的地方,我们都应该彼此相爱,同时禁止你进入他们的reddit。

我还发现Zitron关于人们因为不喜欢彻底的工作而不喜欢他的工作的评论很有趣,有几个原因。一是我的工作经常被正面引用为严谨和彻底的。也有很多不喜欢我工作的人,但我不仅不知道有谁说过他们不喜欢是因为它彻底,而且如果有谁秘密地因为彻底而不喜欢它,我会感到惊讶。总的来说,这似乎不是人们不喜欢事物的原因。人们因为某人知道他们为什么相信某件事或因为某人努力工作而不高兴,也是如此。这真的很有趣,这似乎正是Zitron的受众想听到的。第二件事是,我个人不会认为我的工作是彻底的。我在这里提到的对自己的工作感觉不好同样适用于不觉得自己的工作彻底。我确实对我的工作做一定数量的检查。我不确定我会说在时间花费上比大多数人更多,但在有效性方面,我怀疑方法和时间投入的结合比平均水平更好。但我发表我的工作时总有一种不满的感觉,因为我可能永远继续更彻底地检查下去而永远不会发表任何东西,所以我强迫自己在一种我怀疑高于平均彻底性但远未达到彻底的水平上发表。如果我把我的工作与我认为是彻底的人的工作相比,比如Gary Bernhardt,我不知道我怎么能说我的工作是彻底的。我有几个朋友产出Bernhardt质量的工作,而我选择生产更多但质量较低的工作。我认为这是在质量-速度权衡空间中一个很好的位置,但这并不使我的工作彻底。要做到像Gary那样彻底,以我2026年7月之前的标准基线,我需要每份输出投入10倍到100倍的时间(按我最近发表的速度,还需要额外10倍或更多)。然而,似乎我的事实核查过程比Zitron的彻底得多。即使我们抛开像Timothy Lee例子那样严重的算术错误,如果我们看看像Facebook MAU例子这样的情况,他挑选了一个与其他估计和Meta自己数字方向相反的数字,而且根据其他可用数据在方向上也难以置信,我看不出这样的数字怎么能通过任何事实核查。这对他大量的陈述都适用(我猜是大多数,虽然我没有试图随机抽样来确定)。似乎任何你能想象到的事实核查过程都会发现矛盾的结果。

附录:为什么写这个?

没有真正好的理由,真的。我睡了四个小时,大脑不太好用,我看到有人发布了一张reddit帖子截图,嘲笑Ed Zitron的预测记录。当我写那篇未来学家预测准确性的评论时,我试图确保我没有以任何方式偏向我审查的内容。从帖子中看不出那位审查Zitron预测的reddit用户是否以公正的方式提取预测,还是以某种方式偏颇(既然AI已成为文化战争问题,有人提取偏颇的预测也不奇怪),所以我决定在空闲时间读一些Zitron,同时摆弄agents让它们做我想让它们做的一个不相关任务。对于未来学家的帖子,我读了好几整本书来提取预测,通常只有在某人开始重复、一遍遍说同样的话时才停下来。在这种情况下,Zitron所做的就是重复,所以未来学家评论中的方法论意味着我会审查几个预测然后立即停止。为了克服这一点,我让ChatGPT给我一个预测列表(没有试图偏向正确或错误的预测),然后我略读/阅读了ChatGPT链接到的帖子。有些情况下我认为ChatGPT对帖子的解读是不正确的(这些通常是在它的解读正确时该预测将是错误的情况,但我不同意它的解读),并且(下文进一步讨论)我也删除了那些不可证伪的或似乎是同义反复而无意义的预测(我在未来学家的帖子中也注意到类似的东西)。如果我真的想一想,我可能可以找到更好的事情来利用这些时间,但事已至此;我有时会在待办事项列表中放一些等太累做不了真正工作时做的任务,但这次我没有。

我不认为他们挑出了特别糟糕的预测,虽然他们确实选了一些听起来更荒谬的。然而,如果你去看看那些不那么铁板钉钉的“扣杀”(比如Gemini年底达到5亿用户太离谱Sundar应该为此被解雇,而Gemini实际上年底达到7.5亿),这些和说Cursor没有现实买家、暗示他们连100亿美元都不会卖出去——而“每个人”(关心AI退出的人)都知道他们以600亿美元卖出——一样错。reddit用户挑选了高调的失败预测,但Zitron的预测语料库有更多的失败,如上所述,更大的问题是他推理。

关于reddit评论的另一件事是,无论评论是否公正,人们可能会怀疑一种偏见,因为它是由一个显然是r/accelerate信徒的人发布在r/accelerate上的。看看实际的预测,它们与某种偏见一致(它们也与诚实错误一致,因为无法与记录区分)。例如,其中一条“反驳”是Zitron关于OpenAI将在12-24个月内崩溃的声明。OpenAI没有崩溃,所以这表面上看起来是表明Zitron错的好方法,但如果你读Zitron的帖子,Zitron的实际说法是OpenAI要么崩溃要么筹集更多钱,而他们筹集了更多钱。我不同意Zitron的暗示,即这只是必然导致后来的崩溃,但他公开的预测没有被证伪。这个预测不在这篇文章评分的预测集中。有些人会认为这应该被计入。不计入的原因是,这个预测似乎没有意义,除非它服务于Zitron更广泛的观点(OpenAI注定要崩溃)。如果我们想想人们可以做的预测,一个必须成立的同义反复预测(如果把为了篇幅而省略的所有边缘情况都写出来)是OpenAI有足够的钱运营或者没有,如果没有,它必须以某种方式筹钱。我可以做一百万个这样的同义反复预测,但如果有人给我的预测记录打分,把这些包括进去是没有意义的,因为它们是毫无意义的。一般来说,一个活着的公司会覆盖其成本。如果没有,它会尝试筹钱。如果做不到,它将被关闭或被收购。一个公司要么覆盖成本要么不覆盖成本的预测什么也没说。OpenAI自己的预测是它还不会盈利,其成本将超过收入。这几乎是确定的,所以如果你假设这个几乎确定的事情是真的,那么你就有几乎同义反复的预测:OpenAI要么崩溃,要么筹钱来覆盖成本。以非常高的信心(99.9%或以上)做这样的预测本来是合理的。如果你使用任何预测评分方法,比如Brier分数,这些预测几乎不贡献任何东西,除非它们错了,只要Zitron有大量高信心的错误预测。而且,如上所述,Zitron在他给出尽可能高信心(根据他的措辞,我会把其中一些评为6个9或更高)的预测上反复出错,所以在任何像Brier分数这样的评分机制上,Zitron的记录非常差。而这样的汇总指标真的低估了这类预测的无意义程度。假设Zitron做了无限多的正确的99.99%确定性的近同义反复预测,这会使他做的有限数量的其他预测的分数在Brier分数上变得毫无意义。这仍然会给你对他的任何非近同义反复预测零信心,而那些是人们通常谈论的预测(AI进步已经结束,AI公司必然崩溃并将拖垮大型科技公司等等)。

回到reddit评论者潜在偏见与我自己的偏见的话题,如上所述,我对快速进步是不可避免的观点没有特别偏见,并且指出过人们过度乐观的情况,正如这篇关于未来学家预测的帖子所证明的。我也不是一个需要通过制造别人错或坏的理由来获取参与度的人,也不一致认为每个预测者都是坏的,正如这篇对Steve Yegge预测记录的评论所证明的,在那篇评论中我指出他得分很好,而且实际上表现比原始分数显示的好得多,因为预测通常推理良好且方向正确,即使具体预测不准确。我认为如果有人对未来有很好的洞察力并公开分享,这实际上很棒,所以当我注意到这些情况时我很乐意指出来。只是在这种情况下,Zitron是一种反Yegge:一个预测记录很差的人,其预测实际上比单独从记录上看起来更糟。

附录:本文中的错误

我认为这篇文章几乎肯定有多个错误。总的来说,我发现阅读一长串错误的推理然后在其间寻找错误时很难不变得马虎。我在审查未来学家预测时也有完全相同的问题。这让我想起你为一个编译器有很多bug的系统编程时,你整天整夜遇到编译器bug(至少LLM出现之前,在处理嵌入式系统时并不少见;现在修复这些bug相对容易了)。我发现很难不变得马虎并想“嗯,这可能是编译器bug”,即使偶尔实际上会是你的bug而不是编译器bug。在看这类人的预测时,问题要严重得多,因为编译器通常仍然基本可用而且往往是对的,而阅读这里讨论的这类文本时,你只是不断淹没在胡说八道中,偶尔被一个正确准确的点打断。我认为,要做好这件事,你或者需要一个对在这些东西中跋涉有异常高耐力的人(我的意思是,比我多得多,而我似乎在这方面有略高于平均水平的耐力),或者有一个团队独立评分和打分,但当任何表面层面的阅读立即揭示许多表明这些人几乎完全错误的东西时,谁会愿意花这种精力呢?

我确实让ChatGPT(web界面,Pro)和Claude(web界面,Fable 5)对这篇文章做事实核查。它们都发现了一些在发表前修复的小错误。一年前,我觉得这种事实核查几乎没用,但现在它们已经相当不错了,而且与Zitron相反,我预计它们会继续变得更好。对于对两者好奇的人,在这种情况下ChatGPT比Claude彻底得多,发现了更多错误,也发现了Claude发现的每一个错误。然而,它过于热心,指出了一些非错误,比如暗示一些半开玩笑的评论是不正确的,以及一些大体正确的陈述应该用更字面的方式改写(还配上了AI风格文本)。

我更新了这篇文章,因为@blueblimpms指出我以为关于GPT-5的预测可能实际上是关于GPT-4.5的,尽管Zitron所说的话不清楚。在重读了相关帖子后,我同意,既同意Zitron可能指的是4.5而非5,也同意他的陈述不清楚,所以我改了。这个更正符合我预测会发生的模式,虽然我没有注意到这个问题的次要原因是Zitron的写作相当不精确,经常依赖陈述之间各种模糊的暗示。他在采访中做的“是吗?”的回应就是一个例子,人们可以技术上说他没有做任何陈述,只是问了一个问题,尽管在那些情况下,鉴于他的整体立场,我们可以推断他说这话时的意思。

说起来好笑,但这篇文章中的一个非错误是我说我“不在AI实验室或为AI实验室供货的公司工作”(我口语化地意思是,我不在一家向AI实验室出售硬件或主要从事向AI实验室销售业务的公司工作,比如一个RL环境创业公司;毫无疑问我们有使用非ZDR计划的人向AI实验室发送数据,AI实验室可能从我们这里抓取过数据,或者付钱给绕过法律抓取我们数据的抓取公司,也许有人已经谈判了一笔交易,以对我们来说并不重要的金额向AI实验室出售我们拥有的一些数据,也许自AI实验室成立以来最多占我们收入的0.5%等等)。一个朋友注意到,他不得不在Metafilter上评论,回应一个说我为Nvidia工作的人。我也有几个人直接给我发消息告诉我我为Nvidia工作。我不知道该说什么。我有几个朋友在那里工作,听起来是个不错的工作场所,但那不是我的工作地点。这很容易从公开信息中验证(技术上,我可能辞职并在我雇用的最后公开信息之后开始了一份工作,然后不告诉任何人,但如果是这样的话,那也不应该让随机的Zitron粉丝认为我为Nvidia工作;而且,我没有这样做)。我们在文章中注意到,Zitron的粉丝在辩护Zitron时经常把事实搞错,考虑到他所吸引的人群是不太在乎事实的人,这是有道理的。我想这是另一个例子。当然也有人给我发了我们在文章中讨论过的所有标准辩护(Zitron从没说过那个,Zitron会随着时间被证明是对的,等等),但“你在Nvidia工作”这个比较有趣,因为它肯定不是Zitron粉丝在每场讨论中都有备而来的套话。

但,即使对Raghavan的指控是真的(我不确定怎么能是真的,因为首先一个人怎么能成为计算机科学家的阶级叛徒,但让我们假设无论它是什么意思,都是真的),Zitron的论点是“这个混蛋[指着Raghavan的图像]在2020年接管了Google搜索”,然后优先考虑某些指标而牺牲搜索质量。我不确定为什么要点名某个人,因为这是一场长期斗争,各方都有很多人参与,但如果我们假设这一切都是真的,那么我们假设“管理咨询派”会推动一些指标,这些指标会以牺牲搜索质量为代价来提高参与度和/或收入。这会产生与Zitron在这里需要的相反的效果,即证明Google的增长已经结束,他们如此绝望地追求增长,不得不以某种疯狂的最后一搏把AI放到任何地方来拯救Google。也许有人可以论证这最终会导致Google搜索下降,但Zitron的论点是,在2024年,他们是绝望的,而不是用户最终会离开Google搜索,后者以后会导致下降。任何一个读过很多Zitron的人都会认出他的一个标准“举动”,把情况变成某种英雄-反派叙事(对于搜索,所谓的英雄是Ben Gomes,反派是Prabhakar Raghavan);就好像他对公司如何运作的心智模型来自关于公司的电影。如果你看过一部据称关于某些事件的电影,然后读关于它的书,你会发现事情被过度简化成英雄-反派叙事,几乎所有细微差别都被剥离了。然后,如果你亲身参与过某件事,或者与亲身参与的人交谈,并将发生的事情与关于它的书进行比较,同样的事情再次发生;总的来说,在关于科技事件的书里,主要的因果因素没有被识别出来,许多参与关键决策的最重要人物甚至没有被提及,因为记者与当事人交谈时,并不能真正拼凑出一个对了解底层机制并有良好信息的人来说合理正确的故事。无论如何,在不了解情况的情况下,如果有人告诉你一个Zitron喜欢编造的那种英雄-反派叙事,你已经可以有点怀疑了。^1^

顺便说一句,我不认为他的愤怒真的在视频中体现出来。我的意思是,他明确地说他很生气,他说脏话,侮辱人,就像他写作一样,但他在我看来并不真的愤怒。这让我想起最近我和一群人做的一个情绪识别测试。我发现这个测试相当难,花了大约5分钟在第一道题上,因为那个人脸上挂着巨大的假笑,看起来也有点不舒服和焦虑。我无法判断你应该说那个人是快乐还是不舒服/焦虑。这是一个应该非常简单的测试,还是一个应该有一点微妙之处的测试?根据测试的样子,想了很久之后,我选择了“快乐”。幸运的是,测试实际上会告诉你问题答对没有,所以我意识到测试是关于被做出的假夸张表情,而不是人的真实表情,其余大部分问题都很容易。有一个很困难,因为他们用教科书式的表现来假装某一种特定情绪,也就是说,那种人们在教科书里看到的东西,但以一种非常具体的方式,比其他的教科书式表现更不完整、更不真实;就好像有人读了关于轻蔑冷笑的描述,然后试图根据文字描述做出面部表情。我不得不思考几分钟才得到正确答案。总之,对我来说,Zitron似乎是一个在假装愤怒的人,而不是一个真正愤怒的人。语调、面部表情、肢体语言、动作风格等等,在我看来都不愤怒。我认为这种愤怒定位在写作中比在演讲中更有效,因为他使用的线索(说脏话、说生气、表现出很多轻蔑、侮辱人等等)在写作中已经是愤怒线索的最好了。当你有音频和视频时,这些是相当弱的线索;如果更强的线索并不真正表明愤怒,那个人就是不显得愤怒。可能他有一种非标准的表达愤怒的方式,或者我只是没有足够注意,但在看了一些他像写作那样说话但不显得愤怒的视频后,他的写作对我来说也不再显得愤怒了。^2^

如果你想看看当有人试图讨论数字时是什么样子,这里有一个帖子,Juho Snellman反驳了一个坚持说人们已经做过计算的人。当我赶上AI讨论时,我见过很多这样的讨论,一方有人真的看了数字,另一方挥舞着某种模糊的坚持说数字已经被看过。这从来没有真正有任何结果,因为对于其中一方来说,重点不是你可以从数字中理解某些东西,而是他们有一件可以挥舞的证据,因为有人看了数字。^3^

Zitron当时的论点是幻觉已经好到极限了,这意味着AI性能被封顶在2024年的水平。无论是总体预测还是机制都是错误的。这一个在当时似乎就是错的,因为我在2024年这里指出,你可以通过把AI代码放在一个循环里,让它运行到代码编译通过和测试通过,来让AI代码变得还算像样;我那时不是一个重度AI用户,但任何使用AI的人都能看到有一些方法可以减轻幻觉率,而这些方法没有被广泛采用(这是在codex和claude这样的编码agent执行代码并检查测试通过等等之前)。^4^

这也是另一个在当时似乎就不真实的事情。我不是ML人员,但有人告诉我RL环境是什么之后,几分钟内我就想到了很多生成合成数据以改进训练的方法。我确信这些都不是新颖的,它们是AI实验室正在做的事情;我的观点只是,任何思考几分钟的人都能想出很多方法来改进模型,即使互联网上没有新数据可找(更不用说可以投入更多努力来获取不仅仅是reddit评论或互联网上最容易抓取的内容的数据)。^5^

注意,这只对已解决的预测评分。在那篇特定的帖子中,Zitron还表示通往AGI的进展永远不会发生,这仍然是模糊的,难以裁决,而且你永远无法可靠地将其判定为正面。同样,之前一篇帖子中某个公司必须增加订阅的预测没有被列出,因为它是开放式的,不能真正判定为负面(它暗示必须很快发生,所以可以说是错误的,但如果想狡辩,可以说它将来会发生)。^6^

在这里,Zitron还说,“我现在意识到把东西附加到时间上并不是很有用(虽然我坚持我的预测),因此我认为更有用是建议泡沫破裂的条件是什么”。在这一点之后,Zitron相对较少做带日期的陈述,而做更多开放式的不可证伪的陈述。也许是对他之前预测经常出错的一种反应?^7^

在一小点乐观中,我会说,这个博客似乎做得还不错,尽管没有倾向于极端立场,并且通常尽量避免点击诱饵。这通常意味着,当我查看一些数据时,我会看到一些看起来会是一篇非常有趣的病毒式攻击文章的东西,但仔细一看,它实际上是一个无聊的负面结果,比如当我运行这个快速粗略的编程语言评估时,它最初似乎显示了一个非常有趣的结果,但在我修复了明显的评估bug后就消失了。唉。我希望人们发表更多无聊的负面结果,所以我发表了无聊的负面结果。如果这个博客的流量在Zitron的substack的一个数量级以内,我不会感到惊讶(服务器端统计显示我过去一个月有61万独立访问者,但谁知道其中有多少是机器人,尽管有一些Cloudflare机器人拦截),尽管Zitron写作比我频繁得多,并且使出了书里所有的点击诱饵技巧,而我只是偶尔在我想写点什么的时候发点东西。虽然我的目标显然不是流量,但如果我们根据时间或精力水平进行调整,我不认为这个博客与Zitron相比表现糟糕。Zitron能有610万月独立访问者吗?不是不可能,而且很难说这些数字在机器人流量下意味着什么,但作为参考,《经济学人》约有130万订阅者,纽约时报约有1300万数字订阅者。如果我们武断地假设4/5的独立访问者是机器人流量,那么拥有比这个博客多一个数量级的流量将使Zitron进入与《经济学人》同一级别。在其他条件相同的情况下,我认为Zalewski关于激励是对的,我见过很多人随着他们倾向于最能驱动参与度的东西而成为自己的漫画形象,但我认为反其道而行之也可以运作良好。例如,用一种可以说是点击诱饵的反面的风格,Simon Willison写了我怀疑是过去3-4年程序员中阅读最广泛的博客(就像过去某个时候,Joel Spolsky或Jeff Atwood或Steve Yegge似乎是程序员中阅读最广泛的程序员一样)。在程序员和其他严肃的AI用户中,我猜Willison的受众比Zitron大。然而,Zitron确实有一种Willison以其风格永远无法真正获得的受众。在这篇文章的正文中,我们看了人们在人们使用AI的论坛上为Zitron辩护的常见方式。那是从人们使用AI的论坛上提取的。如果我们看看整个世界,评论看起来相当不同。例如,在我朋友提到的那个视频上,Zitron反复否认现实,采访者反驳,目前的最高赞评论都在支持Zitron,他们也直接否认现实,并声称采访者用现实反驳的地方是采访者有偏见或只是不知道自己在说什么。在最高赞评论中,似乎很少或没有涉及事实;全是情绪认同。这些评论让我想起支持那些使用“滔滔不绝的废话”策略、说一堆离谱废话的政客的支持者会说什么。我可以想象Zitron有一天凭着他否认现实的受欢迎程度竞选公职,或者成为一个当权者的得力助手的煽动家,所以Zalewski是对的,Zitron的吸引力不是某人通过准确描述AI正在发生的事情能获得的。但是,虽然我不认识Willison,这可能完全错误,但我的印象是,和我一样,他在做一件他本来就想做的事情,受众只是在他没有试图最大化受众的情况下发生了。当我说它运作良好时,我的意思是,他似乎能够靠他获得赞助(我猜通常是因为他有这么大的受众)作为全职开源开发者养活自己,这看起来是一个很好的结果,即使这不会产生像Zitron这样的人能产生的那种大众吸引力。^8^

脚注:

^1^ 但,即使对Raghavan的指控是真的(我不确定怎么能是真的,因为首先一个人怎么能成为计算机科学家的阶级叛徒,但让我们假设无论它是什么意思,都是真的),Zitron的论点是“这个混蛋[指着Raghavan的图像]在2020年接管了Google搜索”,然后优先考虑某些指标而牺牲搜索质量。我不确定为什么要点名某个人,因为这是一场长期斗争,各方都有很多人参与,但如果我们假设这一切都是真的,那么我们假设“管理咨询派”会推动一些指标,这些指标会以牺牲搜索质量为代价来提高参与度和/或收入。这会产生与Zitron在这里需要的相反的效果,即证明Google的增长已经结束,他们如此绝望地追求增长,不得不以某种疯狂的最后一搏把AI放到任何地方来拯救Google。也许有人可以论证这最终会导致Google搜索下降,但Zitron的论点是,在2024年,他们是绝望的,而不是用户最终会离开Google搜索,后者以后会导致下降。任何一个读过很多Zitron的人都会认出他的一个标准“举动”,把情况变成某种英雄-反派叙事(对于搜索,所谓的英雄是Ben Gomes,反派是Prabhakar Raghavan);就好像他对公司如何运作的心智模型来自关于公司的电影。如果你看过一部据称关于某些事件的电影,然后读关于它的书,你会发现事情被过度简化成英雄-反派叙事,几乎所有细微差别都被剥离了。然后,如果你亲身参与过某件事,或者与亲身参与的人交谈,并将发生的事情与关于它的书进行比较,同样的事情再次发生;总的来说,在关于科技事件的书里,主要的因果因素没有被识别出来,许多参与关键决策的最重要人物甚至没有被提及,因为记者与当事人交谈时,并不能真正拼凑出一个对了解底层机制并有良好信息的人来说合理正确的故事。无论如何,在不了解情况的情况下,如果有人告诉你一个Zitron喜欢编造的那种英雄-反派叙事,你已经可以有点怀疑了。

^2^ 顺便说一句,我不认为他的愤怒真的在视频中体现出来。我的意思是,他明确地说他很生气,他说脏话,侮辱人,就像他写作一样,但他在我看来并不真的愤怒。这让我想起最近我和一群人做的一个情绪识别测试。我发现这个测试相当难,花了大约5分钟在第一道题上,因为那个人脸上挂着巨大的假笑,看起来也有点不舒服和焦虑。我无法判断你应该说那个人是快乐还是不舒服/焦虑。这是一个应该非常简单的测试,还是一个应该有一点微妙之处的测试?根据测试的样子,想了很久之后,我选择了“快乐”。幸运的是,测试实际上会告诉你问题答对没有,所以我意识到测试是关于被做出的假夸张表情,而不是人的真实表情,其余大部分问题都很容易。有一个很困难,因为他们用教科书式的表现来假装某一种特定情绪,也就是说,那种人们在教科书里看到的东西,但以一种非常具体的方式,比其他的教科书式表现更不完整、更不真实;就好像有人读了关于轻蔑冷笑的描述,然后试图根据文字描述做出面部表情。我不得不思考几分钟才得到正确答案。总之,对我来说,Zitron似乎是一个在假装愤怒的人,而不是一个真正愤怒的人。语调、面部表情、肢体语言、动作风格等等,在我看来都不愤怒。我认为这种愤怒定位在写作中比在演讲中更有效,因为他使用的线索(说脏话、说生气、表现出很多轻蔑、侮辱人等等)在写作中已经是愤怒线索的最好了。当你有音频和视频时,这些是相当弱的线索;如果更强的线索并不真正表明愤怒,那个人就是不显得愤怒。可能他有一种非标准的表达愤怒的方式,或者我只是没有足够注意,但在看了一些他像写作那样说话但不显得愤怒的视频后,他的写作对我来说也不再显得愤怒了。

^3^ 如果你想看看当有人试图讨论数字时是什么样子,这里有一个帖子,Juho Snellman反驳了一个坚持说人们已经做过计算的人。当我赶上AI讨论时,我见过很多这样的讨论,一方有人真的看了数字,另一方挥舞着某种模糊的坚持说数字已经被看过。这从来没有真正有任何结果,因为对于其中一方来说,重点不是你可以从数字中理解某些东西,而是他们有一件可以挥舞的证据,因为有人看了数字。

^4^ Zitron当时的论点是幻觉已经好到极限了,这意味着AI性能被封顶在2024年的水平。无论是总体预测还是机制都是错误的。这一个在当时似乎就是错的,因为我在2024年这里指出,你可以通过把AI代码放在一个循环里,让它运行到代码编译通过和测试通过,来让AI代码变得还算像样;我那时不是一个重度AI用户,但任何使用AI的人都能看到有一些方法可以减轻幻觉率,而这些方法没有被广泛采用(这是在codex和claude这样的编码agent执行代码并检查测试通过等等之前)。

^5^ 这也是另一个在当时似乎就不真实的事情。我不是ML人员,但有人告诉我RL环境是什么之后,几分钟内我就想到了很多生成合成数据以改进训练的方法。我确信这些都不是新颖的,它们是AI实验室正在做的事情;我的观点只是,任何思考几分钟的人都能想出很多方法来改进模型,即使互联网上没有新数据可找(更不用说可以投入更多努力来获取不仅仅是reddit评论或互联网上最容易抓取的内容的数据)。

^6^ 注意,这只对已解决的预测评分。在那篇特定的帖子中,Zitron还表示通往AGI的进展永远不会发生,这仍然是模糊的,难以裁决,而且你永远无法可靠地将其判定为正面。同样,之前一篇帖子中某个公司必须增加订阅的预测没有被列出,因为它是开放式的,不能真正判定为负面(它暗示必须很快发生,所以可以说是错误的,但如果想狡辩,可以说它将来会发生)。

^7^ 在这里,Zitron还说,“我现在意识到把东西附加到时间上并不是很有用(虽然我坚持我的预测),因此我认为更有用是建议泡沫破裂的条件是什么”。在这一点之后,Zitron相对较少做带日期的陈述,而做更多开放式的不可证伪的陈述。也许是对他之前预测经常出错的一种反应?

^8^ 在一小点乐观中,我会说,这个博客似乎做得还不错,尽管没有倾向于极端立场,并且通常尽量避免点击诱饵。这通常意味着,当我查看一些数据时,我会看到一些看起来会是一篇非常有趣的病毒式攻击文章的东西,但仔细一看,它实际上是一个无聊的负面结果,比如当我运行这个快速粗略的编程语言评估时,它最初似乎显示了一个非常有趣的结果,但在我修复了明显的评估bug后就消失了。唉。我希望人们发表更多无聊的负面结果,所以我发表了无聊的负面结果。如果这个博客的流量在Zitron的substack的一个数量级以内,我不会感到惊讶(服务器端统计显示我过去一个月有61万独立访问者,但谁知道其中有多少是机器人,尽管有一些Cloudflare机器人拦截),尽管Zitron写作比我频繁得多,并且使出了书里所有的点击诱饵技巧,而我只是偶尔在我想写点什么的时候发点东西。虽然我的目标显然不是流量,但如果我们根据时间或精力水平进行调整,我不认为这个博客与Zitron相比表现糟糕。Zitron能有610万月独立访问者吗?不是不可能,而且很难说这些数字在机器人流量下意味着什么,但作为参考,《经济学人》约有130万订阅者,纽约时报约有1300万数字订阅者。如果我们武断地假设4/5的独立访问者是机器人流量,那么拥有比这个博客多一个数量级的流量将使Zitron进入与《经济学人》同一级别。在其他条件相同的情况下,我认为Zalewski关于激励是对的,我见过很多人随着他们倾向于最能驱动参与度的东西而成为自己的漫画形象,但我认为反其道而行之也可以运作良好。例如,用一种可以说是点击诱饵的反面的风格,Simon Willison写了我怀疑是过去3-4年程序员中阅读最广泛的博客(就像过去某个时候,Joel Spolsky或Jeff Atwood或Steve Yegge似乎是程序员中阅读最广泛的程序员一样)。在程序员和其他严肃的AI用户中,我猜Willison的受众比Zitron大。然而,Zitron确实有一种Willison以其风格永远无法真正获得的受众。在这篇文章的正文中,我们看了人们在人们使用AI的论坛上为Zitron辩护的常见方式。那是从人们使用AI的论坛上提取的。如果我们看看整个世界,评论看起来相当不同。例如,在我朋友提到的那个视频上,Zitron反复否认现实,采访者反驳,目前的最高赞评论都在支持Zitron,他们也直接否认现实,并声称采访者用现实反驳的地方是采访者有偏见或只是不知道自己在说什么。在最高赞评论中,似乎很少或没有涉及事实;全是情绪认同。这些评论让我想起支持那些使用“滔滔不绝的废话”策略、说一堆离谱废话的政客的支持者会说什么。我可以想象Zitron有一天凭着他否认现实的受欢迎程度竞选公职,或者成为一个当权者的得力助手的煽动家,所以Zalewski是对的,Zitron的吸引力不是某人通过准确描述AI正在发生的事情能获得的。但是,虽然我不认识Willison,这可能完全错误,但我的印象是,和我一样,他在做一件他本来就想做的事情,受众只是在他没有试图最大化受众的情况下发生了。当我说它运作良好时,我的意思是,他似乎能够靠他获得赞助(我猜通常是因为他有这么大的受众)作为全职开源开发者养活自己,这看起来是一个很好的结果,即使这不会产生像Zitron这样的人能产生的那种大众吸引力。

阅读原文
📚 相关主题 行业分析

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新