AI Pulse

AI编程后端换用更小扩散模型,延迟降82%成本降90%

Stefano Ermon:自回归推理是顺序性的,且受内存限制。扩散模型天生适配 GPU——这就是它胜出的原因。

TL;DR:Augment Code 在九月更换了其生产环境编程智能体后端。它不是换成了更大的模型,而是换成了一个更小的、运行在不会逐 token 生成架构上的模型——Stefano Ermon 的 Mercury 2.5——而且数据差距悬殊:延迟下降 82%,成本下降 90%。这是已交付产品上的实测,不是基准测试演示。

扩散模型并行生成一整块 token。这正是你在深夜 11:47 对着 18% GPU 利用率苦战的瓶颈,而昨天调 KV-cache 才帮你多榨出四个百分点。这不再是论文里的东西了——Artificial Analysis 独立测得其速度为 770 tokens/秒,而 Inception 自己声称 1,107;即便是那个保守的数字,也极有可能是真实的、已部署的、正在承担负载的。

它做不到的是让你更安全。某张桌子上放着的每一份治理文件——RSP、Preparedness Framework、欧盟《人工智能法案》附件 III、一份未获全体表决就搁浅的劳动力法案——管制的都是模型可以输出什么。

但没有一份文件管到那位工程师头上:他的全部专长,都在刚刚被绕过去的那一侧技术栈上。

缺口

还没有人做出那个中立的测试——一块场地,让你用自己的流量,在同一台机器上,跑 Mercury 式扩散模型和你当前的自回归栈,而且没有人给自己的作业打分。

Artificial Analysis 的 Optima 和 SemiAnalysis 的 InferenceX 已经很接近了,但两者都无法在你自己的数据、你自己的并发度下,把两种架构并排运行。

开放。可行——Optima 每月 417 美元的席位费,以及一家名为 Vals 的基准测试初创公司 4000 万美元的融资,都说明钱已经在往这个方向流动了;而且资源门槛是现实的:DiffusionGemma 以开放权重发布,按需 H100 每 GPU 小时 3.41 美元。

最快的切入方式不是击败在位者,而是第一个拿出开放、公开、同一骨干的对比结果。Gemma 4 26B-A4B 对阵它的扩散模型姊妹版 DiffusionGemma,同一块 GPU、同一个 vLLM、方法公开。这正是 InferenceX、Artificial Analysis 和 LMArena 各自通过“第一个且开放”占据的位置——最后连卖方都要回头引用裁判(Inception 自己的 Mercury 论文就引用了 Artificial Analysis)。

盈利时间线:仅凭现有研究本身无法估计——但如果按下文“可行性”部分列出的规格/路线图执行,第一份付费鉴定报告在第一个项目里就能覆盖自身的计算成本(以每月 417 美元的席位价为锚,GPU 时间约 34–68 美元)。

可行性

机会

存在开放空白——没有任何产品能满足全部六项要求:在你自己的机器上、用你自己的流量,做独立的自回归 vs 扩散测试。可行:相邻产品已经定价且正在销售。

规格

记录你自己的流量样本;两种架构跑在完全相同的硬件上;在你自己的并发度下测延迟和 GPU 利用率;每个完成任务的成本;质量按你自己的评分标准;方法公开——除了这些,没有任何别的承重要求。

路线图

(1)用一台租来的 H100,通过 vLLM,用你自有流量的脱敏样本,跑 Gemma 4 26B-A4B 对阵其扩散模型姊妹版 DiffusionGemma 26B-A4B;

(2)公开方法和首个结果;

(3)通过其兼容 OpenAI 的 API 加入 Mercury 2.5,作为外部参照点;

(4)把第一份鉴定报告作为固定范围的项目出售,然后产品化。

三大假设

(1)面临这一决策的团队会愿意为独立、自有机器上的鉴定报告付费,而不是自己跑——检验方法:访谈。

(2)单机结果能够迁移到真实团队的栈和流量上——检验方法:对一个脱敏样本做一次代跑。

(3)正式发布版本上的扩散模型服务足够稳定,能被干净地测量——检验方法:把整套测试框架从头到尾跑一遍,确认结果可重复。

可行性快照

技术——通过;注意:采样器设置和扩散模型的框架服务支持仍在变动中。单位经济模型——通过,基于已公开的计算定价。盈利时间线——有风险,时间无法估计。数据护城河——有风险:方法本身是可以复制的;不可复制的是“第一个”和“被信任”。法律合规——有风险,尚未研究:处理别人的生产流量,以及供应商关于发布结果的条款,两者都未核实。

MVP 定义

输入:脱敏流量样本 + 你自己的通过/不通过评分标准;机制:跨两种架构的同一机器重放;输出:一页纸的鉴定报告;检查点:在信任任何数字之前,你先审核一遍样本。通过/不通过标准:三次重复运行在 p95 上的差异在 10% 以内;自动评分与人工复核的一致性至少 90%;至少有一个团队付费。反目标:不做公开排行榜、不做训练或微调、不托管模型、不对前沿模型做一般性排名。

市场进入

前十名客户是约 150 人以下 AI 原生公司的推理或 ML 平台负责人,他们已经在跑 vLLM,已经在问“为什么不用扩散模型”。开放、公开的结果就是获客渠道——InferenceX、Artificial Analysis 和 LMArena 各自正是靠这一渠道迎来第一批用户的。选择购买而非内部自建的理由:只需数天而非数周——无出处的估计。

融资

走到付费试点不需要任何融资。要规模化的话,可比的中立测评公司确实融到过真金白银——一家以 17 亿美元估值融到 1.5 亿美元,另一家融了 4000 万美元——AI 种子轮中位数在 460 万美元左右,不过这个楔子型产品不需要。这是标注过的估计,不是有出处的实据。

决策关口

第一次代跑之后,只有在至少一个团队同意付费试点、且结果能在当前正式发布的 vLLM 版本上复现时,才继续推进。两者任一不满足就放弃。标注过的估计。

---

当年我在马来西亚最大的建筑总承包商之一 SC 工作时,我们还有一家姊妹子公司,叫 SP,专门做基础工程的打桩作业。

每当我们有包含基础工程——通常涉及打桩——的项目时,我们总会拉 SP 一起合作。

但问题就出在这里。当时的 SP 只能做小尺寸的预制钢筋混凝土方桩,承载力非常有限。

如果项目的基础工程在复杂度和难度上要求更高,那就超出了 SP 的能力范围。

所以,经过一番深思熟虑和大量的可行性研究之后,SP 的大老板把整个公司升级了——扩展到钻孔灌注桩,桩径大得多——以适应高层建筑和其他重型项目的基础工程需求。

他还把公司更名为 SG——G 代表 Geotechnics(岩土工程)。

不用说,SG 不得不招募的专业人才,以及砸进重型机械的投资,都是极其可观的。

但这给了 SG 更大的灵活性,去争取利润丰厚的项目。

我记得看着他们最新项目之一中大型筏板基础(当然包括它下面的钻孔灌注桩)的施工进度,感到非常震惊:“哇!这个筏板基础也太大了!”

SG 的大老板冒了一个大风险,而它得到了巨大的回报。

---

每一篇“这改变了一切”的帖子都会被下一篇淹没。那些不会被淹没的,是旧事物的缔造者沉默不语的时刻。与其盯着谁的栈被打败了,不如观察谁停止为自己的栈辩护——那通常才是真正的信号。📉

说说你的看法:如果并行 token 这场赌注是真的,“我的内核是自回归的”还算护城河吗——还是说,这正是 2016 年搞 RNN 的人说过的那句话?🤔

片段致谢:No Priors(Sarah Guo 与 Elad Gil)——Stefano Ermon 那一期。如需署名或删除,请私信联系。

―― 高票评论(帖子共 2 条讨论)――

[+1] u/wllmsaccnt:这个机器人分不清自己是在发钓鱼帖还是广告,所以两个都发了?

[+1] u/ginger_and_egg:为什么有两套并行的说明文字,搞什么鬼

阅读原文

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新