AI推理成本下降,一位开发者:警惕芯片和开源枢纽被少数人掌控
本周:OpenAI的Jalapeño推理芯片、Nvidia约129亿美元收购Hugging Face、阿里Qwen3.8-Flash——AI的成本与控制都在发生变化。
我想把最近几天的三则新闻放在一起看,因为它们单独看都有报道,但合在一起能说明一些问题。
1. OpenAI的Jalapeño芯片
OpenAI公布了其首款定制推理芯片(与Broadcom和Celestica合作;据报道Samsung参与HBM4)的结果。他们声称每千瓦吞吐量比Nvidia的GB200/GB300机架高1.5-1.9倍,端到端延迟低1.7-3.6倍。部署目标定于2026年底。值得注意的是,这些是供应商报告的基准数据,在独立测试之前应持保留态度,但方向——实验室自研推理硅片——才是真正的信号。
2. Nvidia / Hugging Face
多家媒体(TechCrunch、Fortune)报道Nvidia即将以约129亿美元收购Hugging Face。HF一直是开放模型、数据集和Spaces事实上的中立枢纽。Nvidia收购它,立即引发了关于中立性和硬件默认设置的质疑,即使短期内不会有什么变化。
3. 阿里巴巴Qwen3.8-Flash
125B参数,开放权重,据报道基准测试与Opus 4.6和DeepSeek V4-Flash相当,定价极低。据报道Qwen下载量已突破30亿,领先Meta和Google,并且他们正在测试大型商业用户的收入分成。
背景信息:本月最大的融资轮出现在推理基础设施领域(Fireworks AI约15亿美元,Together AI约8亿美元),而非模型训练。此外,Anthropic的Claude本月的稳定运行表现异常糟糕。
作为在这些API之上构建产品的人,我的看法:
主线在于,推理经济学现在成为了主角,成本曲线正在快速下降——部分归功于定制硅片,部分归功于来自中国的廉价开放权重模型。对于任何正在交付产品的人来说,实际启示是不要把你的模型供应商视为固定决策。用你的真实工作负载,将廉价的开放模型与你付费的API进行基准测试,并建立一个备用供应商(这个月的可靠性问题已经为你提供了理由)。我更警惕的是集中化——更便宜的token固然很好,但如果芯片、开源枢纽和前沿模型都集中到少数人手中,定价杠杆最终会反转。
想听听大家的看法,尤其是关于HF收购——是过度炒作,还是开源中立性的真正隐患?