OpenAI新芯片故意浪费硅片省加速器算力
OpenAI 的新 Jalapeño 🌶️ 芯片做了一个看起来非常奇怪的取舍:它浪费硅片,目的是避免浪费加速器。
一个 LLM 请求不是单一 workload。它在运行过程中会改变形态。Prefill 阶段需要大量矩阵计算。投机解码需要小模型在极小批次下运行。验证阶段需要为模型权重和 KV 缓存提供内存带宽。
业界目前正在推进的直观方案是给每个阶段分开配硬件。NVIDIA 已经在用 Rubin + Groq 3 LPX 走这个方向了。Rubin 处理预填充和注意力计算,LPX 处理低延迟 FFN 并生成草稿 token。
这种方案能实现专业化,但带来了两个问题:1)第一,数据必须跨硬件边界传输。预填充/解码拆分只需要每个 KV 块移动一次,而且现代系统可以 overlapping 处理传输。但把注意力计算和 FFN 拆分就难多了,因为每解码一个 token,激活值都要在 Rubin 和 LPX 之间来回传输。
2)第二,你的集群现在每种机器是固定比例的,可实际流量不是这样的。更长的提示需要更多预填充容量,前缀缓存命中又会去掉大部分预填充需求。更好的草稿模型会改变需要的验证量,新的注意力和 MoE 架构又会转移瓶颈。结果就是一个池排起长队,另一个池还闲置着。
而 Jalapeño 把不同资源整合进同一个 700W 封装里。64 个计算切片配对 64 个逻辑 HBM 切片,总共有 216 GiB HBM4,带宽 15.4 TB/s。软件可以动态调整每个阶段分配多少矩阵计算、标量计算、内存带宽和网络资源,不需要的部分就直接断电。
这听起来很浪费,因为 OpenAI 为没在用的晶体管付了钱,但一个闲置加速器困住的远不止晶体管,它困住了一整个封装、HBM、网口、供电和散热。
在 OpenAI 固定的 8k/1k 测试中,对比选定的 GB200/GB300 系统,Jalapeño 每个封装每瓦峰值吞吐量高 1.5-1.9 倍,端到端延迟低 1.7-3.6 倍。
这不能证明这个架构赢了,这些都是厂商做的单 token 预测测试。流量稳定的大规模服务可以填满专用硬件池,专用硅在利用率高的情况下表现应该会更好。
OpenAI 赌的是,流量比例不会一直稳定。Jalapeño 把专业化从机架层面移到了芯片内部。
@gpuemi 深度解析🤿
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖