AI Pulse

OpenAI自研推理芯片实测:响应更快更省电

OpenAI自研推理芯片实测:响应更快更省电

OpenAI发布了首款自研推理芯片Jalapeño。它同时做到更高的吞吐量和更低的延迟,而现有硬件系统通常得在这两者之间做取舍。

芯片额定功率700瓦,测试负载下实测持续功率不超过550瓦。在峰值吞吐量下,Jalapeño的每瓦AI工作量比对比系统高1.5至1.9倍。端到端延迟低1.7至3.6倍。交互密集的工作负载上,优势扩大到2.1至4.1倍。

这些结果不只在单一模型上成立。测试覆盖了三个模型:GPT‑OSS 120B、DeepSeek R1和Kimi K2.5 1T。Kimi K2.5 1T是其中最大的公开模型,Jalapeño在它上面的峰值每瓦性能约为对比系统的1.5倍。端到端延迟低3.4倍。OpenAI内部测试中,前沿模型上的优势更大。工作负载越大、越苛刻,优势越明显。

客户能感受到的变化,是更快的响应、更灵敏的智能体,以及需求增长时更可靠的访问。Jalapeño从设计之初就以服务现代和未来的语言模型为目标,尤其是交互式智能体。设计上尽量减少数据移动和通信延迟,模型状态(包括KV缓存)可以留在本地。网络架构让整个工作负载保持在一个连接系统内,数据移动进一步减少。

AI参与设计

AI直接参与了Jalapeño的开发,团队9个月从初始设计走到流片。AI还帮忙优化了算术电路,让团队在计划内集成进更多计算性能。Jalapeño被设计为人类和AI都能清晰、可预测地编程的目标。用Codex和GPT‑Astra,团队两个月内把三个开源模型优化到高性能。这三个模型原本不在生产计划里。AI生成的实现比人类专家版本快1.5到1.8倍。这说的是GPT‑OSS上选定的注意力机制和混合专家模块。

部署与未知数

Jalapeño计划年底前部署到OpenAI的计算基础设施中。OpenAI不会因此停用其他芯片。NVIDIA和其他合作伙伴的加速器,仍会广泛用于训练和推理。Jalapeño是多代芯片平台的第一代,第二代在深度开发中,第三代正在成型。

性能数据只覆盖推理,Jalapeño在训练任务上的表现没有给出。成本、API价格、第三方可用性也没被提及。

一个趋势已经清楚:OpenAI正在通过自研芯片降低对第三方硬件的依赖。同时,模型、产品、软件、芯片、内存、网络和系统可以放在一起设计。Jalapeño是这套逻辑的第一个实物证据。

阅读原文
📚 相关主题 硬件

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新