AMD开源优化后八卡每秒生成七万八千词
AI推理几乎被NVIDIA垄断,Netra Runtime团队也一样。很多人用RTX PRO 6000、H100或B300跑大语言模型。最近他们拿到一小批AMD MI350X。针对Qwen 3.6 35B A3B,技术栈优化一路深入内核。
MI350X的原始算力高于NVIDIA B200。短板在软件:ROCm不如CUDA成熟,性能一直追不上。内核级优化之后,成绩与NVIDIA方案相当。单张MI350X每秒输出11,161个token。8张卡时,峰值每秒81,331个token,平均78,498个token。同样的8卡基准,这是vLLM吞吐量的2.16倍。
内核变快之后,瓶颈转移到GPU之外。调度、图覆盖、多轮对话的状态管理、路由,连HTTP序列化都成了限制。
团队把内核代码开源在GitHub上,并发布了技术博客说明优化过程。代码开源后,其他开发者能直接借鉴这些优化。AMD生态的成熟速度,可能因此快一些。
评论区提了几个具体问题。有评论说,8张MI350X不便宜,不如去优化更便宜的GPU。有人问78,498这个数字是聚合批量请求的吞吐量,还是单流吞吐量。如果是聚合,单个用户未必感受得到这么快。还有人问测试是标准数据并行=8,还是前端挂了路由器。另一条评论指出,vLLM的数据并行没有前缀感知能力。同一个对话的多次请求不会固定在同一个GPU上,多轮对话会因此重复计算。
AMD硬件本身不弱,软件生态才是短板。这次开源是补软件生态的一步。但调度和框架层面的问题,不会因为内核变快就消失。