AI Pulse

开源工具包让AMD显卡跑AI提速59%,AI服务更便宜、响应更快

dstack开源了一个工具包。它让Qwen3.8-27B在单块MI300X上跑得更快。速度从311 tokens/s拉到495 tokens/s,提升59%。这个成绩在完整100万token上下文下测出。首token时间低于1.5秒,同时服务四个并发用户。不是短文本场景刷出来的数字,长对话、长文档都能保持。

提速来自两处。一处是源代码级补丁,打在SGLang的AITER注意力后端上。另一处是一连串优化会话。改完的结果打包成一个可移植的预设。任何AMD云、Kubernetes集群或裸机集群,都能直接部署。

评论区有人指出,AMD自己的Hyperloom项目正在做类似的事。有用户一直在等二手MI210降价,想买一两块搭家庭实验室。还有人问,有没有预设注册表,能按GPU小时成本选出某模型的最快方案。

有评论担心FP8 KV缓存会损害长时间任务的质量,还拿RTX 5090做对比。它装下Q4_K_M量化和约100k上下文的F16 KV缓存,就已经很满。性能还差不少。

目前还没有预设注册表公开出来。MI210的适配效果、FP8 KV缓存对长期任务的影响,也都没有数据。

阅读原文
📚 相关主题 开源推理优化

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新