AI Pulse
📡 X 信号

vLLM 在AgentX 1.0测试中跑出亮眼 token 吞吐

vLLM 在AgentX 1.0测试中跑出亮眼 token 吞吐

祝贺@SemiAnalysis_发布AgentX 1.0 🎊,这是一个开源多轮智能体编码基准,数据收集自价值约300万美元的真实 traces,运行在1000多颗芯片上,使用约2兆瓦持续运算算力。

我们很高兴看到@vllm_project在前沿开源模型上取得了极具竞争力的性能:
🔷DeepSeek V4 Pro达到130,093 tok/s/chip
🔷Minimax M3达到77,079 tok/s/chip
🔷Kimi K3达到12,479 tok/s/chip

本推文串将概述@vllm_project和@inferact的相关工作:我们测试了什么、发现了什么,以及已经合入上游的内容。

这项工作展示了vLLM在真实工作负载上的性能,也体现了我们专注于将vLLM打造成优先适配智能体的引擎。

优化AgentX性能需要应对三大挑战:前缀复用、高效长上下文并行,以及通过Prefill-Decouple解耦扩展性能。

首先,长智能体会话会给前缀缓存和KV缓存卸载带来很大压力。现代混合模型大幅降低了所需的KV缓存大小,但即使只缓存每个块边界,仍会填满KV缓存池,导致跨会话的前缀缓存抖动。

修复方案是稀疏保留:每个定长区间段保留一个状态,加上最新的重放边界(vllm-project/vllm #43447, #45845),之后保留共享前缀边界,让智能体会话的区间可以设为0(#47782)。这让我们在14个并发请求、上下文长度到1M的情况下,仍能保持超过95%的缓存命中率。

KV缓存卸载更大的结构改动是将共享KV池改为分布式。通过将Mooncake Store作为一等连接器,prefill秩可以命中worker内和跨worker的前缀缓存,我们不再需要为了保持集群忙碌,在缓存局部性和负载均衡之间做权衡。会话感知路由(48048)让路由可以实现这一点。

对于单节点部署,SimpleCPUOffloadConnector已经得到大幅改进,支持所有混合模型架构,同时兼容CUDA和ROCm平台。对于ROCm上的DeepSeek V4 Pro,和重新计算前缀相比,该实现提升了81.7%的输出吞吐量,平均端到端延迟降低了46.6%。

2.8T的Kimi K3几乎放不下单节点,就算挤进去,留给KV缓存的空间也几乎为零,而KV缓存正是长多轮会话最需要的资源。

在这里,并行策略的重要性超过了我们测试过的所有其他模型。在所有配置中,TP8/DCP8是K3智能体场景的最优方案,B300上的vLLM峰值达到约12.5k tok/s/chip,对应约8 tok/s/user,Dynamo + vLLM上的GB300 NVL72可以在200 tok/s/user以上仍保持性能曲线。

K3还暴露出了一个值得修复的路由bug:vllm-project/router#194修复了路由丢弃reasoning_content的问题,这个问题会影响所有在其后部署的推理模型。

在MiniMax M3上,B200上的vLLM达到了约44k tok/s/chip,在吞吐量对比p90首包延迟上,vLLM领先TRT-LLM。M3和Qwen3.5都已经在第一时间完成适配合入。

最后,要实现完全优化的性能,需要通过prefill-decode解耦和分布式KV缓存卸载来扩展部署。感谢vLLM的MultiConn

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新