16个GB10节点流畅运行2.8T参数Kimi K3,编码30 tok/s
我想分享一个快速更新和性能视频,运行完整的 Moonshot AI Kimi K3(moonshotai/Kimi-K3)模型在我的 16x GB10 集群上。
让 2.8T 参数模型流畅运行需要自定义运行时补丁和可靠的网络布局,但编码任务的吞吐量和并发性令人印象深刻。
性能基准
- 编码生成/解码:在密集代码生成和智能体任务期间,持续约 30 tok/s(峰值约 38 tok/s)。
- 预填充吞吐:约 750–910 tok/s(通过修改 NCCL 拓扑和双交换机设置优化)。
- 并发与压力测试:同时处理多个用户请求而不会降低 token 生成速率或耗尽 KV 缓存内存。
- 上下文/工具基准:稳定运行数十万 token 的上下文,支持多次 500k 压缩的智能体工作流。
硬件配置
- 计算:16x GB10 集群节点
- 连接:双 MikroTik 交换机(CRS804-4DDQ),使用 4x 400G-to-4x100G 分支电缆。
- 运行时:自定义 gb10-vllm 栈,使用 dspark / Inferact/Kimi-K3-DSpark 包装器以及自定义 MLA/KV 内核。
我附上了一个短片,展示实时 token 流和编码输出。
GitHub 和设置文件
所有运行时补丁、配置文件和构建脚本都在我的 GitHub 上: