AI Pulse

16个GB10节点流畅运行2.8T参数Kimi K3,编码30 tok/s

我想分享一个快速更新和性能视频,运行完整的 Moonshot AI Kimi K3(moonshotai/Kimi-K3)模型在我的 16x GB10 集群上。

让 2.8T 参数模型流畅运行需要自定义运行时补丁和可靠的网络布局,但编码任务的吞吐量和并发性令人印象深刻。

性能基准

- 编码生成/解码:在密集代码生成和智能体任务期间,持续约 30 tok/s(峰值约 38 tok/s)。
- 预填充吞吐:约 750–910 tok/s(通过修改 NCCL 拓扑和双交换机设置优化)。
- 并发与压力测试:同时处理多个用户请求而不会降低 token 生成速率或耗尽 KV 缓存内存。
- 上下文/工具基准:稳定运行数十万 token 的上下文,支持多次 500k 压缩的智能体工作流。

硬件配置

- 计算:16x GB10 集群节点
- 连接:双 MikroTik 交换机(CRS804-4DDQ),使用 4x 400G-to-4x100G 分支电缆。
- 运行时:自定义 gb10-vllm 栈,使用 dspark / Inferact/Kimi-K3-DSpark 包装器以及自定义 MLA/KV 内核。

我附上了一个短片,展示实时 token 流和编码输出。

GitHub 和设置文件

所有运行时补丁、配置文件和构建脚本都在我的 GitHub 上:

👉 https://github.com/ciprianveg/gb10-vllm

阅读原文
📚 相关主题 大语言模型开源工程

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新