AI Pulse
📡 X 信号

K3大模型部署需数千万元 新方法降低大模型蒸馏算力成本

有人指出K3部署成本很高,很快就有研究人员开始探索降低大模型蒸馏算力消耗的方法。K3是一个参数规模2.8T的大模型,仅BF16格式的原始权重就有约5.6TB。

Moonshot官方建议使用搭载64颗以上加速器的超级节点部署K3。如果全部采用H200显卡计算,单张H200拥有141GB高带宽内存(HBM),公开价格约为2.7万美元,折合人民币大约19万元一张。

64张H200显卡的总成本就有约1200万元人民币,这还仅计算GPU的花费。再加上CPU、内存、NVMe硬盘、高速网络、服务器、电源、散热和后续运维,自行部署一套64加速器的K3运行集群,总成本大约在三千万元人民币左右。

本次公开的GitHub项目采用两个方法降低蒸馏成本,首先缓存教师模型每个位置Top-100的logits,供学生模型后续训练直接使用,减少教师模型重复计算的开销。

其次将KL损失改为融合分块(Fused Chunked)计算方式,不再一次性生成完整的词表×序列长度稠密张量,而是将输出投影直接融入KL计算,按块处理数据。

实际测试显示,处理上下文长度32K的GPT-OSS 20B模型时,所需节点数从4个缩减到1个,单步训练时间从57秒降到12.23秒,单GPU浮点吞吐从74.2提升到345.7 TFLOP每秒。

项目代码已经开源,相关论文也已公开,符合部署条件的用户可以尝试使用。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新