BitNet让100B大模型只用普通CPU就能跑
这看起来不太真实……但微软确实搞出来了!!
一个100B参数的模型,单个CPU就能跑。
不用GPU,不用复杂配置,就是重写了底层的数学实现。
大部分人可能没留意到这个细节 传统的大语言模型用的是16位浮点数,每个权重都是一串小数,比如0.0023、-1.47这种。
推理的时候要做几十亿次浮点乘法运算,这就是为什么非得用GPU不可。
BitNet的做法完全不一样。
它不用浮点数,改用三元权重:{-1, 0, 1}。
这不是压缩,也不是优化,是换了一套完全不同的计算方式。
看下效果: → 乘1就是保留原值 → 乘-1就是翻转正负号 → 乘0就直接跳过 就这么简单。
没有乘法运算了,只剩加减和跳过。
矩阵乘法——AI最核心的计算——变成了CPU上成本很低的整数运算。
实际数据是这样的: → CPU上快2到6倍 → 能耗降低最高82% → 模型越大,效果越明显
想想看: 一个100B的模型 每秒能生成5到7个token 就在一个普通的CPU上
这不叫“优化” 这叫换了个思路
最夸张的是啥? 这些模型不是训练完再压缩的。 是从一开始就用这种方式训练的。 精度没降,质量也没掉。 模型就是在这样的约束条件下学会的。
为什么说它是1.58位? 因为: log₂(3) ≈ 1.58 3个取值,每个权重的信息密度做到最大。
硬件瓶颈这件事,可能正在成为过去式。
AI不会越变越小。 是数学变聪明了。
过一年再看,本地跑LLM大概都不算什么事了, 反而是跑不起来才稀奇。
🔗