AI Pulse
📡 X 信号

BitNet让100B大模型只用普通CPU就能跑

这看起来不太真实……但微软确实搞出来了!!

一个100B参数的模型,单个CPU就能跑。

不用GPU,不用复杂配置,就是重写了底层的数学实现。

大部分人可能没留意到这个细节 传统的大语言模型用的是16位浮点数,每个权重都是一串小数,比如0.0023、-1.47这种。

推理的时候要做几十亿次浮点乘法运算,这就是为什么非得用GPU不可。

BitNet的做法完全不一样。

它不用浮点数,改用三元权重:{-1, 0, 1}。

这不是压缩,也不是优化,是换了一套完全不同的计算方式。

看下效果: → 乘1就是保留原值 → 乘-1就是翻转正负号 → 乘0就直接跳过 就这么简单。

没有乘法运算了,只剩加减和跳过。

矩阵乘法——AI最核心的计算——变成了CPU上成本很低的整数运算。

实际数据是这样的: → CPU上快2到6倍 → 能耗降低最高82% → 模型越大,效果越明显

想想看: 一个100B的模型 每秒能生成5到7个token 就在一个普通的CPU上

这不叫“优化” 这叫换了个思路

最夸张的是啥? 这些模型不是训练完再压缩的。 是从一开始就用这种方式训练的。 精度没降,质量也没掉。 模型就是在这样的约束条件下学会的。

为什么说它是1.58位? 因为: log₂(3) ≈ 1.58 3个取值,每个权重的信息密度做到最大。

硬件瓶颈这件事,可能正在成为过去式。

AI不会越变越小。 是数学变聪明了。

过一年再看,本地跑LLM大概都不算什么事了, 反而是跑不起来才稀奇。

🔗

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新