AI Pulse

60MB的AI跑在CPU上,还能从硬盘翻1亿条历史

有个开发者从零训练了一个250M参数的模型,叫SHADOW-250M-Instruct。权重量化到2 bits以下,部署包才60MB,跑起来大约占80MB内存。在普通笔记本电脑的CPU上,生成速度约400 tokens每秒,不需要GPU。60MB放今天的大模型里,小得不像回事儿,但它有个本事:从硬盘上检索1亿token的历史。

长上下文:把记忆压成1 bit,塞进磁盘

最近的2048个token用fp16留在KV缓存里,行为和常规模型一样;更早的token被压缩到1 bit写进磁盘。压缩后每个token约320字节,100万token的历史大概占320MB磁盘空间。模型从训练一开始就被训练成从磁盘缓存检索信息,上限是1亿tokens。预算有限,模型没有学会推理这些token,只能检索并基于它们作答。

举个具体例子:当问题“设备Grus-189的序列号是什么”被提出时,答案躺在存档约5060万token深处,模型返回了SN-442976。算下来,大约16GB的文本内容。一台没有GPU的电脑,把历史放在硬盘上,就能让AI回答其中的具体事实。

质量:语言建模的底子

压缩这么狠,质量掉多少?基础模型在未见过的英文网页文本上交叉熵3.15 nats/token,困惑度23.3,每字节0.99 bits。困惑度23.3,相当于模型预测下一个词时,要在23种可能里猜。这衡量的是语言建模质量,不是对话能力。

作者在帖子里写得很直接:这是一个250M模型,在开放事实上会有错误,不声称能击败任何大模型。它的训练目标被定在“检索出来”而不是“推理出来”,这正是预算限制下的取舍。

词汇表:固定编码,零训练参数

这模型还有个反常规的设计。通常嵌入表要训练,这里每个token是一段固定的512位代码,全部131k tokens加起来8.4MB,零训练参数。在WordSim-353人类词相似度评级上,这套固定代码得了0.619 Spearman相关,而随机代码只有0.029。语义结构被编码进了固定表示里,省掉的嵌入表正是模型里最大的一块参数开销。

模型可以微调,完整工具包包含演示和微调前后的数字对比,主权重也在repo里。GitHub和Hugging Face链接都已公开,Hugging Face上的名字是NODEMIND/SHADOW-250M。链接挂出来的时候,repo在GitHub上有7颗星。

社区:比作者预想的温和

作者最后补了一句感谢。“说实话,发帖前我很害怕,以为会被喷,结果每一条评论都是好奇的、有帮助的。”

评论者的注意力集中在几个方向。有人惊讶2 bit和1 bit压缩能到这个程度,说听起来可以在树莓派上跑;也有人反问,要是有128GB内存,干嘛还要压缩写盘。有人把1亿token的磁盘缓存比作向量数据库。还有人提出更基础的问题:这个离线上下文缓存,是作者自己发明的,还是读过什么资料?模型如何搜索上下文,是在固定上下文上训练的吗?扩展到更大参数规模的估计、下一步是否做推理,这些问题也还挂在评论区,没有看到作者回答。

一位评论者说“我找的正是这个东西”,另一位建议下一个模型叫UMBRA。还有人用一句话概括了整个项目:一个基于语言模型的专家系统,或者反过来。

这个概括刚好画出了模型的边界。250M参数,60MB部署,CPU运行,检索而不推理,固定编码表,1亿token的硬盘历史。它没有宣称自己是顶级大模型的替代品。它只是证明了一件事:能回答问题的AI,不一定要靠云端超级计算机。

阅读原文
📚 相关主题 大语言模型开源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新