AI Pulse
📡 X 信号

玩家适配GLM-5.3 Flash 在家用4张3090上运行

玩家适配GLM-5.3 Flash 在家用4张3090上运行

2比特量化的GLM-5.3 Flash效果达不到要求,3比特量化版本体积则达到125GB。

发帖人拥有4张RTX 3090显卡,总显存容量为96GB,放不下3比特版本。

他参考Project Maya的模型打包思路,没有对模型重新量化,只调整了不同模块的量化比特分配。

具体来说,他将@turboderp_发布的两个EXL3量化版本的张量进行替换,让门控矩阵和上行投影矩阵保持2.05比特每权重(bpw),专家下行投影矩阵使用3.05比特每权重。

EXL3支持每个张量单独存储比特宽度,因此修改后的模型可以直接加载。整个过程共替换了49536个张量,没有任何张量被重新量化。

在发帖人的设备上,不同方案的性能表现为:2.05比特每权重每秒生成79个token,KL散度(与BF16精度相比)为0.121;发帖人的混合方案占98GB显存,每秒生成66个token,KL散度为0.096;3.05比特每权重每秒生成43个token,KL散度为0.047。

这个混合方案可以在256K上下文长度下同时支持视觉输入和工具调用,其中77%的参数存储在显存中,剩余参数存储在内存中。

发帖人还移除了模型的拒绝生成机制,只需要一个2.2MB的额外文件,不需要修改模型权重。

原生模型会拒绝146个有害请求中的144个,加载该文件后,438次测试中没有出现任何拒绝生成的情况,该文件同时兼容2比特量化版本、本次混合版本以及Maya-M。

目前没有其他320B参数的大模型,可以在家用设备运行,同时支持256K上下文、视觉输入、工具调用且无内容限制。

这个方案并非神奇的黑科技:给下行投影矩阵分配第三个比特,每字节的效果比分配给其他模块高17%,发帖人只是选择了适配自己显卡容量的分配方式。目前已经开放了三个去限制仓库、一个新量化版本和两个引擎分支供下载。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新