AI Pulse

16GB显存跑AI助手,免费微调版让工具调用更可靠

作者只有16GB显存,别的模型想舒服地装进去很难。他选的是Gemma 4 12B。

但这个型号不顺手。官方微调版本不适合智能体式编程——让AI自己决定调用哪些工具来完成任务。在GitHub Copilot里,模型用不好给它的工具,命令行更是弱项。于是作者自己微调了一版,同时解决工具调用和命令行两个问题。

微调结果很直接:工具调用提升2.7倍,模型尝试发出的工具调用次数多了15.7%。在作者看来,多出来的调用是在实际干活,不是陷在冗长的推理里空转。

权重从fp16到Q4_K_M的版本都放出来了,可以用llama.cpp或ollama直接加载。Q4_K_M是量化格式,显存占用更小。16GB显存的机器直接就能用,数据不用送到云端。

训练数据是5,211个高质量工具调用示例,每条都按Gemma 4自己的聊天模板格式化。主体来自glaiveai,另加了一批AgentInstruct的样例。选后者是因为它包含真实世界的bash和终端操作,命令行场景正好缺这个。

评论区有人直接要训练细节:数据集、超参数、脚本,还问是不是SFT加某种强化学习。另一个问题更具体:微调有没有解决模型一次只调用一个工具的毛病。提问者注意到,许多新的智能体模型能连续做三到四次工具调用,Gemma系列却似乎从来没有这个能力。

显存大小也被讨论。一位只有12GB显存的评论者问,能不能做4bit QAT版本,他说QAT比普通量化更稳定。16GB显存还有别的选择:Qwen 3.8 27B IQ4_XS去掉视觉模块,能勉强塞进显存。另一款Qwen 3.8 27B UD Q3 K_XL,配合Vulkan和MTP,在16GB的9070XT上能跑100k上下文。这个档位里,Gemma不是唯一选择。

有人质疑选型。Qwen 3.5 9B本来就有专做智能体工作的微调版,为什么还要费劲微调Gemma 4 12B?也有人给不换模型的方案。比如forge,它会在工具调用失败时自动提示模型,对反复失败的模型很管用。另一个评论者做过一个路由器,放在任何OpenAI兼容API前面。后来嫌太乱,换成了Qwen 35B MOE,11GB显存上跑,工具调用表现不错。

还有人愿意投更多时间。一个评论者花了几周给Gemma 4 12B写推理引擎,专门针对自己的5080 16GB优化。在unsloth的NVFP4模型上,解码速度比llama.cpp略高,16k基准下预填充速度快50%。

后面还有人在等别的版本:有人想微调Gemma 12B做视频编辑,因为模型自带音频和视觉。那位准备做大型微调的评论者说,愿意分享工具调用的成果,包括他写的蒸馏工具Ghostwriter。另外两条请求更具体:希望26B也有同样的微调;希望作者把数据集发到Hugging Face,说不定能帮26B和31B解决遗留的工具调用问题。一个12B模型的微调,讨论已经落到了更大的型号上。

阅读原文
📚 相关主题 大模型AI微调本地部署

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新