AI Pulse
📡 X 信号

开发者在Mac上调出比苹果新Siri更强的本地小模型

开发者在Mac上调出比苹果新Siri更强的本地小模型

这篇帖子意外爆火,还引发了不少SaaS领域从业者的讨论。作者在这里分享了自己微调小语言模型(SLM)的全过程。

今年4到5月,作者完成了65亿参数模型Mac-1的微调,这个模型可以控制487款Mac原生应用。作者的目标是打造一个比Siri更好的语音助手,并且已经实现了这个目标。

作者用Codex GPT 5.5设计整个微调框架,确定所需数据集、适配的小模型、微调方式和本地运行方案。作者提到,除了Claude系列模型外,现有大模型在微调流程编排上的表现已经相当出色。

最终确定用两个模型分工:20亿参数的Qwen 3.5负责分类,40亿参数的Qwen 3.5负责工具调用和生成回复。

Codex GPT 5.5建议数据集至少需要2万个样本。作者没有找到现成的 macOS原生工具开源数据集,于是决定自己构建合成数据集。

构建数据集时,Deepseek模型负责执行,Codex GPT 5.5担任规划和审核角色。只用两天,团队就得到了经过验证、去重、评估的3万个样本数据集。

之后Codex设计了微调配置,选择用unsloth studio、LoRA适配器而非QLoRA,并且通过Colab Pro获得价格更低的H200 WebGPU使用权。

微调任务8小时就完成,首次测试在45个分类、400多款macOS原生工具上就得到了78%的准确率。作者又花两周调整,第五轮训练后准确率就达到了98%。

就在作者准备发布模型当天,苹果推出了后端搭载Gemini的新版Siri。作者决定暂时不直接和苹果竞争,但仍考虑发布模型或将它开源。作者认为这个模型的表现依然优于苹果新版Siri。

作者分享这段经历是为了说明,在特定训练场景中,小语言模型的表现可以超过大语言模型。多数企业都有这类特定场景,包括客户支持、金融、保险、销售、库存管理、数据录入等,覆盖文档分析、信息提取、翻译、合规、摘要、分类等多种需求。

经过微调的小语言模型处理这些任务速度快10倍,成本低95%,还可以部署在企业自有服务器,数据不需要外流,这也是很多企业现在自研AI方案的原因。

作者认为,微调在当下就像2024年之前的编程,是一项正规的专业技能。作者还提到自己已经基于1万条推文微调了一个9亿参数、写作风格和自己一致的Ornith 1.5模型,后续会分享分步教程,请大家保持关注。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新