BarunAction 35M只用七千人数据,对齐大模型九成性能
介绍 BarunAction (35M) 🤗
今天我们发布了 BarunAction-35M,该模型旨在结构化移动动作任务上与 Qwen2.5-0.5B-Instruct 竞争。
没错,相比一周前,模型规模扩大了14倍。我(以及 Codex)在 BarunLM-35M 的基础上完成了大量后训练工作,最终得到了这个紧凑模型,可以将自然语言请求转换为类型化个人动作。
上周,我们介绍了 BarunLM-35M,这个基座模型在我们污染感知的九任务零样本基准测试中,取得了所有参评模型里最高的宏平均准确率。但如果一个小模型没法真正用起来,那做出来也没用。
我们的目标是,在保持模型极轻量的同时,最大化它的现实实用性。我们在 7,937 个移动动作样本上,做了一轮全参数、仅响应监督微调,完成后训练。本次发布没有用到强化学习。
在我们固定分组的 756 行移动动作开发划分集上,BarunAction 的严格完全匹配得分是 79.63%,而 Qwen 得分为 87.70%。尽管参数数量比 Qwen 少 14.09 倍,在该测试方案下 BarunAction 仍保留了 Qwen 90.80% 的完全匹配率。
这是公开开发证据,不是非公开的官方评估。
我们已经开源了模型权重、训练与评估代码、SFT 配方、数据衍生说明、基准证据和可复现性工件,方便其他人检查、复现,并在此基础上开展工作。如果你发现了任何bug、意外行为,或是有改进想法,我们非常期待收到你的反馈。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖