JOSIE-2 大模型靠练推理赢过翻倍体量模型
今天我发布了完整的 JOSIE-2 模型系列。🚀 提供 2B • 4B • 9B 三个变体。
JOSIE-2 探究了一个简单的研究问题:大语言模型能否通过学习推理方法,而非单纯记忆更多事实,来大幅提升能力?
为了研究这个问题,我搭建了一个多阶段、多模型的合成数据生成流水线,利用并训练了两个独立的大语言模型,生成了最高质量的合成数据集。
我依托此前开发 JOSIE 和 Josiefied 模型积累的多年经验与知识,完成了模型的优化与创建。每个模型都在 400 万 token 上训练,上下文窗口大小为 16K。
实验结果令人振奋:
- JOSIE-2-2B-OSS 性能持续优于它的 4B 基座模型
- JOSIE-2-4B-OSS 性能持续优于它的 9B 基座模型
- JOSIE-2-9B-OSS 发挥远超参数规模预期,能够和参数规模两倍于它的模型竞争,甚至常常超过对方。
我还特意对数据集做了筛选,强调诚实与真实性,鼓励模型优先输出真实答案,在合适的时候承认不确定性,并且对错误假设提出质疑,而非单纯附和用户。
训练过程中出现了一个意外的行为:模型的推理风格。当提示词特别模糊或问题不成立时,模型内部推理偶尔会爆粗、开玩笑,甚至吐槽用户。这个行为只局限在推理过程中,且不是通过显式训练得到的——它自然涌现,是因为我在训练时没有特意优化掉风格化表达。
所有模型及量化变体现已在 Hugging Face 集合上线:🤗
Ollama 版本很快就会推出。欢迎查看基准测试对比。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖