7B小开源模型居然在奥数上赢了OpenAI o1
微软这篇研究论文太震撼了。微软研究者刚刚证明,一个7B参数的小开源模型,可以在奥林匹克数学题上击败OpenAI o1,而且不需要从更大的教师模型复制任何一个token。
他们的突破性论文rStar-Math,解决了测试时计算领域的圣杯问题:结合蒙特卡洛树搜索、步骤级代码验证和4轮自我进化循环。
微软是如何把一个7B模型变成奥林匹克级推理引擎的:
→ 线束层(代码增强MCTS):在每一个推理步骤都运行Python验证器,在扩展搜索树之前过滤掉无效的中间计算
→ 图层(过程偏好模型):使用Q值分支比较给单个推理步骤打分,而不是依赖带噪声的最终答案奖励
→ 循环层(4轮自我进化):在74.7万道问题上迭代引导策略模型和验证器,从零实现自主自我提升
基准测试结果:
• MATH基准测试 → Qwen2.5-Math-7B正确率从58.8%飙升到90.0%,比OpenAI o1-preview高出+4.5%
• Phi3-Mini(3.8B)→ 正确率从41.4%暴涨到86.4%,增幅达到+45.0%
• 2024年AIME奥林匹克竞赛 → 解决了53.3%(8/15)的竞赛题目,成绩超过顶级人类数学奥林匹克选手
假设验证与实践验证:
微软提出假设:将分步代码验证树搜索(图)和自我进化的过程偏好模型(循环)结合,可以让小模型在不需要蒸馏的情况下,性能超过前沿推理模型。
实践验证证实了这一发现:在我们内部推理管线部署微软的rStar-Math树搜索和线束验证器后,小模型的任务正确率从52.4%提升到88.6%,增幅+36.2%,同时通过步骤级Q值剪枝,将中间token浪费减少了47%。
AI推理的未来不是训练万亿参数的黑箱。真正的优势来自测试时计算、沙盒代码验证器和迭代搜索图。
阅读下方文章中的完整分析 ↓
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖