AI Pulse

Qwen3.8-27B思考档位乱序:低档比中档更费推理,Pi微调版修复

Qwen3.8-27B思考档位乱序:低档比中档更费推理,Pi微调版修复

Qwen3.8-27B 有个怪问题:思考档位顺序是乱的。低档比中档花更多推理,通过率反而更低——68.5% 对 70.7%。只数通过的尝试,低档仍比中档多花约 1.3 倍推理。基础模型只在最高档满足“更高级别花更多、解决更多”这一顺序。

微调版 Pi(Qwen3.8-27B-pi)把这个顺序掰了回来。做法分两段:先 SFT,再 RL(GRPO)。SFT 用筛选过的成功会话做 LoRA 微调,覆盖所有线性层。适配器参数不到模型参数的 1%。它让输出 token 省约 21%、每任务轮次少 13%,通过率还略高。但成本顺序依然违反——low 还是比 medium 贵三分之一。

RL 专门收拾这个问题。作者问的是:同一任务上,成功的低档尝试该比成功的高档尝试花更多推理吗?奖励设计把正确性放在第一位:失败得 0,成功至少得 0.5;xhigh 不施加长度压力。GRPO 原本的二元结果奖励,被换成了成功条件化的努力顺序奖励。low 对 medium 的推理比率,从 SFT 后的 1.37 倍降到 0.97 倍。RL 的主要功劳是恢复顺序,不是拔高分数。

三个评估集上,顺序都立住了。Terminal-Bench 2.1:Pi 从低到高是 71.9% → 75.3% → 79.8%。基础模型在中档反而掉头向下。Pi 的中档匹配基础模型的最高档,输出 token 少约 41%。SciCode:每个档位解决更多子问题,最高档输出 token 少约 23%。GPQA Diamond:Pi 保持“更高级别花更多、得分更高”,最终 86.4%。同组任务里,基础模型两个顺序都违反。

量化版本也一块儿发布:BF16、FP8(约 30.4GB),外加 17 个 GGUF 变体(约 9–29GB)。FP8 遵循官方 Qwen 的 FP8 格式;GGUF 校准数据来自完整代理轨迹,成功和失败都算。Pi 本身是开源(MIT)的终端编码代理,只有四个工具:read、write、edit、bash。

作者是学生,自费租算力。RL 运行较短,单一训练种子,没有做消融。所以 Base 对比 Pi 时,SFT、RL、检查点选择叠在一起,不能把功劳单独算给奖励。奖励只约束推理 token,不保证总输出、工具调用或墙钟时间减少。作者更想用 Terminal-Bench 4.1,但预算不够,只能留在已接近饱和的 2.1。

报告最后留了几条实操建议,都来自踩过的坑。验证损失不是代理成功的良好预测器,选 SFT 检查点要真跑代理看效果。通过/失败奖励会浪费最好的组,成功条件化参考在全员成功时仍能制造学习信号。检查梯度而不是损失:他用的 Liger RMSNorm 损失一样,梯度却差了约 82%。

阅读原文
📚 相关主题 大模型编码

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新