OrcaRouter 讨论 27B 开源决策模型的设计方向
最近我们看到一波开源“决策模型”浪潮,其中很多是 27B 参数,因为它们都基于同一个 Qwen3.8 27B 基座构建。这些模型大多开源了权重,但没人运营像样的 API。
原因也很合理:让 27B 模型保持热启动随时可用成本很高。这让我们回归基本原理(卡尼曼的框架):系统 1 应该是快速、便宜、持续在线且面向行动的。系统 2 则应该更慢、思考更深,只在需要时调用。
如果你的系统 1 做每个决策都需要昂贵的 27B 推理模型,那你实际上只是构建了另一个更小的系统 2。
我们不是说 Jev 就是系统 1 模型的最终形态。但我们认为,可以在不增加资源占用的情况下,添加/改进一些能力让它变得更好:
- 状态性——理解之前发生了什么、什么改变了,以及当前的信念状态。
- OOD/不确定性识别——知道它什么时候不知道答案。
- 原生升级——不只是输出置信度,还要选择:行动/弃权/升级给系统 2。
- 动作选择——从“回答这个问题”转变为:“给定当前状态,下一步应该做什么?”
这就是我们认为真正的系统 1 应该优化的方向。不是单次调用的最大智能。而是单位成本能产出最多有用决策,并且能正确判断何时该升级给系统 2!
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖