llm-as-a-verifie让低成本LLM性能超越Claude Fable 5
给大家分享个真能让V4-Flash超过Fable 5的神器🔥 这个神器叫llm-as-a-verifie,核心是靠“自己生成、自己验答案”,结果直接干过了 Claude Fable 5,而且成本便宜 11 倍。
llm-as-a-verifie的作者@jackyk02 刚分享了一组 Terminal-Bench 2.1 实验:
在没用这个神器之前DeepSeek V4 Flash 单次运行的成功率只有 79%。
但如果配合这个神器llm-as-a-verifie,让一次生成 5 个候选答案,再让 DeepSeek V4-Flash 自己当 Verifier,从里面挑一个最好的。
成功率直接从79% 到了88%。
直接超过 Claude Fable 5。
更夸张的是,整个过程甚至不需要再接一个更强的模型做裁判。
就是: DeepSeek 生成 5 次 → DeepSeek 自己检查 → DeepSeek 自己选答案 然后性能直接往上跳了 9 个点。
这意味着一个很值得注意的变化: 便宜模型可能根本不需要在单次推理里打赢最贵的闭源模型。
只要推理成本足够低,就可以疯狂采样,再用 Verifier 把正确答案筛出来。
以前 Scaling 是堆参数、堆训练算力,现在变成可以拿推理次数换智力。
如果这条路线继续成立,开源/低成本模型真正恐怖的地方可能还不是“越来越聪明”。
而是它便宜到可以一次思考 5 遍、10 遍、20 遍。 然后再自己给自己批卷子。
看了下仓库感觉靠谱。 里面公开了 Terminal-Bench 2.1 的 5 条 DeepSeek V4 Flash trajectory、Best-of-3 / Best-of-5 的复现脚本,以及 verifier 实现。
README 写的是 Bo5 从 78.7% 提升到 88.0% ± 0.6%,Oracle 上限是 96.6%。
而且我专门看了有没有最经典的 benchmark 小把戏,也就是把正确答案偷偷喂给 Judge。
这里暂时没发现。loader 里明确把每条 trajectory 拆成 problem、trace 和 reward,verifier 只看到 problem 和 trace,reward 作为 held-out ground truth 最后才拿来判断它选对没有。
仓库地址: