AI Pulse
📡 X 信号

llm-as-a-verifie让低成本LLM性能超越Claude Fable 5

llm-as-a-verifie让低成本LLM性能超越Claude Fable 5

给大家分享个真能让V4-Flash超过Fable 5的神器🔥 这个神器叫llm-as-a-verifie,核心是靠“自己生成、自己验答案”,结果直接干过了 Claude Fable 5,而且成本便宜 11 倍。

llm-as-a-verifie的作者@jackyk02 刚分享了一组 Terminal-Bench 2.1 实验:

在没用这个神器之前DeepSeek V4 Flash 单次运行的成功率只有 79%。

但如果配合这个神器llm-as-a-verifie,让一次生成 5 个候选答案,再让 DeepSeek V4-Flash 自己当 Verifier,从里面挑一个最好的。

成功率直接从79% 到了88%。

直接超过 Claude Fable 5。

更夸张的是,整个过程甚至不需要再接一个更强的模型做裁判。

就是: DeepSeek 生成 5 次 → DeepSeek 自己检查 → DeepSeek 自己选答案 然后性能直接往上跳了 9 个点。

这意味着一个很值得注意的变化: 便宜模型可能根本不需要在单次推理里打赢最贵的闭源模型。

只要推理成本足够低,就可以疯狂采样,再用 Verifier 把正确答案筛出来。

以前 Scaling 是堆参数、堆训练算力,现在变成可以拿推理次数换智力。

如果这条路线继续成立,开源/低成本模型真正恐怖的地方可能还不是“越来越聪明”。

而是它便宜到可以一次思考 5 遍、10 遍、20 遍。 然后再自己给自己批卷子。

看了下仓库感觉靠谱。 里面公开了 Terminal-Bench 2.1 的 5 条 DeepSeek V4 Flash trajectory、Best-of-3 / Best-of-5 的复现脚本,以及 verifier 实现。

README 写的是 Bo5 从 78.7% 提升到 88.0% ± 0.6%,Oracle 上限是 96.6%。

而且我专门看了有没有最经典的 benchmark 小把戏,也就是把正确答案偷偷喂给 Judge。

这里暂时没发现。loader 里明确把每条 trajectory 拆成 problem、trace 和 reward,verifier 只看到 problem 和 trace,reward 作为 held-out ground truth 最后才拿来判断它选对没有。

仓库地址:

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新