Stanford University发布LLM-as-a-Verifier 框架(5)
开源模型能否通过验证自己的答案来击败前沿闭源模型?斯坦福大学推出了 LLM-as-a-Verifier。
该框架简单得惊人:让 DeepSeek V4 Flash 为任务生成 5 条候选智能体轨迹,然后用完全相同的模型(不使用更强的闭源模型,也不使用外部验证器)来验证、打分并给这些候选排序。
这个开源模型同时充当生成器和裁判器,把低成本推理变成了一个自我改进的循环。关键在于,开源模型的 token 成本足够低,生成并验证 5 个候选的成本仍远低于调用一次前沿模型。
结果:在 Terminal-Bench 2.1 上,DeepSeek V4 Flash 的任务成功率从 79% 提升到 88%,超过了 Claude Fable 5,而总成本大约低 11 倍。
该方法在多个基准测试中都取得领先:Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)以及 MedAgentBench(73.3%)。
当将验证器反馈输入 SAC 和 GRPO 后,它还能提升机器人控制和数学推理的样本效率。
论文:
代码:
项目:
我们的报告:📬 #PapersAccepted by Jiqizhixin
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖