13个大模型答案验证系统,一个只看格式的基线超过8个
哪个系统真正在验证LLM答案上表现最好——赢家能帮到你的agent吗?
每个答案验证供应商都会发布一个基准,而每个供应商都赢了各自的基准。我们在一个包含2,018条、标签完全相同的测试集上运行了十三个系统,发布了评分代码,并把结果并排放在一起。
类型化决策排行榜 → https://huggingface.co/spaces/mayafree/typed-decision-leaderboard
简而言之:只有三个系统超过0.70,最强的两个在统计上无法区分,而一个只看答案长度和格式的基线得分0.7036——高于十三个系统中的八个。
1. 类别
类型化决策模型返回结构化判定——布尔值、选项或序数分数——而不是自由文本。它只运行一次前向传播,生成零个token,这使得它在回答相同问题时比询问前沿模型便宜一到三个数量级,也更快。
TypeSafe AI的Jev以“System One模型”的名义创立了这一类别,围绕它形成了一个小型生态:开源复现、架构兼容的替代品(如Convai的Laya),以及相邻工具(如Patronus Lynx和Vectara HHEM)。
此前不存在的是一个所有系统都运行过的单一测试集。
2. 我们测量了什么
| 项目 | 内容 |
|---|---|
| 任务 | 给定一个问题和一个由某个模型编写的答案,评判该答案是否正确 |
| 条目 | 2,018条 · 508条错误 · 5个领域 · 由4个不同模型生成的答案 |
| 指标 | AUC——错误答案在排序中沉到底部的程度。无阈值。0.5=抛硬币 |
| 轴 | 事实性验证,不提供任何依据文档 |
| 聚合 | 先按领域,再按规模加权 |
| 不确定性 | 配对自举,3,000次重采样;区间包含零则不分排名 |
有两个设计选择值得明确说明,因为它们改变了数字的含义。
按领域聚合。将全部2,018条合并为一个AUC会得到系统性地更高的数字,因为不同领域的分数尺度不同,合并会奖励这种差异而非区分能力。在我们自己的系统上,合并读数为0.80,而按领域均值为0.73。我们报告的是较低、可复现的那个。
已发布的基线。表中有两行参考:一个基于答案的十个表面特征(长度、数字数量、格式)的逻辑回归模型,以及回答模型自己声称的置信度。它们的存在是为了让其他每个数字都有可对照的基准。
3. 结果
| # | 系统 | 供应商 | API | 本地 | AUC |
|---|---|---|---|---|---|
| 1 | ZTC (397B) | VIDRAFT | 是 | 是 | 0.7364 |
| 2 | JEV | TypeSafe AI | 是 | 否 | 0.7350 |
| 3 | ZTC (27B) | VIDRAFT | 是 | 是 | 0.7282 |
| — | 长度与格式基线 | 参考 | — | — | 0.7036 |
| 4 | open-jev 4B | pngwn | 否 | 是 | 0.6844 |
| 5 | Patronus Lynx 8B | Patronus AI | 是 | 是 | 0.5179 |
| 6 | Laya-Typed-Decisions 421M | Convai | 否 | 是 | 0.5144 |
| — | 模型自身声明的置信度 | 参考 | — | — | 0.5000 |
| 7 | Laya-Multilingual 322M | Convai | 否 | 是 | 0.4796 |
参考——直接询问LLM(生成token,因此在轴之外,不参与排名):GPT-5.2 0.7148 · Qwen3-Next-80B 0.6366 · GPT-4o-mini 0.5878 · Gemini 2.5 Flash-Lite 0.5822。
不同轴:Vectara HHEM-2.1 0.4852。它判定一个答案是否来自所提供的文档;本测试集不提供任何文档。
表的顶端是平局
ZTC (397B) 以0.0014领先JEV。该差距的95%区间从−0.019到+0.032。按照榜单自己的规则——区间包含零则不产生排名——第一名和第二名无法区分,页面在表格上方而非脚注中说明了这一点。
4. 在误差棒范围内仍然成立的四个发现
4.1 表面基线是真正的门槛
仅凭答案长度和格式就达到0.7036。十三个被测系统中,八个低于它。低于这条线的验证器检测的不是正确性,而是形态。这个类别中任何省略该基线的排行榜都是在给参赛者贴金。
4.2 在这个轴上,更大并不更好
在同一家族内,397B模型整体上胜过27B——但在科学推理上,排名强烈反转:
科学推理 27B 0.7410 · 397B 0.6287
一个大了十四倍的模型得分低0.11。这与一个独立的观察一致:一个180B级别的模型得分0.7146,低于一个4B的0.7284。验证质量跟随的是表征几何,而不是参数数量。
4.3 “直接问前沿模型”既贵又只能排中游
GPT-5.2达到0.7148——低于两个ZTC配置,也低于JEV——同时生成token,并且每1000次调用大约花费0.55美元,而JEV为0.024美元。更小的评审模型更差:GPT-4o-mini 0.5878,Gemini 2.5 Flash-Lite 0.5822。
4.4 存在开源替代品,但差距是真实的
Laya在架构上是Jev最接近的开源类似物——非自回归、零生成token、Apache-2.0、每次调用约0.015秒,这大约比我们测量的托管API快140倍。它的速度主张成立。但它在本测试集上的准确率不成立:0.4796 / 0.5144,而公开声称在供应商自己的英文类型化决策基准上击败了Jev。两个数字都可能是真的——它们是不同的测试——这正是需要一个共享测试集的理由。
5. AUC不是你在部署时使用的数字
排名回答的是“哪个系统最擅长把正确答案和错误答案分开”。它并不回答“哪个系统能帮助我的agent”。我们直接测量了第二个问题。
设置:对于每一条,用验证器给答案打分;把得分最低的k%发送给更强模型重新回答;其余保留。所有分支共享同一个重新回答池,因此没有分支获得更幸运的重试。平局随机打破,并在200个种子上取平均。
在20%重试预算下,相对于74.83%的无门控基线:
| 门控 | 最终准确率 | 相对无门控 |
|---|---|---|
| ZTC | 76.16% | +1.34个百分点 |
| JEV | 74.76% | −0.07个百分点 |
| 随机 | 74.58% | −0.25个百分点 |
这两个系统的AUC相差0.0014,端到端agent准确率相差1.4个百分点。机制解释了这一点。重新回答是一把双刃剑:
错误答案被送回 → 38%被修复
正确答案被送回 → 30%被破坏
因此,门控的价值由精确率决定,而不是召回率。在20%预算下,JEV路由了403条,其中216条已经是正确的;ZTC路由了403条,其中195条已经是正确的。JEV修复的数量大致等于它破坏的数量。这种不对称在AUC列中是看不见的。
范围:一个升级目标,一个条目集。我们把它当作机制来报告,而不是普适常量。
6. 我们发布什么,以及我们不能发布什么
完整发布:每一个分数、每一个标签以及评分代码。
不重新分发:源条目。它们来自许可证禁止再分发或修改的语料库,或是需要访问门控的语料库,以及来自商业模型输出,其条款未明确允许重新发布。评分代码已发布,因此相同的协议可以在任何私有集上运行。
不列分数:四个已发布的复现,因为无法从它们发布的工件中执行——缺少分类头、不支持的架构、不完整的tokenizer。每个都带着失败原因和链接出现在榜单上,因为一个类别的真实状态包含那些无法运行的东西。
标记为待定:有一个条目,其重新测量结果与我们复现工具目前无法解释的早期值存在差异。在工具与上游实现匹配之前,它保留先前的数字并带有标记。用我们自己不可信的代码来降低竞争对手的分数不是修正。
7. 复现此事
该榜单报告每个条目的:API可用性、本地权重可用性、是否能在客户数据上重新训练、生成token数、每1000次调用成本以及按领域的AUC。
要添加一个系统,请在Space上发起讨论,附上链接和可运行的评分代码片段。无法从已发布工件执行的条目会列在“未能运行”下,而不是被省略。
排行榜:https://huggingface.co/spaces/mayafree/typed-decision-leaderboard
被测系统
Darwin-397B-ZTC · ZTC-Judge-27B · Jev · open-jev 4B · Patronus Lynx 8B · Laya · Vectara HHEM-2.1 · GPT-5.2 · GPT-4o-mini · Gemini 2.5 Flash-Lite · Qwen3-Next-80B