AI Pulse

13个大模型答案验证系统,一个只看格式的基线超过8个

13个大模型答案验证系统,一个只看格式的基线超过8个

哪个系统真正在验证LLM答案上表现最好——赢家能帮到你的agent吗?

每个答案验证供应商都会发布一个基准,而每个供应商都赢了各自的基准。我们在一个包含2,018条、标签完全相同的测试集上运行了十三个系统,发布了评分代码,并把结果并排放在一起。

类型化决策排行榜 → https://huggingface.co/spaces/mayafree/typed-decision-leaderboard

简而言之:只有三个系统超过0.70,最强的两个在统计上无法区分,而一个只看答案长度和格式的基线得分0.7036——高于十三个系统中的八个。

1. 类别

类型化决策模型返回结构化判定——布尔值、选项或序数分数——而不是自由文本。它只运行一次前向传播,生成零个token,这使得它在回答相同问题时比询问前沿模型便宜一到三个数量级,也更快。

TypeSafe AI的Jev以“System One模型”的名义创立了这一类别,围绕它形成了一个小型生态:开源复现、架构兼容的替代品(如Convai的Laya),以及相邻工具(如Patronus Lynx和Vectara HHEM)。

此前不存在的是一个所有系统都运行过的单一测试集。

2. 我们测量了什么

项目内容
任务给定一个问题和一个由某个模型编写的答案,评判该答案是否正确
条目2,018条 · 508条错误 · 5个领域 · 由4个不同模型生成的答案
指标AUC——错误答案在排序中沉到底部的程度。无阈值。0.5=抛硬币
事实性验证,不提供任何依据文档
聚合先按领域,再按规模加权
不确定性配对自举,3,000次重采样;区间包含零则不分排名

有两个设计选择值得明确说明,因为它们改变了数字的含义。

按领域聚合。将全部2,018条合并为一个AUC会得到系统性地更高的数字,因为不同领域的分数尺度不同,合并会奖励这种差异而非区分能力。在我们自己的系统上,合并读数为0.80,而按领域均值为0.73。我们报告的是较低、可复现的那个。

已发布的基线。表中有两行参考:一个基于答案的十个表面特征(长度、数字数量、格式)的逻辑回归模型,以及回答模型自己声称的置信度。它们的存在是为了让其他每个数字都有可对照的基准。

3. 结果

#系统供应商API本地AUC
1ZTC (397B)VIDRAFT0.7364
2JEVTypeSafe AI0.7350
3ZTC (27B)VIDRAFT0.7282
长度与格式基线参考0.7036
4open-jev 4Bpngwn0.6844
5Patronus Lynx 8BPatronus AI0.5179
6Laya-Typed-Decisions 421MConvai0.5144
模型自身声明的置信度参考0.5000
7Laya-Multilingual 322MConvai0.4796

参考——直接询问LLM(生成token,因此在轴之外,不参与排名):GPT-5.2 0.7148 · Qwen3-Next-80B 0.6366 · GPT-4o-mini 0.5878 · Gemini 2.5 Flash-Lite 0.5822。

不同轴:Vectara HHEM-2.1 0.4852。它判定一个答案是否来自所提供的文档;本测试集不提供任何文档。

表的顶端是平局

ZTC (397B) 以0.0014领先JEV。该差距的95%区间从−0.019到+0.032。按照榜单自己的规则——区间包含零则不产生排名——第一名和第二名无法区分,页面在表格上方而非脚注中说明了这一点。

4. 在误差棒范围内仍然成立的四个发现

4.1 表面基线是真正的门槛

仅凭答案长度和格式就达到0.7036。十三个被测系统中,八个低于它。低于这条线的验证器检测的不是正确性,而是形态。这个类别中任何省略该基线的排行榜都是在给参赛者贴金。

4.2 在这个轴上,更大并不更好

在同一家族内,397B模型整体上胜过27B——但在科学推理上,排名强烈反转:

科学推理 27B 0.7410 · 397B 0.6287

一个大了十四倍的模型得分低0.11。这与一个独立的观察一致:一个180B级别的模型得分0.7146,低于一个4B的0.7284。验证质量跟随的是表征几何,而不是参数数量。

4.3 “直接问前沿模型”既贵又只能排中游

GPT-5.2达到0.7148——低于两个ZTC配置,也低于JEV——同时生成token,并且每1000次调用大约花费0.55美元,而JEV为0.024美元。更小的评审模型更差:GPT-4o-mini 0.5878,Gemini 2.5 Flash-Lite 0.5822。

4.4 存在开源替代品,但差距是真实的

Laya在架构上是Jev最接近的开源类似物——非自回归、零生成token、Apache-2.0、每次调用约0.015秒,这大约比我们测量的托管API快140倍。它的速度主张成立。但它在本测试集上的准确率不成立:0.4796 / 0.5144,而公开声称在供应商自己的英文类型化决策基准上击败了Jev。两个数字都可能是真的——它们是不同的测试——这正是需要一个共享测试集的理由。

5. AUC不是你在部署时使用的数字

排名回答的是“哪个系统最擅长把正确答案和错误答案分开”。它并不回答“哪个系统能帮助我的agent”。我们直接测量了第二个问题。

设置:对于每一条,用验证器给答案打分;把得分最低的k%发送给更强模型重新回答;其余保留。所有分支共享同一个重新回答池,因此没有分支获得更幸运的重试。平局随机打破,并在200个种子上取平均。

在20%重试预算下,相对于74.83%的无门控基线:

门控最终准确率相对无门控
ZTC76.16%+1.34个百分点
JEV74.76%−0.07个百分点
随机74.58%−0.25个百分点

这两个系统的AUC相差0.0014,端到端agent准确率相差1.4个百分点。机制解释了这一点。重新回答是一把双刃剑:

错误答案被送回 → 38%被修复
正确答案被送回 → 30%被破坏

因此,门控的价值由精确率决定,而不是召回率。在20%预算下,JEV路由了403条,其中216条已经是正确的;ZTC路由了403条,其中195条已经是正确的。JEV修复的数量大致等于它破坏的数量。这种不对称在AUC列中是看不见的。

范围:一个升级目标,一个条目集。我们把它当作机制来报告,而不是普适常量。

6. 我们发布什么,以及我们不能发布什么

完整发布:每一个分数、每一个标签以及评分代码。

不重新分发:源条目。它们来自许可证禁止再分发或修改的语料库,或是需要访问门控的语料库,以及来自商业模型输出,其条款未明确允许重新发布。评分代码已发布,因此相同的协议可以在任何私有集上运行。

不列分数:四个已发布的复现,因为无法从它们发布的工件中执行——缺少分类头、不支持的架构、不完整的tokenizer。每个都带着失败原因和链接出现在榜单上,因为一个类别的真实状态包含那些无法运行的东西。

标记为待定:有一个条目,其重新测量结果与我们复现工具目前无法解释的早期值存在差异。在工具与上游实现匹配之前,它保留先前的数字并带有标记。用我们自己不可信的代码来降低竞争对手的分数不是修正。

7. 复现此事

该榜单报告每个条目的:API可用性、本地权重可用性、是否能在客户数据上重新训练、生成token数、每1000次调用成本以及按领域的AUC。

要添加一个系统,请在Space上发起讨论,附上链接和可运行的评分代码片段。无法从已发布工件执行的条目会列在“未能运行”下,而不是被省略。

排行榜:https://huggingface.co/spaces/mayafree/typed-decision-leaderboard

被测系统

Darwin-397B-ZTC · ZTC-Judge-27B · Jev · open-jev 4B · Patronus Lynx 8B · Laya · Vectara HHEM-2.1 · GPT-5.2 · GPT-4o-mini · Gemini 2.5 Flash-Lite · Qwen3-Next-80B

阅读原文
📚 相关主题 大语言模型测评

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新