AI Pulse

Arena推出结合事实准确性的AI模型排行榜

Arena推出结合事实准确性的AI模型排行榜

事实准确性一直是用户使用AI模型时最常遇到的问题之一。7月15日,Arena推出全新排行榜,不仅根据人类偏好排序,还会加入模型回答的事实准确性进行排名。

人类偏好从一开始就是Arena模型排名的核心依据,但模型质量的部分维度很难靠人工评估,事实准确性就是其中之一。人工核查事实速度慢、人力成本高,因此事实准确性并不总能体现在人类偏好投票中。新排行榜结合人类偏好与事实准确性两个互补维度生成排名,单一维度单独使用都只能反映部分情况。

此次新增的事实准确性排名首先应用在文本竞技场和搜索竞技场中。初始阶段,该排名会作为非默认选项,用户可在排行榜界面手动开启。

方法概述

首先,随机抽取对战样本进行事实准确性核查,之后从每个模型的回答中提取独立断言,筛选出可通过网络验证的内容。每个独立断言会由搜索代理系统验证,给出校准后的真实概率。

校准通过高质量已验证事实标注数据集对原始概率做后处理实现。随后对比两个回答的平均断言正确概率,平均真实性更高的模型赢得对战,优势越大胜利权重越高。

基于标注好的「事实对战」数据,研究团队用复合Bradley-Terry模型构建同时反映人类偏好与事实准确性的统一排行榜。该模型可调整事实标注与纯人类偏好标注的权重,默认事实权重为25%。

默认权重下,事实性差的模型基本无法登上榜首,全程不产生错误断言但对人类没有实际帮助的模型,也无法登顶。

研究发现

为支撑排名,团队标注了大语言模型在真实对话中产生的超过200万个断言,其中130多万个来自文本竞技场,70多万个来自搜索竞技场,覆盖约13万场文本竞技场对战和4万场搜索竞技场对战。

76%的文本竞技场对战中,至少有一个回答包含断言;搜索竞技场的这一比例为88%。文本竞技场中,模型平均每个回答产生5个断言,搜索竞技场接近10个。文本竞技场的边际真实断言率为87%,搜索竞技场为89%。

将每个模型的得分随事实权重变化绘图后可以看到,事实权重100%代表得分完全基于事实性,0%代表完全基于人类偏好。多数人类偏好得分靠前的模型,得分会随事实权重升高而下降。

OpenAI的GPT模型和SpaceXAI的Grok模型得分随事实权重升高上升或保持不变,Anthropic的Claude模型和Google的Gemini模型下降或保持不变,Meta的muse-spark-1.1和百度的ernie-5.1得分大幅下降。

分厂商来看,多数OpenAI模型得分随事实权重升高上升,Anthropic模型得分下降或持平。Anthropic模型整体更受人类偏好,OpenAI的最新模型整体事实性更高。

SpaceXAI的Grok-4-0709事实性表现扎实,但后续推出的Grok-4.1系列事实性大幅倒退,新版本Grok-4.20、Grok-4.3和Grok-4.5事实性有所回升,不过Grok-4.3的人类偏好得分很低。

Google模型事实性得分的波动小于OpenAI和SpaceXAI的模型。Gemini-2.5系列至今仍是事实性最高的模型,但Gemini整体事实性随时间推移有所下降。这些趋势在可使用搜索工具的搜索竞技场中保持一致。

多数开源模型的得分会在高事实权重下下降,mistral-medium-3.5和腾讯的huyuan-hy3-preview是例外。

几乎所有厂商的人类偏好得分都随时间推移上升,将纯事实性得分与旗舰模型发布时间做图后发现,只有OpenAI同时稳定提升事实性,SpaceXAI近期发布的模型也在提升事实性,这一趋势同样出现在搜索竞技场。

过去一年间,Google和Anthropic模型的事实性一直保持在相对稳定的水平,可使用搜索工具时尤其明显。Meta在muse-spark到muse-spark-1.1迭代中事实性大幅提升,但仍落后于其他头部闭源和开源厂商。

研究观察到人类偏好得分和事实性得分呈弱正相关,整体来看两个信号基本相互独立,这也是加入事实性信号作为必要评估子维度的原因。

分行业领域看平均断言正确率,不同领域模型事实性差异不大但符合直觉:模型在数学任务中事实性最高,在软件、医疗和科学任务中表现也不错,事实性最低的领域是法律与政务任务。

与风格偏好评估的区别

奖励风格本身没有错,和人类有效沟通是聊天模型的核心能力,格式与文笔都是评估的重要因素。深层隐患在于,更「有风格」的回答可能掩盖其中不可否认的错误。

新的事实性排行榜直接解决了这个问题:没有用风格替代不良表现,而是尝试直接测量和检测这类行为。事实性本身只是回答正确性的一个维度,但它是尤其重要、值得优先考量的维度。原因有两点:第一,人类越来越信任模型来回答自己知识领域之外的问题;第二,模型本身的事实核查能力已经越来越优于人类。

更详细的方法说明可查看官方博客:https://arena.ai/blog/factuality-in-arena

阅读原文
📚 相关主题 模型评估大语言模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新