AI Pulse

Arena排行榜推出AutoEval自动模型评估功能

Arena排行榜推出AutoEval自动模型评估功能

Arena的模型评估基于真实使用场景,但真实用户评估信号需要时间收集。7月30日,Arena推出AutoEval评分,在人工投票积累完成前,就能提供及时、校准后的真实任务模型评级。

AutoEval可在模型发布首日就生成评估信号,评分会明确标注为“AutoEval”,等到足够多人工投票收集完成后再更新结果。这能帮助社区更早筛选出适配自身任务的最优模型。

AutoEval的工作逻辑是,先训练一个学习了人类偏好的奖励模型(RM),由它自动生成投票,再将实时人工投票与奖励模型生成的代理投票结合。

相比等待人工投票,AutoEval能在1小时内生成排名,而非耗时数天。由于可以控制奖励模型投票的提示词,还能针对特定领域开展评估。它支持文本、视觉、图像生成、编码多个领域,可在纯人工投票无法快速扩量的场景下,补充快速、定向的自动化评估。

奖励模型的训练基于Arena的大规模人类偏好数据集,包含数百万条来自实时投票的 pairwise 对比数据,用来学习近似人类判断。这是一个逐点奖励模型,它会为每个提示词-响应对输出一个标量评分,训练后得到的评分排名会稳定符合人类偏好。

基于海量真实偏好数据训练的文本奖励模型,预测人类偏好的准确率比现有前沿大语言模型裁判(Gemini-3-flash/pro、GPT-5)高出8%到10%。在复杂prompt、模型实力接近的场景中,大语言模型裁判难以做出判断,而该奖励模型依然能匹配人类的真实偏好。

为在线服务训练奖励模型并非一次性任务,评估目标、数据和待评估模型都会持续变化,训练过程需要应对多个挑战。人类偏好会随使用习惯演变,需要在利用海量历史反馈的同时适配近期趋势。随着模型能力提升,质量差异变得更细微,奖励模型需要跟上能力演进、分辨细小差距。人工投票存在模糊性,需要对平局和校准做显式建模。多轮反馈存在上下文依赖,难以定位驱动偏好的具体行为。复杂任务需要混合信号,需要同时考量多个维度的表现。

处理完这些挑战后,当前奖励模型的准确率和可靠性已经满足实用需求。

AutoEval用奖励模型替代人工投票,之后沿用Arena原本的排名方法计算最终评分,具体分为四个步骤:从实时评估中采样真实的提示词-响应对;让目标模型针对同一提示词重新生成响应B;奖励模型为每个响应评分,对评分差应用softmax得到软概率投票;将目标模型的自动投票与其他模型的实时人工投票结合,得到最终Arena评分。

为验证准确性,研究团队用截至2026年4月底的数据训练奖励模型,对之后发布的新模型计算AutoEval评分。结果显示,AutoEval评分和实时人工评估评分的相关性极高,排名相关系数超过0.98,多数AutoEval评分都落在人工评分的置信区间内。

在超过40个测试模型的两两对比测试中,当两个模型真实性能差距超过10分时,AutoEval选出正确结果的准确率超过90%;差距超过15分时准确率达到100%。如果两个模型得分差距在5分以内,即使人工评估也会因为置信区间重叠无法区分优劣。

AutoEval不局限于文本领域,相同方法可应用于文本、视觉、图像生成、编码所有Arena板块。

以图像生成为例,团队基于超过300万偏好对训练了文生图奖励模型。该数据集来自真实用户提出的实际生成提示词,训练后的奖励模型不仅在自身数据分布上表现出色,在公开基准测试上也达到顶级水平。在Meta 2026年推出的多模态奖励基准MMRB2上,Arena-RM的表现优于其他所有逐点文生图奖励模型,比第二名高出超过9分。

Arena排行榜始终是公共资源,AutoEval让模型发布时就能立刻获得评分。目前它已经覆盖文本、视觉、图像、编码四个板块,可在数小时而非数天内完成新模型排名,聚焦社区关心的领域。后续团队会继续解决奖励建模的开放问题,将该方法扩展到更多模态,加入更多信号更好地匹配人类偏好。

阅读原文
📚 相关主题 模型评估开源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新