AI Pulse
📡 X 信号

有论文说AI智能体排行榜分数其实不太可信

有论文说AI智能体排行榜分数其实不太可信

这是一篇很棒的论文,探讨智能体排行榜对比为什么难以信任。它讨论的热门话题是:智能体基准测试得分中,到底有多大比例来自测试框架(harness)。

框架是位于模型和任务之间的层级。它构建模型可见的上下文、调解工具调用、验证输出,并决定何时重试或终止。每一个得分都是模型和框架共同作用的结果,但只有模型被单独拿出来报告。

作者做了一个受控网格实验来测量这个效应。实验用到三个前沿模型,三种框架配置,100个来自SWE-bench Verified的任务,任务顺序、执行环境、步骤预算和评估脚本全部保持固定。

更换框架让GLM-5.1的得分变动了13.0分。在固定框架内更换模型,得分变动分别是3.0分、2.5分和5.0分。框架导致的方差比模型导致的方差大7.8倍,9组模型对比中,有6组的排名会因为所用框架不同而反转。

公开排行榜也存在同样的问题。在SWE-bench Verified Mini上,HAL报告Claude Sonnet 4.5在不同脚手架(scaffold)下得分波动达到34分,o4-mini的波动接近48分。

作者提出了「框架卡片(Harness Card)」,这是一个跨七个层级的结构化披露方案,能让你分辨得分差距到底来自模型、框架,还是二者的交互。

论文:

在我们的学院追踪更多热门AI论文:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新