AI Pulse

模型是大脑,框架是手脚,AI基准只测大脑

执行框架是模型调用外部工具、接收报错、管理进度的那套程序。模型好比大脑,框架是手脚。同一个大脑,配上不同的手脚,表现差别很大。把重试次数、工具报错、长时间运行的连贯性算进去,尤其明显。

运行时架构决定一次任务失败的方式,这个影响往往比模型本身的智力更大。工具调用超时,框架返回可解析的错误码,模型就能做局部修复。反过来,把原始堆栈直接倒给模型,上下文窗口被污染,下一步就容易乱跑。连接中断时,框架回头确认变更已经生效,代理就不会把同一件事做两遍。压缩已完成的多步操作时,连正在进行的任务状态一起清掉,长时间任务就没法连贯。这些细节,光靠模型本身弥补不了。

为什么还没有公平对比

SWE-bench、Terminal-Bench、OSWorld、BrowseComp 都在测不同维度的能力。它们的比较单位几乎都是模型本身。还没有一个公平对比的基准。OpenAI Agents、Anthropic 的 agent stack、AWS AgentCore、Google 的 agent 平台,LangGraph 这类本地方案,都没进过同一场测试。排行榜分数和你在对话框里实际感到的好用程度之间,隔着的那层框架仍是盲区。

一个有用的基准应该测任务成功率、每次成功任务的成本、实际用时。工具调用和重试次数、长时间任务的可靠性,都算进去。人工干预次数暂时算可选项,先记着。更有效的做法是控制变量:同一模型配不同框架,同一框架配不同模型。组合实验完整跑一轮,成本随模型和框架的数量成倍上涨。这可能是公开基准迟迟没出现的原因。

多数基准只看第一次尝试就成功的概率(pass@1)。多次运行的一致性(pass^k)和错误恢复效率,基本不测。第一次失败、第二次自我修复,这种算通过吗?真实使用里,错误恢复对体感的影响很大,但公开数据几乎是空的。

已经有人在补

零散尝试正在出现。Terminal-Bench 把 Harbor 开发的 Terminus、Claude Code、Codex 纳入测试列表。另一款叫 KIRA 的代理软件也兼容它。过去一周,有人自己写任务做自定义评估。有人发布的基准里,许多模型用 Pi 或 OpenCode 跑能通过,用 Hermes 跑却有 60% 失败。Hacker News 上也刚出现一个九种编码框架在笔记本电脑上的对比。

Sierra 的 tau-bench 开始测同一任务反复运行的一致性。专门注入工具故障、统计自我修复花了多少 token 和多少轮的基准,还没有出现。

该测什么

比任务失败率更值得盯的,是运行时被推进非预期状态的频率——做了件没人让它做的事。一个系统 20% 失败,但每次失败都明确报错。另一个 95% 成功,剩下 5% 在悄悄弄坏状态。前一个安全得多。

要看的还有:测试环境是真实命令行和文件系统,还是玩具沙箱。成功标准也有讲究:测试真通过,和代理自己说完成,是两回事。第一次工具失效后,需要人推几次。对抗或畸形输入下,非预期动作漏过了多少。这些比一个成功率数字更能说明生产就绪度。把“非预期行为”做成可比较的标准化测试,还没有答案。

人工干预会变成必填项

已经有公司把产品押在框架上。Fixa.dev 的创始人自己也说,这话有点自卖自夸。但产品做法很具体:真实云虚拟机、安装依赖、读真实报错,循环到检查通过。

那行标着“可选”的人工干预指标,会是这场竞赛的胜负手。一旦有平台靠“人工干预最少”胜出,那行数字会迅速变成必填项。

阅读原文
📚 相关主题 基准测试

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新