AI Pulse
📡 X 信号

AA-AnalystAgent测出闭源大模型稳定性排名有意外

AA-AnalystAgent测出闭源大模型稳定性排名有意外

我们正式发布 AA-AnalystAgent,这是我们针对真实世界电子表格与文档定量分析推出的全新智能体基准测试。

Claude Opus 5 以 54% 的成绩位居第一,其次是 GPT-5.5 的 50%,以及 Claude Fable 5 的 49%。

在真实分析师岗位中,专业判断与专业知识和原始定量能力同等重要。AA-AnalystAgent 正是对这项能力进行测试,要求模型解读信息来源,判断适用哪些例外情况与注意事项,并确定一套方法来成功完成任务。

由于将分析师任务交付给智能体不仅要求答案正确,还要求结果稳定,AA-AnalystAgent 会对每项任务运行五次,并将 pass^5 作为核心指标(我们称之为「全五次通过」)。pass^5 要求模型必须在五次独立尝试中每次都答对任务,才算通过。

AA-AnalystAgent 概览:
🔢 涵盖 14 个商业与科学领域的 80 道题目,包括医疗支出报告、贸易与商品统计、水文与气象数据、政府拨款、能源成本模型、金融模型、环境报告以及项目进度表

🧠 覆盖真实分析师工作的五大工作流分类:信息来源查找与诊断、筛选与汇总、比率/趋势/敏感性分析、损益建模,以及现金/资产负债表/估值建模

方法细节:
🤖 智能体框架:每项任务都由运行在我们开源的 Stirrup 参考框架中的智能体解决,自带代码执行、网络获取、图像查看和答案提交工具

📊 评分:每个模型每项任务运行五次,最终答案由相等性检查器与参考解决方案对比。共三项指标:pass^5、pass@1(平均通过率)、pass@5

🔒 题目集非公开,以降低数据污染风险。方法页面公开了来自加州医疗补助支出报告的两道样题,附带完整提示词与源材料

核心发现:
🥇 @AnthropicAI 的 Claude Opus 5(max)以 54% 位居第一,其次是 @OpenAI 的 GPT-5.5(xhigh)的 50%,以及 Claude Fable 5(max,Opus 4.8 回退)的 49%。Anthropic 占据前五名中的三个席位,前三名的得分差距仅为 80 道题目中的三道净差。

🎯 对排行榜头部来说,可靠性比原始能力的区分度更大:GPT-5.5(xhigh)的 pass@1 最高,但 Opus 5 在 pass^5 上领先,因为它能稳定重复自己做对的结果。

🔍 过早 commit 错误解读是模型最常见的失败方式,在我们分类的失败案例中占比 57%。

💰 相同分数对应的成本差异极大:Claude Sonnet 4.6 和 @Xiaomi 的 MiMo-V2.5-Pro 得分都是 20%,单题成本分别为 1.34 美元和 0.05 美元。

🥈 @Kimi_Moonshot 的 Kimi K3(max)是表现最好的开源权重模型,得分 39%,比闭源头部模型落后 15 个百分点。

AA-AnalystAgent 作为独立排行榜发布,不属于 Artificial Analysis Intelligence Index。更多详情见下文 👇

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新