Agent Arena发布Agent能力排名榜单
智能体竞技场会对智能体跨领域解决问题的能力进行排名。美国实验室在所有领域都处于领先:
- @AnthropicAI 的模型占据了代码、工作和对话领域的第一名
- @OpenAI 的 GPT 6 Astra (Max) 在所有三个类别中都保持在前四名:代码第二,工作和对话都是第四
领先模型在各个类别中都保持强势,但排名发生了变化:
- Claude Fable 5.1 (Max) 领先于代码和工作领域,在对话中排名第二
- Claude Sonnet 5.5 (Max) 领先于对话领域,在代码中排名第四,在工作中排名第五
代码和工作排名的联动比对话更紧密:
- 例如 Gemini 4 Argon (High) 在代码中排名第 14,在工作中排名第 12,但在对话中排名第五,凸显了其在对话智能体任务中的独特优势
智能体竞技场基于模型相对于当前前沿的整体净改进,以及智能体任务特定类别的性能进行排名。这些排名基于智能体尝试解决来自全球人类提交的真实任务时收集的实时轨迹。
- 代码:编写和调试代码、工作流自动化以及数据分析
- 对话:创意写作、学习、个人问题、日常研究以及媒体生成
- 工作:文档、专业研究、规划以及专业写作
本图展示了截至 2026 年 10 月 5 日,入选模型在智能体竞技场各个类别中的对比情况。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖