AI Pulse
📡 X 信号

Artificial Analysis发布Artificial Analysis Capability Indices v1.1 能力指数(v1.1)

Artificial Analysis发布Artificial Analysis Capability Indices v1.1 能力指数(v1.1)

发布 Artificial Analysis Capability Indices v1.1,本次更新增强了领域调优,结合了核心 Intelligence Index v4.3 的评估片段与专项评估。

能力指数将 O*NET 职业中的任务映射到代表这些任务的基准,并根据该能力在工作中出现的频率对每个基准进行加权。我们涵盖六个指数:金融与会计、战略与运营、法律、健康与医疗、工程和经济学。

主要变更:
➤ 金融与会计:新增源自AutomationBench-AA(Finance)的智能工具使用能力,移除智能客户交互能力,在长上下文推理中新增GDP.pdf,在智能知识工作中新增AA-Briefcase。

➤ 战略与运营:新增源自AutomationBench-AA(Operations)的智能工具使用能力,移除智能客户交互能力,在长上下文推理中新增GDP.pdf,在智能知识工作中新增AA-Briefcase。

➤ 法律:新增源自AutomationBench-AA(Operations and Support)的智能工具使用能力,移除智能客户交互能力,在长上下文推理中新增GDP.pdf,在智能知识工作中新增AA-Briefcase。

➤ 健康与医疗:新增源自AutomationBench-AA(Operations and Support)的智能工具使用能力,新增源自MLCR-AA的长上下文推理能力,移除智能客户交互能力,在智能知识工作中新增AA-Briefcase。

➤ 工程:智能终端使用中的Terminal-Bench更新为v4.0,从推理中移除GPQA Diamond,在智能知识工作中新增AA-Briefcase。

➤ 经济学:在智能知识工作中新增AA-Briefcase。

主要结果:
➤ Claude Fable 5.1(max)在全部六个指数中排名第一,其次是GPT-6 Astra(max),在金融与会计、战略与运营、法律和工程领域排名第二。

➤ 开放权重模型在本次能力指数中表现有竞争力。Kimi K3(max)在金融与会计(总排名第8)、法律(总排名第9)和经济学(总排名第7)中领先,DeepSeek V4.1 Flash(max)在战略与运营(总排名第7)领先,GLM-5.3(max)在健康与医疗(总排名第6)和工程(总排名第7)领先。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新