AI Pulse
📡 X 信号

Artificial Analysis推出端点准确度指数,帮开发者选API

我们正式发布 Artificial Analysis Endpoint Accuracy Index,用于衡量无服务器 API 端点保留了开放权重模型的多少准确率。我们目前已覆盖 GLM-5.2、gpt-oss-120b 和 DeepSeek V4 Pro,Kimi K3 即将上线。

服务提供商会为了优化速度和成本牺牲准确率。他们会量化权重、编写自定义内核、调整推理栈,有时甚至直接发布带缺陷的版本。我们现在把 Artificial Analysis Intelligence Index 的严谨方法引入端点测量,这样开发者就可以不只用价格和速度,而是基于准确率选择服务商。

我们将每个无服务器端点与我们自托管的官方权重参考部署做对比,100% 代表与参考结果匹配。当端点结果落在参考结果的 95% 置信区间内时,就认为该端点达到参考 parity。目前覆盖已对 GLM-5.2、gpt-oss-120b 和 DeepSeek V4 Pro 开放,Kimi K3 的准确率覆盖即将推出。

端点准确率指数的核心要素:
➤ 三个同等权重的领域:工具调用(BFCL-500,500 道题,重复 3 次)、科学推理(HLE-250,250 道题,重复 10 次)和长上下文召回(AA-LCR-25,25 道题,重复 10 次)。每个子集都会根据导致准确率差异的服务选项区分端点,重复次数设置保证得到紧凑的置信区间。

➤ 参考部署:我们按照发布实验室推荐的精度,自托管官方权重,遵循实验室的服务方案,并公开每个参考部署的完整命令。

➤ 推理参数:我们运行模型支持的最高推理模式,以及每个端点支持的最大输出长度和上下文窗口。

➤ 置信区间:奇偶检验同时考虑了端点运行和参考运行的不确定性。

➤ 滚动覆盖:当有足够多的服务商提供某模型时,我们就会将其纳入覆盖;当同系列有新版本替代旧版本时,旧模型会退出覆盖。服务商推出新端点后我们就会对其基准测试,并定期刷新所有已列出端点的数据。

➤ 时间标记:每个结果都标注了测量日期,多日基准测试标注为测试完成当日。

GLM-5.2 的核心结果:
➤ 输出 token 限制会降低准确率。严格的限制会在模型完成推理前切断响应,限制最严格的端点在 HLE-250 上的得分只有参考结果的一半甚至更低。

gpt-oss-120b 的核心结果:
➤ 工具调用处理能力拉开了端点差距。服务商解析和格式化工具调用的方式各不相同,部分端点在 BFCL-500 上得分仅 22%,而参考结果为 37%。

➤ 即使在相同请求设置下,服务配置也会改变模型的行为。部分端点在相同配置水平下生成的推理 token 少得多,受限的上下文窗口还会截断长上下文任务。

DeepSeek V4 Pro 的核心结果:
➤ DeepSeek V4 Pro 端点更符合参考结果。大多数端点达到了参考 parity,DeepSeek 自身的第一方端点得分s

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新