AI Pulse
📡 X 信号

Artificial Analysis发布AI代理搜索API基准榜

Artificial Analysis发布AI代理搜索API基准榜

我们正式发布 Artificial Analysis Search Index,该基准测试用于测评不同搜索 API 提供商在被智能体调用时的质量、成本和速度表现。

本次我们初始纳入测试的提供商包括 Parallel、Exa、Firecrawl、You (dot) com、Tavily、Keeble,搜索是智能体最重要的工具之一。

不同搜索提供商在搜索方式、结果排序、结果打包上做出了不同选择,这些选择会改变模型读取的内容,以及模型的行为方式。

我们将基准测试覆盖范围拓展到了搜索 API,方便开发者根据实测的质量、成本和速度选择搜索提供商。

每个提供商的测试结果都是同一款模型搭配对应搜索 API 得到的,模型为 GPT-5.6 Luna (medium)。

模型运行在我们的开源智能体框架 Stirrup 中,框架自带搜索和抓取网页的工具——测试中仅更换搜索工具背后的搜索提供商。

发布之时,排行榜已经涵盖 7 家搜索提供商的 11 项测试结果,我们会持续拓展覆盖范围,力求为 AI 智能体场景下的搜索提供商提供最准确、最全面的基准测试。

Artificial Analysis Search Index 的核心特点:
➤ 三项等权重基准:Search Index 是以下三个测试的平均分:DeepSearchQA(900 道需要多次搜索的宽泛研究问题,按回答项计算 F1 分数打分)、BrowseComp(200 个需要多跳浏览的难事实样本)、以及 AA-Omniscience(600 道非公开问题,在 6 个领域中保持平衡)

➤ 相同智能体,不同搜索提供商:智能体有 25 轮操作来完成每项任务,它的网页搜索工具返回搜索提供商的原生响应载荷(内容模式统一为摘要),最多返回 10 条结果,并且过滤掉污染来源

➤ 纯模型基线:我们将搜索智能体的结果和同一模型不借助工具单次回答的结果对比,以此展示每家提供商能把模型表现提升多少,超出模型内部知识的水平

➤ 每项任务的成本和时间:我们汇总了模型推理和搜索两部分的时间与成本。这点非常关键——搜索 API 有着不同的成本和延迟结构,但如果搜索质量更高能帮助智能体减少轮次,就能节省成本更高的语言模型推理开销,抵消搜索本身的额外成本

核心结果:
➤ 发布时,Parallel、Exa 和 Firecrawl 的整体表现最强,Artificial Analysis Search Index 得分分别为 75、74 和 73
➤ 所有测试的搜索提供商都大幅提升了知识类基准的表现:纯模型基线的 Search Index 得分仅为 33,而接入搜索的提供商得分在 65 到 75 之间
➤ 高质量聚焦搜索结果能减少模型推理支出:Parallel Search (advanced) 单次任务的搜索成本高于 Parallel Search (basic),但单次任务总成本更低(分别为$0.084 和$0.11)。这种情况下,更高质量的结果将模型的 token 使用量削减了超过 40%,完全抵消了搜索成本的上涨,同时还拿到了更高的基准分数
➤ 单次搜索调用速度快不代表任务整体速度快:Para

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新