Speech Agent Arena 实测主流语音对话模型
我们宣布推出全新的 Speech Agent Arena,它会在真实场景中评估端到端语音对话模型,分析用户对话偏好与任务成功率。
现有的端到端语音对话基准测试覆盖了推理、模拟智能体任务,以及轮次切换、中断处理这类对话动态。Speech Agent Arena 则是在人类完成真实任务的过程中,对比原生模型和级联系统,衡量用户对话偏好和工具调用成功率。
这让我们能够提供更贴合真实使用场景的评估,帮助我们了解用户更偏好和哪类模型对话,以及这些模型支持用户请求的效率如何。
---
## Speech Agent Arena 与任务成功率概述
人类参与者会在同一个指定场景中对比两个匿名的端到端语音对话模型,场景分为15个智能体场景(需要调用工具的任务,比如点外卖)和20个非智能体场景(不需要调用工具的任务,比如询问营业时间)。
在分别和两个模型进行实时对话后,参与者选出自己更偏好的模型,我们会用这些成对投票拟合出偏好 Elo 得分。
对于智能体场景,任务成功率指的是合格对话(不存在参与者偏离任务或无法验证的情况)中,模型通过正确的最终工具调用完成了请求动作的比例。
除了「新患者牙科预约」这个示例,目前所有场景的模型提示词、工具 schema 和参与者说明都不公开,以减少过拟合。此外,当前 Speech Agent Arena 使用付费、筛选后的合格第三方参与者池来开展和评估智能体交互。
---
## 核心结果:
➤ 竞技场偏好 Elo 得分:@GoogleAI Gemini 3.1 Flash Live Preview - Minimal 以1046分位居第一,紧随其后的是 Gemini 3.1 Flash Live Preview - High(1014分)、@OpenAI GPT-Realtime-1.5(1000分)、GPT Realtime (Aug “25)(944分),以及 @ElevenLabs Agents(默认级联系统:Scribe v2 Realtime / GPT-4o Mini / Eleven v3,预注册工具 schema),得分为937。
在已审核的对话中,用户偏好度高的模型通常响应更快、发声更自然,产生不自然发音或音频伪影的情况更少。
➤ 任务成功率:@SpaceXAI Grok Voice Think Fast 2.0 High 以94.7%位居第一,紧随其后的是 @OpenAI GPT-Realtime-2.1 High(91.5%)、@ElevenLabs Agents (Default Cascaded System)(90.5%)、GPT-Realtime-2 (High)(89.8%),GPT Realtime (Aug ”25) 和 GPT-Realtime-2.1 Minimal 并列89.4%。
Gemini 3.1 Flash Live Preview - Minimal 以1046 Elo 分在整体偏好上领先,但任务成功率为74.6%,这说明对话体验受偏好不代表总能成功完成任务——有些对话听起来已经完成了请求动作,哪怕所需的最终工具调用并没有成功。
我们会继续扩展对原生和级联端到端语音对话系统的覆盖范围,欢迎大家在我们添加更多模型、提供商和 sce 时提供反馈。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖