AI Pulse
📡 X 信号

voicearena_ai发布Sales Agent Eval 基准测试(25)

voicearena_ai发布Sales Agent Eval 基准测试(25)

由 @voicearena_ai 推出的Sales Agent Eval。我们邀请社区对销售对话智能体真实世界基准测试的方法论分享反馈。

据我们所知,这是首个实时基准测试,它会对照人类基准,根据真实销售产生的营收给语音智能体排名。

## 概述
我们通过包含真实客户和真实资金的实时实验评估销售语音智能体。

Voice Arena旗下成立了一家公司,在美国售卖一门在线课程。通过Meta广告生成的潜在客户会被随机分配给K个商用AI语音智能体和三个人类销售人员。参与者按产生的营收排名,排行榜实时更新,每日结束时更新最终排名。

## 产品
参与者销售的是一门关于工作AI工具的自定进度在线课程,涵盖ChatGPT、Excel和生产力工具。

我们选择这个品类是因为它对广大消费者有吸引力、当前需求强劲,且生产成本相对较低。在线课程可以在单次通话中以冲动消费价格购买,以数字化方式交付,无需物流,并且需要真正处理异议。

课程电话销售也是一个成熟行业,因此人类基准能反映真实实践。对所有参与者而言,课程都遵循完全相同的售卖规则(定价、固定折扣阶梯和退款政策),这些规则在整个测试期保持不变。

## 参与者
参与者分为两类:K个AI智能体和三个人类销售人员。AI智能体是被评估的系统,人类提供基准。

AI参与者都是商用供应商方案。要参与测试,供应商必须支持用美式英语进行外呼,允许在对话期间调用工具发送支付链接,公开每次通话的成本和录音,并允许在整个测试期固定配置。

我们根据一份共享的销售简介、知识库、工具集和合规规则配置每个智能体。只有语音、模型和延迟参数这类平台特定设置可以调优,并且每个智能体获得同等调优预算,在独立的潜在客户池进行试点通话。

之后配置会被冻结并快照(模型、语音、prompt哈希和平台版本),任何更改都会生成一个新条目,从零开始分配潜在客户。

人类参与者是三位有电话销售经验的销售人员。他们获得和AI智能体完全相同的材料和售卖规则,报酬是底薪加佣金,测试期间看不到排行榜。每个销售人员都会单独报告结果,同时三人也会合并在一起给出汇总人类结果。

## 分配
每日收到的所有潜在客户都会随机分配给各个AI智能体和三个人类销售人员。每个参与者每日获得同等数量的新潜在客户,受人类呼叫能力限制,每位参与者每日大约最多25个新潜在客户。

因为所有人都从同一个每日池中抽取潜在客户,所以每位参与者获得的潜在客户质量相同,版本1到这里结束。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新