AI Pulse
📡 X 信号

Accio开源CommerceAgentBench 基准测试集(27 years)

Accio开源CommerceAgentBench 基准测试集(27 years)

大多数电商AI基准测试都测试模型能说什么。CommerceAgentBench测试智能体实际能做成什么事。

它的一个采购任务是把智能体放进有大约300封杂乱供应商邮件的收件箱里。同一个供应商可能用不同公司名称发邮件,因此智能体必须交叉核对地址、电话号码、银行信息和其他标识来确认供应商的真实身份。

它还必须在多次修改后重构出最新有效的报价,将六个Incoterms、四种货币和不同附加费标准化为可比的到岸成本,再按认证、最小起订量(MOQ)、付款条款和交货期进行筛选。

这个任务还有安全层。智能体必须检测BEC付款重定向风险,同时避免对合法邮件产生误报。

这个基准测试特别实用的一点是,评分不基于模型对自身操作的解释。得分取决于环境中留下的操作轨迹,包括是否应用了正确标签、是否保存了草稿、日历事件是否真实创建。

这更接近电商中真实的人机协作。人类仍负责关键决策,而AI智能体提供专业分析,在业务系统中执行部分工作流。

这个基准测试的覆盖范围也不止采购。在它的商品上架任务中,会提供一个旧商品页作为参考,但价格、品牌和型号全都是过时的。直接复制的话,发布出来的就是错误数据。

定价也不是简单计算。智能体必须在完成上架前,考虑供应商成本、标价、阶梯定价、MOQ、库存水平和国别价格差异。

而且这个基准测试的可信度是有支撑的。Accio背靠阿里巴巴27年的电商经验,拥有从1000万用户→160万对话→20万执行轨迹→2000个高价值工作流→107个真实世界基准任务的数据漏斗。

CommerceAgentBench现已开源。欢迎探索它、测试你的智能体,并贡献模拟环境:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新