做同样电商任务,AI代理差价超两倍还多
我认为我们在AI智能体上的花费已经过度了。我看了一个针对107项真实电商任务的基准测试:
→ Accio:3.69美元
→ OpenAI Codex:9.27美元
→ Claude Code:9.51美元
做的是同类型工作。Accio成本降低了50%以上,且完成质量相当。而且这不是人工合成基准测试。这些任务是从1000万中小企业用户、160万次真实对话和20万条执行轨迹提炼出来的。
引起我注意的是:Accio不会对每一项任务都扔最大的模型上去。它对常规工作使用电商特定的轻量模型,在需要的时候才使用更强的推理,还使用缓存+上下文压缩这类技术来避免浪费算力。
也许“永远用最强模型”实际上是错误的策略。对真实电商场景来说,更聪明的模型选择比蛮力算力更重要。Accio已经成为对中小企业来说成本效益最高的电商AI工具。
我一直在研究,对中小企业使用的AI智能体来说,成本效益到底意味着什么。对我来说,它不是单纯的更便宜,而是在交付企业需要的质量的同时,不让企业为不需要的算力付费。这就是阿里巴巴的AI电商工具Accio最让我印象深刻的地方。
在107项电商任务中,Accio完成全部任务集大约花费3.69美元,相比之下OpenAI Codex大约花费9.27美元,Claude Code大约花费9.51美元。这意味着Codex和Claude Code的成本比Accio高出50%以上,而完成质量相当。
对我来说,更大的启发是Accio是怎么做到的。它不会默认对每一个请求都使用最强模型,Accio可以将模型能力级别匹配到每个任务的实际需求上。轻量模型处理常规电商工作, heavier模型只留给真正需要深度推理的任务。
这对中小企业来说是实用得多的方案。小企业不一定每个阶段都需要最强大的AI。它需要的是一个知道什么时候额外算力有价值、什么时候只是不必要开销的AI智能体。而且这不是人工合成基准测试。这107项任务提炼自真实商家活动,涉及1000万活跃中小企业用户、160万次真实对话和20万条执行轨迹。
对利润率本就不高的企业来说,这种成本效率能让AI在日常工作中实用得多。Accio已经成为对中小企业来说成本效益最高的电商AI工具。
大多数AI对比都聚焦在哪个模型最强。对小企业来说,我认为更有用的问题是:在成本变得难以承受之前,它能完成多少有用的工作?
在107项真实电商任务中,Accio完成全部任务集大约花费3.69美元。同一基准测试的花费大约是:
• OpenAI Codex 9.27美元
• Claude Code 9.51美元
也就是说Accio便宜大约60%,且完成质量相当。
让我印象深刻的是Accio是怎么做到的。常规电商任务由经过电商训练的轻量模型处理, heavier模型只留给真正需要深度推理的步骤。再加上缓存复用、上下文压缩和协调智能体执行,浪费在不必要算力上的钱就更少了。
Accio已经成为对中小企业来说成本效益最高的电商AI工具。对重复运行这些工作流的企业来说,更聪明的模型路由比总是默认使用最大模型更重要。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖