拆解两种多LLM架构,帮你省推理费用
LLM 路由 vs 智能体混合(Mixture of Agents),清晰讲解。当你搭建一个需要处理多样查询的系统时,业内会考虑两种架构模式。一种是为每个任务挑选最合适的模型,另一种则是让多个模型合作处理同一个任务。两者都用到多个大语言模型,但它们对这些模型的利用方式完全不同。
下面的示意图讲解了两种模式的工作原理。
在 LLM 路由中,意图分类器读取提示词,成本排序器会对延迟、token 价格和能力进行加权,因此只有一个模型会被调用,其余所有模型都保持空闲。
- 提示词会按领域和动作分类。
- 成本排序器会根据延迟和价格约束选出最合适的模型。
- 一个模型给出回复,其余模型永远不会接收到这个查询。
在智能体混合(Mixture of Agents, MoA)模式中,一组咨询模型各自独立分析查询,再把输出交给一个聚合器,聚合器会利用所有视角写出最终答案,并完成工具调用。咨询模型互相看不到对方的分析结果,只有聚合器能看到全部内容。
Nous Research 报告称,在 HermesBench 上,一个预配置的 MoA 得分比任一单独模型都高出约 6 分,幅度在 8% 到 11% 之间,该配置中没有任何单个模型能独自达到相同结果。
LLM 路由和 MoA 不是互相竞争的方案,而是解决不同问题的两种不同工具。路由为任务选对模型,而 MoA 组合多个模型,实现超越任何单个模型的性能。
纸面上来讲路由是两种模式中更简单的那个,但路由层的大部分工程工作和挑选最优模型无关。核心问题是缓存命中。一个智能体任务会依次调用多次,每次调用都会重发累计的上下文,如果模型已经见过这段上下文,提供商通常会给出约 90% 的折扣。但缓存是和特定模型绑定的。
如果路由器在任务中途切换模型,热缓存就会失效,完整上下文会按冷缓存价格重新计费。要解决这个问题,你需要按任务路由一次,而不是按调用路由一次。第一次调用正常路由,最优模型会被固定到这个会话中,任务内的所有调用都会发往同一个模型,因此缓存能保持热度。
除此之外,生产环境的路由层还需要在路由器前加护栏检查,路由模型必须足够小,让决策成本低于它路由出去的调用成本,还要有带降级 fallback 的成本策略,以备主模型故障。
所有这些功能都已经在 Plano 中实现了,这是一个开源代理,运行在智能体和模型提供商之间的本地。整个路由配置都写在一个 YAML 配置文件里,因此切换模型或修改策略永远不需要改动智能体代码。它还带一个仪表板,可以显示哪个模型回答了哪个请求,以及花费是多少。
仓库地址在这里:(别忘记点星标⭐)
我们把这套完整流程部署在了我们的 Hermes 智能体前面,账单直接降了一半,一行智能体代码都没改。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖