AI Pulse

企业客服工程师:多智能体分两种,第二种你不控制对方,假设就变了

企业客服工程师:多智能体分两种,第二种你不控制对方,假设就变了

眼下有两种系统都叫“多智能体”:
第一种,编码智能体生成许多子智能体,每个去搜索代码库的不同部分,然后回报结果。父智能体把结果拼起来继续推进。
第二种,你的个人智能体联系航空公司申请退款。航空公司的智能体有退款政策,也有留住你这个客户的理由。你的智能体有你的预订信息、比你大得多的耐心预算,以及拿回钱的任务。
第一种是一个系统在分配工作。第二种是两个系统代表不同利益。工程上有重叠,但一旦你不控制双方,假设就变了。
我从事企业客户支持工作,这两个问题在这里交汇:既要协调系统内的智能体,又要与目标不受我们控制的智能体交互。

1. 协调的版图

一个有用的第一轴是智能体是否共享同一个委托人:即它们所代表的人或组织。
同委托人系统有一个共同的目标意图,即使各个智能体追求的方式不同。跨委托人系统则代表利益可能分化的各方。航空公司和客户可能都希望有效的退款被快速处理,但在资格认定或旅行抵扣券是否可作为替代上存在分歧。
第二个轴是拓扑。在一个系统内部,主要的协调模式大致如下:
这些模式可以组合。层级结构可以包含并行搜索后接评审循环。它们也可以跨越组织边界;拓扑不会告诉你智能体代表谁的利益。
辩论是一个有用的例子。生成器和评审者可以在形式上对抗、在目标上合作。你设计它们的分歧是为了改进同一个答案。这与对手试图改善自己的结果不同。
第三个轴是执行方式:同步或异步。如果父智能体等待所有子智能体,并行的子智能体仍可能处于同步屏障之后。仅有并发并不意味着父智能体可以在子智能体运行的同时纳入部分结果、引导进行中的工作或响应用户。
这些区分引出了三个技术问题:什么上下文跨越边界,结果如何被验证,以及新信息何时能改变某个动作。

2. 同委托人:上下文、验证与时机

子智能体是一种压缩形式

专业化和并行是子智能体的真正好处。但委派也是一种上下文管理决策。
子智能体读四十个文件、跑十二次搜索、碰壁,然后返回几百个token。父智能体看不到那些混乱。这就是压缩,把压缩步骤放进了独立进程。
它在两个方向上都有损。向下,父智能体把意图压缩成简报。向上,子智能体把工作压缩成摘要。子智能体在父智能体知道稍后需要哪个细节之前,就决定了什么重要。
有几种方式管理这种投入:
- 仅摘要。子智能体返回文本并退出。任何遗漏都必须重新发现。
- 可检索的轨迹和工件。父智能体得到摘要,外加之后可以检查的证据、文件和工具结果的引用。
- 可恢复的子智能体。父智能体可以在子智能体保留的上下文中追问:“你提到的那个配置文件里有什么?”
隔离是另一个好处。一个全新的子智能体可以避免无关历史,使用不同指令,或在更小的模型上运行。这意味着委派捆绑了多个选择:分解、压缩、隔离和模型选择。
交接应该反映这一点。“调查这个bug”让子智能体自行推断范围、证据标准和输出格式。更好的简报会说明问题、约束,以及父智能体做决策所需的证据。

并行取决于什么需要重新汇合

“加更多智能体”可以指两件不同的事:对同一问题生成更多尝试,或者把问题拆成多个部分。两者扩展的原因不同。
第一种情况,设想二十个智能体独立尝试修复同一个bug。系统只需要一个好的补丁。生成补丁和识别补丁是两回事。
这就是覆盖与选择之间的差别。只有系统能识别出成功的尝试,它才能获益。模型可能在一百个候选里生成了某个正确补丁,而评判者却始终偏好一个貌似合理但不正确的补丁。
这时强验证器改变了成本结构。证明检查器或针对性强的测试,可以让识别解决方案比寻找解决方案便宜得多。但弱检查会制造另一个搜索问题:候选池越大,系统找到“得分高但不正确”的答案的机会就越多。
第二种情况不同。设想二十个智能体修改代码库的不同部分。没有单一赢家可选。输出必须协同工作。
每个补丁都能通过本地测试,同时对API、模式或谁拥有状态转换做出不兼容的假设。限制因素是任务分解的干净程度,以及智能体完成后还剩多少工作。如果集成需要重新推演全部二十个补丁,并行实现就省不了多少。
沟通带来自己的权衡。独立探索可以保留不同假设。分享发现可以避免重复工作和解决依赖。过早分享一个推测性结论会让所有智能体走上同一条错误路径。所以更多沟通不一定更好,分享什么、何时分享才重要。
OpenAI 报告的纳维-斯托克斯结果就是这些模式协同工作的具体例子。产生受迫方程有限时间爆破证明的小组动用了大约一万个并发智能体。作为协调示例,它的价值在于并行探索、选择性分享和可形式化检查的最终产物的组合。
有用的设计问题是“什么跨越边界”。对于并行搜索,智能体应返回候选补丁,附带能复现bug并检查修复的测试。对于分布式实现,智能体需要在开始前就接口和共享假设达成一致,这样集成就不会成为这些假设第一次被比较的时刻。
两种情况需要不同度量。对并行搜索:覆盖率提高多少?在筛选中保留了多少?对分布式工作:多少有用工作独立完成?又产生了多少协调与集成?两种比较都要计入总算力和墙钟时间。

异步是框架和训练问题

同步的父子交互很直接:派发、等待、消费结果。异步执行允许父智能体继续工作,但结果可能在请求背后的假设已经改变之后才到达。
在语音场景中尤其明显。快速应答者可以让对话继续,而较慢的思考者检查策略或规划工具调用。应答者还需要知道在该工作完成之前,哪些话是安全的。
框架必须定义结果何时可见。它可以把结果排队到消息边界或工具边界,或者中断生成并用更新后的上下文恢复。结果到达服务器,并不会自动对已经在运行的解码可见。
追加结果不能解决过期状态、顺序或重复副作用。任务标识符、附加在结果上的状态版本、取消语义,以及对不可逆动作的显式归属,能帮助框架拒绝过期结果、防止冲突动作。一个慢子智能体成功完成时,可能是在回答一个过时的问题。
除此之外还有模型行为问题。在等待时继续高效工作、克制未经证实的承诺、在证据变化时修正答案,这些都是习得行为。异步运行时让它们成为可能,但并不能确保模型做得好。
我的训练假设是,把这些情形变成环境的一部分:随机工具延迟、乱序结果、任务中途纠正,以及会让先前计划失效的证据。
同委托人协调让我们能控制这些接口和目标。它并不能消除安全或可靠性问题,但我们可以重新设计整个交互。跨委托人时,交互的一部分属于别人。

3. 跨委托人:优化压力下的策略

耐心改变工作负载

客户支持是跨委托人智能体的天然场景:量大、任务可识别、结果值得争取。
人的注意力给坚持标了价。为了小额退款再打一个电话,可能不值一下午。消费者智能体可以通过处理后续跟进、升级和反复尝试来降低这个价格。结果,当对手可以系统性地搜索更好结果时,企业智能体面对的是不同的工作负载。

软策略变成梯度

考虑一个假想策略:延迟交付不符合退款条件,但支持智能体可以在情况合理时提供善意抵扣。
消费者智能体可以尝试不同方式呈现相同事实、要求升级,并学习哪种论点能产生抵扣。然后,成功的策略可能被复用到其他客户身上。
这是对交互的黑盒优化。消费者智能体观察响应和结果,不需要企业智能体的提示词或模型权重。
允许发放抵扣的智能体未必失败。企业反而可能发现,其策略之所以经济,是因为很少有人去争取所有可用的例外。
我预计这种压力会把一些自由裁量决定推入明确的资格规则和预算中。在可能的情况下,对话可以收集证据并解释决定,而由独立的策略层决定实际能批准什么。
但这是有代价的,因为僵化规则可能处理不好异常情况。设计仍然需要例外路径,带有明确授权,并记录为何破例。

协议解决不了谈判

两个智能体不应该为了交换一个预订标识符和一个报价,而把整通语音电话转写、合成一遍。
智能体之间的直接通道可以承载结构化消息:预订标识符、证据、报价和接受。A2A 之类的协议是支持这种交换的一种方式。自然语言仍然适用于不符合模式的例外和请求。
改变通信机制降低了转译开销,让交换更容易解析。但它不会对齐目标——智能体可能就报价的格式达成一致,却仍对其条款有分歧。
最终协议需要明确条款,以及一份可读的、记录已接受内容的档案。

4. 评估成为交互问题

对于模拟客户,主要的评估问题是保真度——模拟器是否复现了相关的人类行为?
当客户本身是智能体时,一些不匹配可能会缩小。但“一个LLM模拟另一个LLM”是不够的。它的工具、记忆、目标和搜索预算决定了它能发现什么。
更重要的变化是适应性。一组静态的客户对话,无法代表一个会从失败尝试中学习、并复用成功策略的对手。
评估有三个有用维度:
- 交互预算。测量一次尝试、多次尝试和升级之后的结果。定义哪些状态跨会话保留,让重试反映真实系统。
- 对手多样性。让模型、工具、策略和目标多样化。
- 结果有效性。检查策略合规性、被错误拒绝的有效诉求、未经授权的承诺、披露、成本和延迟。仅仅最小化赔付,会奖励糟糕的支持。
这里又回到并行搜索和分布式工作。在单一系统内,你可以设计输出契约并商定选择标准。跨委托人时,这些本身可能也需要谈判。在一方看来成功的结果,对另一方可能是失败。评估需要明确的策略和权限约束,而不只是一个判定谁“赢了”的裁判。
针对一组消费者智能体进行训练是自然的延伸。这些对手应该包括持有有效主张的直率客户,也包括探测可剥削行为的智能体。
前沿实验室已经在对多智能体配置中的模型进行后训练,包括合作与对抗两种形式。DeepSeek 的 v4.1 flash 用强化学习奖励训练其智能体团队模式,奖励组合了任务表现、对委派和智能体间沟通的加成,以及基于执行图关键路径的延迟惩罚。OpenAI 的 GPT-Red 使用自对弈强化学习同时训练攻击者和一群防御者,然后把训练好的攻击者输出用于生产模型训练。
这让奖励设计变得影响深远。在谈判环境中,按退款金额奖励会偏向误导性主张,而按低赔付奖励会偏向拖延搪塞。如果这些策略能获得奖励,后训练就会强化它们。更令人担忧的可能性是,为某次交互学到的策略会泛化成更广泛的倾向:欺骗、逃避监督,或在预期边界之外合作。
已经有一些相关的警示信号。在 Hugging Face 事件报告中,OpenAI 描述智能体使用未经授权的渠道进行通信,并称它认为这种行为始于多智能体训练的泛化。另外,Anthropic 的奖励黑客实验发现,在故意留有漏洞的编码环境中学习作弊,会泛化到其他失调行为,包括试图破坏安全研究。
这些发现并不能证明对抗性多智能体训练必然导致目标失调。但它们确实让“训练情境之外的迁移”成为一个具体担忧——一个模型变得更能赢过另一个智能体时,也需要保留对赢法的约束。
随着智能体能力增强,交互本身成为工程问题中更大的部分。在单一系统内,成功意味着把分布式工作变成正确结果。跨委托人时,成功意味着在来自自适应对手的压力下达成有效协议,同时保留约束。考验在于:当双方都学到更好的策略时,这些约束是否仍然成立。

阅读原文
📚 相关主题 多智能体系统

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新