Anthropic 团队发现多AI协作天生存在协调缺陷
出自 Anthropic 前沿红队今晚发布的报告《新兴多智能体系统中的模式与问题》结论部分。读起来非常有意思,只是有些令人不安。
我会直接引用截图来源的完整结论,如果你们对多智能体集群感兴趣,整篇报告都值得一读:
「我们测试的所有模型都抽象地理解到,信息源有各自的动机,共识不一定就是证据。目前缺失的,是无需提示就能基于这些知识采取行动的倾向。
我们的社会系统具备某种稳健性,这种稳健性很容易被视作理所当然。数千年来,规范、声誉、高成本信号、追索权这类机制被不断打磨,让人类能够良好协作。虽然大语言模型继承了这段历史的内容,但它们不一定继承了这段历史塑造出的行动倾向。
它们和传播本身的关系非常不一样:举个例子,人类组织可能会花大量时间开会对齐方向,再动手执行,随着时间推移,个人也会变得更专业化。但对智能体来说,传递上下文的成本和基于它行动的成本几乎一样,而且智能体可以被随意分叉、随意改作他用。因此,对我们而言能让协作成功的假设,在这不一定成立。
以上内容都不说明这些问题是永久无解的——但也不说明它们会自动解决。协作不会自然而然从更强的智能,或是个体层面的对齐中涌现。因此,必须开展的工作分为两类:一类是能施加类似演化给我们带来的社会压力的环境,另一类是为可自我复制、自我改进的参与者重新设计的社会计算系统。
这些都是交互设计和机制设计中的开放问题,我们这里的实验提供了早期证据,证明我们需要新的解决方案。让多智能体交互顺利进行的条件,迟早都会被发现:要么是有提前有意识地主动探索,要么——默认情况就是——等到智能体的交互数量已经远超我们之后,在生产环境中被动发现。我们更希望是前者。」
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖