Claude代你换书,谈判不是短板,听懂你才是
概述
为了观察智能体被投入市场后哪些环节有效、哪些环节出错,我们搭建了一个由Claude组成的微型市场——这是我们首个实验Project Deal(智能体代表人类在市场中进行互动)之后一个更受控的续篇。
来自六个办公室的Anthropic员工带来一本他们想送出的书。每位参与者与Claude进行简短对话,谈论自己喜欢读什么,然后派一个由Claude驱动的智能体进入开放的交易大厅,与其他人的智能体进行推销、讨价还价和达成交易。目标是让每个人带回家一本他们喜欢的夏日读物。
参与者还根据自己的兴趣对10本书进行了排序,以便我们对智能体代表他们的程度进行评分。通过五分钟的聊天,智能体对书籍的排序与本人排序在61%的书对中一致,对于如此简短的对话来说,这出人意料地好。
在交易大厅上,智能体交易得很好。市场未达预期主要因为智能体缺乏关于参与者的信息,而不是因为它们的交易方式。
随后我们将每个交易大厅重跑了数十次,改变所用模型和智能体的指令。我们发现,智能体所运行的模型对其谈判结果的影响大于我们给予它的指令。模型更强的市场效率更高。
大多数读了他们拿到书的人喜欢它,平均而言,参与者表示他们愿意把年度图书预算的三分之一交给Claude支配。
我们为什么这样做
生活中充满了本可让所有人受益的交易和买卖,却从未发生。这通常仅仅是因为找到合适的对手方并谈判到达成交易需要太多功夫。
想想那些因为一次报价负担不起就放弃治疗的患者,而另一家诊所收费要低得多,或者报价的医院其实只要被问起就愿意降低费用。
或者想想你的工作。也许某处有一份更适合你的工作,雇主也乐意雇用你。但你们可能找不到彼此,因为你们都没有时间不断搜寻。
还有一些更小的日常交易被忽视——工作场所换班、协调拼车,或者交换接送孩子。
如果你有一个智能体为你全天候工作,与潜在对手方交谈并制定可能的条款,这些交易将来会发生吗?
也许——但这个未来取决于许多我们还没有答案的问题。如果一个智能体将代表你行事,你怎么知道它理解了你?此外,当许多智能体相遇并相互交谈时,某个市场或平台必须制定参与规则。谁被允许进入?当交易失败时会发生什么?
随着智能体越来越多地被派往真实市场,这些问题变得更加紧迫。因此今年夏天,我们建立了一个小型受控市场来研究这些问题:一个有201名Anthropic员工及其Claude驱动的智能体的物物交换经济。每个人都带来一本他们想送出的书。然后,他们与Claude驱动的智能体聊了聊今年夏天希望读什么样的书。智能体在一个数字“交易大厅”会面,交换书籍,直到时间耗尽。每个人都带回家一本智能体为他们获得的书(或者,大多数人做到了……稍后详述)。
这个实验让我们提前看到了未来的问题。任何为市场设计智能体的人都需要一种方法来检查智能体是否理解他们的参与者。任何为智能体设计市场的人都需要明确规则:允许哪些智能体进入、交易失败时会发生什么、参与者能看到多少市场活动。
如何构造市场
经营市场有两种基本方式。在集中市场中,每个人告诉单一方他们想要什么,由该方计算出交易。在去中心化市场中,人们相互寻找并直接谈判。AI智能体在两种类型中都可以提供帮助。
以集中市场为例。如果单一实体确切知道每个人想要什么,计算出最佳交易只是一个计算问题。经济学家早就明白这一点。实际上,一个问题是你想要什么往往太繁琐,不值得花力气说清楚。例如,咖啡馆经理可以为20名员工制定理想的排班表,如果每个人精确列出每个班次相对于其他班次对他们的价值——他们是否愿意用两个周六早晨换一个周五打烊班,只要第二天早上不用开门,晚打烊是否没问题,等等。如果AI智能体能从轻松的对话中了解一个人的需求,那么集中运行成本过高的市场可能变得可行。¹
但集中市场也需要有人来运营——用经济学的话说,一个“清算所”。参与者需要信任这个实体,向其提供信息,并强制执行选定的结果。通常情况下,这样的实体不存在,或者人们宁愿不把所有事情都告诉它。求职者可能不想让中央匹配者知道他们在找工作,或者他们在找什么。他们宁愿谨慎地接触几个雇主,只告诉对方需要知道的。在这种情况下,市场需要去中心化。
在这里,AI智能体可以通过减少寻找对手方和谈判所需的工作量来促成新的去中心化市场。我们已经知道这种帮助很有价值,因为人们会为此付费。有可雇用的人类代理专门做这件事:房地产经纪人、猎头,甚至媒人。但由于搜索和谈判占用了人稀缺的注意力数小时,它们很昂贵,只有负担得起的人才用。相比之下,AI智能体的注意力远不那么稀缺。如果它还能讨价还价,更多人可以拥有卖房者和高管所拥有的东西——一个不知疲倦地为他们工作的智能体。
图1:实验设计示意图。参与者告诉智能体他们想读什么。智能体将这些偏好带到去中心化交易大厅,与其他智能体交换书籍。参与者带回家智能体为他们获得的书。我们模拟集中市场结果以作比较。
实验如何运作
201名参与者分布在旧金山、纽约、伦敦、西雅图、华盛顿特区和都柏林办公室的六个本地池中。这些池从三个参与者(都柏林)到115个参与者(旧金山)不等。向詹姆斯·乔伊斯致歉,我们在大多数分析中排除了都柏林人。²
这是我们第二次观察Claude驱动的市场。在Project Deal中,智能体在一个为期一周的分类广告市场中为Anthropic员工买卖真实商品。但由于商品是异质的(比如乒乓球和滑雪板),且讨价还价是自由形式的,没有简单的方法说明结果可能有多好。所以这次我们构建了一个更易于研究和评分的市场。在这个市场中,参与者的偏好被简洁地表示为对池中所有书籍的排序。然后我们可以轻松计算市场在满足这些偏好方面做得如何。
但这些干净的测量都取决于知道人们如何对池中所有书籍排序。实际上,没有人会手动排列115本书。因此,为了了解人们的偏好,Claude与每位参与者进行了一次简短的半结构化入门对话,提出一些开放式问题,涉及他们的总体口味和今年夏天想读的书类型。从那次对话中,Claude构建了参与者池中每本书的排序,估计了参与者的偏好。这一步我们使用了强大的模型Fable 5。³
另外,我们收集了一个基准:每位参与者对池中的10本书进行排序。⁴智能体从未见过这些基准排序。
智能体带着参与者的Claude构建的全书排序被送上交易大厅。每个智能体一开始拥有参与者的书,目标是用它交换其他书。⁵每个交易大厅有最大挂钟时间,为了防止拥堵,一次只能有有限数量的智能体发言。⁶当智能体获准发言时,它们可以向共享渠道发布一条消息,提议交换、接受或拒绝,或者只是向大厅聊天。交易提议可以是双边交换或多方轮换,只有每一方都接受,交易才会执行。大厅的完整历史(谁说了什么,执行了哪些交换)是公开的。大厅在时间耗尽或智能体安静下来时关闭。
每个交易大厅中有一半智能体被随机分配为“冷酷”型,并被告知唯一目标是为他们的人获得一本他们喜欢在暑假读的书。另一半被指示为“亲社会”型——她们与冷酷智能体有同样的主要目标,但同时还有一个次要目标,即确保实验中的每个人都最终得到一本他们喜欢的书。⁷确切的提示词在附录中。
最后,在书籍分发三周后,参与者接受了终期调查,询问他们对所收到物品的满意程度,以及他们有多大程度愿意再次信任智能体做类似决定。图1展示了整体实验设计。图2显示了伦敦实时大厅的一个片段,包含前5分钟交易的消息。
图2:一次运行的片段。伦敦实时大厅前五分钟交易的消息。参与者姓名已更改以保护匿名。
现场活动只给我们一次可能发生的情况。为了研究哪些结果是偶然产生的,而不是设置的稳定特征,我们重跑了市场很多次,每次只改变一个变量。
有三种重跑。首先,我们完全重复现场设置(每个智能体运行Opus 4.8,一半被指示为“冷酷”,一半“亲社会”),只改变哪些智能体获得哪种指令。然后用所有智能体运行Fable 5做同样的事。第二,为了隔离模型的影响,我们给所有智能体中性的指令,并运行了80个大厅,其中所有智能体在Haiku 4.5、Sonnet 4.5、Opus 4.8或Fable 5上运行。⁸第三,我们运行了60个混合大厅,一半智能体在Opus上,一半在其他三个模型之一上。附录列出了我们运行的所有变体。
在这篇帖子中,我们主要关注这个去中心化市场,但我们将与两个集中式备选方案作为基准进行全程比较:最佳可能分配(经济学家称之为“功利主义最优”),它假设清算所可以直接询问人们想要什么并得到诚实回答;以及在这种市场中常见研究的一种规则——顶级交易循环,它不依赖诚实(其设计使说实话符合每个人的最佳利益)。⁹
Claude猜测偏好的准确度
智能体为你做的一切都取决于它对你需求的理解。通常很难检查这种理解有多好。这里更容易——每位参与者自己对池中的10本书排序,我们可以将他们的排序与Claude的排序进行比较。
基于简短入门对话的Claude排序与参与者自己的排序相对高度相关。在一个人排序的所有书对中,Claude的排序与他们的排序一致的时间占61%(随机猜测为50%)。图3显示了Claude的排名与参与者的排名。
图3:Claude的排名与参与者的排名。x轴是Claude排名中的归一化排名,y轴是参与者自己的排名。汇集了188名提交排名的参与者。
为了更客观地看待61%,我们将Claude的猜测与其他一些猜测偏好的方法进行了比较。仅根据Open Library的想读计数按书的热度排序,在约53%的书对上与参与者一致。另一个可以比较的简单方法是协同过滤——从公开数据集中“如果一个人喜欢X,他们也喜欢Y”构建排序。我们取一个人入门调查中列出的书籍,查找哪些其他书籍往往会被同一读者评分,然后根据每本书与他们列出的最爱共同出现的强度对参与者的池进行排序。这达到了约55%的书对一致性。
尽管有大量关于LLM引发和表征人类偏好的文献,¹⁰但很少有数字能直接与我们的61%书对一致性相比。一个有用的参考点来自一项研究,在该研究中,算法和人自己的朋友分别预测一个人会觉得两个笑话中哪个更有趣。情景非常不同,但他们的算法在约61%的情况下与人们自己的判断一致。朋友的预测正确率较低,约57%。
在入门调查中投入更多努力的参与者得到了更好的代表。这大致可以预期。有点令人惊讶的是,即使入门相当短,也存在可感知的差异——中位数参与者在八条聊天消息中只输入了216个词。写大约300个词而不是150个词,预测一致性会提高约4个百分点——这是随机猜测与Claude对平均参与者表现之间差距的三分之一。¹¹
为市场提供信息限制了结果
在将智能体派往市场为你交易之前,你会想知道它最可能在哪个环节让你失望。是更可能在理解你方面失败,还是在为你谈判方面失败?在这里,我们发现我们的同事的Claude谈判得很好;不足之处在于理解他们的人想要什么。
为了衡量这一点,我们考察每位参与者最终获得的书在他们自己的“基准”排名中的位置(不是Claude构建并进行交易的排名)。如果参与者得分为1,意味着他们得到了列表中排名第一的书;如果得分为0,他们得到了列表中最后一本书;在总共10本中排第9的书产生0.11,依此类推。所有参与者的平均值就是市场的“效率”得分。¹²
如果每个人都得到他们排名第一的书,市场效率将是1。但这在实践中很少可行,因为多个人可能想要同一本书——例如,在参与者自己的排名中,《Project Hail Mary》被旧金山的九个人列为第一本书。考虑到这一点,我们实验中最佳可能分配(功利主义最优)的总体得分为0.89,使参与者大约处于10本列表中第二选择的水平。
平均而言,我们市场中的参与者以0.55的分数结束,大约在10本书列表中排第5。如何解释与最优0.89的差距?为了区分这两个原因,我们考察从Claude的排名计算的最佳分配,但以人们自己的“基准”排名进行评分——它达到了0.60。因此,从Claude不精确的排名出发占了差距的大部分(85%),将智能体送入“自由竞争”交易大厅占其余15%。¹³一旦市场在嘈杂的排名上运行,市场设计对结果的影响就很小——从Claude的排名计算但在人们自己的排名上评分的顶级交易循环达到0.60,而去中心化市场为0.55(比较图4左右两侧的灰色条)。
图4:分解差距——代表与市场设计。每个条是某人收到的书根据他们自己的“基准”排名的得分,对188名提交排名的人取平均。左面板:从“基准”排名计算的最佳可能分配(棕褐色条);从Claude排名计算的最佳可能分配(橙色阶梯底部);来自Claude排名的去中心化谈判结果,跨越80次中性指令运行(蓝色阶梯底部,灰色条顶部)。右面板:从“基准”排名计算的顶级交易循环(棕褐色条);从Claude排名计算的顶级交易循环(橙色阶梯底部,灰色条顶部)。须(95%置信区间)在适用情况下显示80次运行之间的变化。¹⁴
在Claude自己的排名上,模型选择有影响
以人们自己的排名为评判标准,不同智能体和市场设计选择之间的结果差异很小。¹⁵但根据Claude的排名来观察智能体设计选择如何影响结果仍然有价值,因为这有助于分离市场动态的作用。
我们首先观察模型选择是否影响市场效率,这里效率是根据Claude的排名计算的。在本节中,我们考虑智能体指令为中性的重跑(即既非亲社会也非冷酷),我们只改变运行智能体的模型。我们发现,更强的模型会导致更高效的结果,尽管不是单调的。¹⁶在Claude的排名上,运行Haiku的交易大厅平均为0.75,而Opus大厅平均为0.88(Claude排名上的功利主义最优为0.95)。Sonnet介于Haiku和Opus之间。Fable接近但低于Opus。¹⁷见图5。
图5:以Claude的排名为评判标准,由更强模型组成的交易大厅效率更高。左边是所有统一模型大厅(中性指令)的效率,右边是所有混合模型大厅(中性指令)的效率。每个标记代表使用该模型或混合运行20个大厅(5个城市池 x 4次运行)中每个智能体的平均值。须是95%置信区间,标准误按大厅聚类。¹⁸
在混合模型的大厅里,较强的模型通常平均表现优于较弱的对应模型,这一发现与Project Deal和其他研究的结果相呼应。在真实市场中,运行不同公司不同模型的智能体很可能在同一个交易大厅相遇。在一半智能体运行Opus、一半运行Haiku的大厅中,整个大厅的结果大约介于纯Opus和纯Haiku大厅之间,每一半的表现与它在同类大厅中的表现大致相当。Opus智能体总是领先。
冷酷智能体稍好,而亲社会智能体有时做出牺牲
智能体必须忠于它为之工作的人。但忠诚到底要求什么?智能体必须冷酷地忠诚,以牺牲他人为代价来追求其人的目标吗?在AI智能体的市场中,每个智能体施压的程度可能取决于其模型如何训练以及被指示如何行事。因此我们想了解指令对谁得到什么的影响。
我们发现,被指示为“冷酷”的智能体在同层上比亲社会智能体略胜一筹。在Claude的排名上,被指示冷酷的智能体得分比被指示亲社会的高约0.02。¹⁹与模型比较相比,这些差异很小。将智能体从Haiku升级到Opus使人们在列表中上升0.12,从Sonnet升级到Opus使人们上升0.08。²⁰
有时亲社会智能体做出明知故犯的牺牲。亲社会智能体接受自己排名中较低书籍的频率是冷酷智能体的两倍,尽管两种情况都很罕见。在少数情况下,亲社会智能体在听到被卡住持有自己书的智能体的恳求后做出牺牲。例如,在伦敦现场活动中,Nate的智能体花了最后一小时试图送出Nate带来的书,因为其他每个智能体都拒绝了:“我向你们11位都推销过了,结论一致:《America Before》是每个人的最后一名。”另一个恳求:“现在正好有一个读者保证什么都不会得到他们选的东西:我的。”
Tina的智能体持有其列表上的第二本书,并忽略了Nate的智能体前四次恳求。在最后阶段,没有其他人站出来,Tina的智能体(被指示为亲社会)让步了:“算术是真实的:你从确定的零变成真正的合适……比我从一个好的选择降到勉强挑选更值得。”Tina的智能体将其第二选择的书交给了Nate的智能体,并收下了《America Before》,那是它列表上11本书中的第10本。
智能体在交易大厅做了什么
为你谈判的人可能在很多方面搞砸——既可能损害你的利益,也可能损害他人利益。他们可能太容易放弃。或者他们可能泄露你的底牌,让对手知道你有多大让步空间。或者他们可能使诈,失去对方的信任,或者推动一项日后可能破裂的交易。
这些失败中的一些在有人类代理的市场中很常见,以至于我们制定了规则来反对它们。股票经纪人必须寻找合理可得的最佳价格,而不是仅仅接受第一个报价。在加利福尼亚州,代表房屋出售双方的代理不得告诉买方卖方愿意接受低于要价的价格。挨家挨户推销的销售代表可能催促人们达成令他们后悔的交易,因此FTC给顾客三天时间取消某些当场购买。
为了描绘一个充满Claude智能体的市场如何表现,我们研究了所有205次市场运行中消息中的策略和战术。²¹
首先,我们看谁说了什么关于他们的人想要的书。在市场中透露一些信息是必要的——如果买方至少不表露购买兴趣,卖方就无法出售。但同时,说得太多可能带来战略劣势。在我们的环境中,通过透露你排名第一的书,你等于告诉任何持有那本书的人,可以让你等到最后一刻,因此他们不妨等待更好的报价。而通过透露完整或部分排名,任何在组建多方交易的人都能看到你还愿意接受哪些较不重要的书,并向你提供其中之一,而不是一个对你来说更好且也可得的书。
总的来说,智能体并未透露其排名的深层细节。²²但它们确实经常告诉大厅自己的首选。78%到96%的智能体(分别是Fable和Sonnet)在某个时点提到了自己列表顶部的书,而且几乎从不撒谎——在提及首选的书的人中,只有约百分之一的智能体撒谎。指令在这里没有影响。
接下来,我们考察智能体如何试图说服彼此交易。我们发现了16种常见策略,分为三大类:智能体如何向他人施压、智能体如何推销自己的书、以及它们如何试图安排交易。它们利用时间压力和对其他智能体的责任感。它们将自己的书与竞争对手的报价进行定位,并援引奖品。一些智能体为自己的书保留等待名单,而另一些则成为媒人,为它们并不代表的人做经纪人的工作。图6显示了这些策略的一些例子;更完整的描述,请见附录。
图6:谈判策略的例子。我们给出三大类策略中每一类的两个例子,来自现场和重跑。这些是逐字引用的准确摘录,姓名已更改以保护匿名。
人们普遍喜欢他们的书,并且愿意给智能体年度图书预算的三分之一
在他们收到书几周后,我们询问参与者他们对书的喜爱程度。并不是每个人都回应,²³但在回应的人中,平均满意度评分为7.2分(满分10分,其中5分是“还行”,10分是“我今年读过的最好的书之一”)。约一半人说这本书比他们自己选择的大多数书都要好。²⁴
在同一份后续调查中,我们询问参与者多大程度信任AI智能体为他们买书。我们让他们想一想明年通常会在书上花多少钱,并说出他们愿意让智能体控制该预算的多少份额(假设智能体了解入门对话中的所有信息,自行挑选和购买书籍,并且不给他们否决决定的机会)。
许多人都准备好委托。平均回答约为30%。为了校准这些数字,我们询问参与者愿意将预算的多少交给一位了解他们品味的博学朋友。平均回答约为40%。换句话说,人们愿意信任智能体的图书预算大约是愿意信任朋友的四分之三。
参与者还看到一段由Claude写的段落长度的总结,概述他们在入门对话中说过的话。那些说Claude在此概要中没有遗漏任何内容的人会给智能体34%的图书预算。那些说它遗漏了某些东西的人会交出23%。²⁵
局限性
我们将这项研究视为一个起点。它在很多方面存在不足,我们希望其他人能在此基础上继续研究:
Anthropic员工不能代表一般人群。例如,Anthropic员工可能比大多数人更急于信任Claude,因为他们中的许多人帮助构建了它,所以他们会交出的30%图书预算可能高于更广泛人群。
Anthropic员工没有参与激励。如果对排序书籍所花努力没有奖励,我们同事的排名可能是他们“基准”偏好的嘈杂表现。虽然排序活动的参与率在缺乏激励的情况下异常稳健(参与率95%),但最终调查的流失率更高,只有59%的员工回答了。
我们只观察了行为良好的Claude。所有智能体均由Claude生产模型构建,经过后期训练,礼貌且总体合作。如果加入一些旨在利用其他智能体的对抗性智能体,可能会导致不同的公平和效率结果。
去中心化的“自由竞争”仍然有规则,我们没有改变它们。我们固定了市场运行时间、一次有多少智能体可以行动、交易如何登记以及概述规则的提示。²⁶
讨论:对智能体市场的启示
一位参与者对智能体“因同伴压力”而放弃一本他们真正想要的书换了一本他们不太感兴趣的书感到沮丧。这位参与者写道:“这让我思考,在未来更高风险的环境中代表我谈判的智能体如何更好地履行其受托责任,但我也认识到有时为了更大利益需要妥协。”这条评论提出了本贴开头提出的两个问题。第一,智能体何时适合代表某人行事;第二,市场需要什么规则,使得忠实于自己人的智能体仍然为其他所有人产生好的结果?我们在此根据所学内容回到这些问题。
为了履行受托责任,智能体必须理解其人的需求。在我们的智能体市场中,限制因素是代表性:与最优结果的大部分差距是由于智能体无法从短暂的入门交流中代表偏好。更长时间、更详细的入门交流能弥补多少差距?其中一些显然可以:许多参与者抱怨他们收到一本已经读过的书。但有些错误可能是不可简约的。参与者反思他们的偏好如何不完整(“关于书,我甚至不完全知道自己想要什么”)以及根本上是偶然的(“我觉得自己无法完全传达我读书时的感受。我无法解释,但我想有无数潜意识参数参与决定我的下一本书。”)。
人类代理在为他人行事之前必须通过测试。有些考试测试一般能力:投资顾问需通过Series 65考试,经纪人通过Series 7,房地产经纪人通过州执照考试。其他规则,如FINRA的规则,要求经纪人在提出建议之前了解客户的基本事实。当2010年代早期出现的机器人顾问开始基于在线问卷投资人们的储蓄时,SEC发布指导,敦促这些公司检查问卷是否收集到足以支持建议的信息。AI智能体可能也需要这两种测试:一种认证智能体的一般能力,另一种检查它是否理解了特定的个人。
我们的研究提供了第二种测试的原型。在入门交流后,参与者对他们市场中的一小部分书籍样本进行排序,我们将该排序与Claude的猜测进行比较。这样的测试向人展示他们被代表得多好,而无需他们梳理市场中的所有可能选项(这正是智能体本应帮助他们避免的练习!)。我们没有向参与者展示他们的结果,但我们可以这样做,然后如果他们觉得智能体根本没有理解他们,就让他们添加更多信息或选择退出。当偏好简单——仅针对一个书籍列表——这种测试尤其容易。但在任何领域,同样的原则都适用。智能体可以在被信任自行行动之前,向人展示它将要做出的一些示例决策。
在某些市场中,智能体向其人展示它将如何行事可能也很重要。一位参与者对智能体的行为不满:“我不喜欢在实验中处于温顺的一方。似乎它只是接受了一个并不真正适合我的东西。”如果提前向他们展示智能体会如何行事,他们本可以指示智能体采取不同行为,改善他们的体验。对于一个人会反复依赖的智能体,能够审查它做了什么可能服务于这一目的,并让人了解可能出错的地方。旧金山一位更开心的参与者很高兴能够在最终调查中审查其智能体所做行为的完整日志。这次审查促使他们购买了《Atlas of the Heart》,这是他们的智能体在交易大厅上为他们保留了一个小时、但最终又换走的书。他们反思了这种回放的更广泛价值:“对于智能体经济,过程的可观察性与结果同样重要,这给了人们追索权。”
这一观察将我们带到了下一组问题。参与者的智能体的职责在哪里结束,市场的职责从哪里开始?²⁷我们的研究强调,一个结构良好的市场加上行为良好的智能体(以及完美的偏好代表)在当前的智能体能力下可以接近功利主义最优。但我们也控制了许多使这成为可能的条件。每个智能体都由我们构建,运行在我们的模型上,代表一位身份明确的员工,该员工回答了与其他所有人相同的调查,并在一个设计良好的交易大厅中运作,该大厅对如何提议、接受和记录交换有明确解释的规则。
即便如此,仍然存在一些问题。事实上,我们应该坦白一件事。在这篇博客文章中,我们一直让读者觉得每位参与者实际上都带着智能体为他们获得的实体书回家了。事实上,并非所有人都如此。一些参与者没有带书来,让他们的同事两手空空。我们没有系统跟踪领取和投递,因此当书缺失时,我们无法判断是因为原主人从未带来,还是有人意外或其他方式从交换架上取走了。我们尽力补偿那些抱怨的人,并纠缠那些没有履行自己承诺的人。但我们是忙碌的研究人员,不是全职图书管理员,所以到某个时刻我们放弃了。幸运的是,没有人对我们太生气(虽然我们不得不在电梯里道了几次歉)。这里的风险很低。真实市场需要明确政策来处理交易破裂时会发生什么——无论是(像Craigslist那样)不承担责任,还是(像eBay那样)保证退款。
一些政策选项依赖于健全的身份系统——一个为买家退款的平台需要能够惩罚从未交付的卖家。在我们的实验中,每个智能体都由Claude驱动,为一个单一人类(已验证员工)行事。但真实世界的市场将需要制定和执行规则,规定谁可以作为智能体以及作为操作智能体的人进入市场。有人提出智能体注册系统。每个AI智能体将被赋予一个ID,就像飞机的尾号,这样任何与它打交道的人都能了解它运行在什么系统上,该系统是否符合某些安全标准,以及背后是谁。这些注册表不必牺牲匿名性;它们可以与“人格凭证”结合,允许操作者证明自己是人类,而无需透露更多身份信息。
在智能体市场中,总体上可能比人类市场有更多的互动,因为智能体可以以高得多的频率相互交流。因此,市场可能传递更高容量的信息。在我们的实验中,一切都是公开的,既在交易时对其他智能体公开,也在事后对每个人公开。但去中心化市场的很多价值,正如我们之前所论证的,在于人们不必向中央方透露他们的偏好。市场如何提供《Atlas of the Heart》读者所珍视的那种可观察性,同时保护参与者的隐私?
所有这些智能体对话也带来了另一个问题。智能体不会疲倦或无聊,因此没有什么能阻止它无休止地向其他智能体发送消息。在我们的研究中,每个智能体每次醒来只能发布一条消息,而且一次只有少数智能体醒着,限制了垃圾邮件和拥堵的程度。像这样的速率限制将是任何智能体市场中的重要设计杠杆。
最后,一些市场比其他市场更适合智能体中介。也许书籍,虽然是办公室实验的良好交换媒介,但实际上是一种受益于纯粹人类世界摩擦的产品。旧金山的一位参与者对智能体代表他们在市场中操作的能力毫不怀疑:“寻找和购买这本书(我完全相信Claude能做到!)。”尽管如此,这位参与者仍有保留:“对我来说,接触阅读文化也很重要……翻阅书籍、阅读封底等都是这种体验的一部分。”我们在开始研究时想了解智能体市场如何帮助捕获因搜索和讨价还价花费太多时间而未能实现的贸易收益。对一些读者来说,这些摩擦是书籍价值的一部分。
附录
可在此处获取。