弥合区块链与现实的鸿沟:土豆、大语言模型与预言机的未来
支付保险理赔的智能合约需要确认航班是否真的取消,预测市场需要确认科罗拉多州博尔德是否降雨,借贷协议需要确认抵押品价值。在所有这些场景中,都需要将链下外部事实转换为区块链系统可用的结果,系统价值也取决于转换结果的可靠性。
区块链让这个问题变得格外突出。区块链的免信任程度完全由输入的信息决定,如果事实来自中心化机构,链上所有内容的去中心化都只是表面的,因为单一主体可以控制决定结果的输入。如果事实来自去中心化机制,又会出现去中心化场景下的经典激励问题,参与者持有的份额会催生影响报告结果的动机。问题核心是找到一种机制,既精准又能防操纵,将可靠信息带上链,这个问题比行业中常说的价格喂价要宽泛得多。
当前预言机的失效
目前预言机的失效在预测市场中最为明显,比如Polymarket依赖UMA的乐观预言机。UMA的设计允许任何人提交市场结果提案,也允许任何人提出争议,争议会按UMA代币持有量进行加权多数投票,系统诚实性的基础是至少一半投票份额希望得到真实结果。这个假设在实际中并不牢靠。
2025年4月,Polymarket开设了一个市场,赌乌克兰是否会与特朗普政府达成稀土矿协议。一名持有超过25% UMA治理代币的参与者,在没有任何证据证明协议存在的情况下,强行提前敲定了结果为“是”。该结果遭到争议后,代币加权争议投票仍然维持了这个虚假结果。《华尔街日报》调查发现,仅9个钱包就控制了Polymarket争议中近一半的UMA投票权,目前已有机构从小持有者手中收购委托代币,成为系统内最大投票方之一。这种“议会中的议会”,无论架构图怎么画,都不是去中心化预言机。
第二类操纵针对数据源而非投票过程。Polymarket曾开设过巴黎气温的预测市场,结果以机场单个传感器的读数为准。后来该传感器的读数一直远高于巴黎其他所有传感器,当时的报告显示,可能只是有人加热了这个传感器,甚至可能只用了一个吹风机,不需要发起治理攻击。如果预言机只读取单个物理设备,篡改真实信息的成本只不过是开车去一趟机场。
可信中立意味着什么
可信中立作为一项设计属性,要求预言机机制至少在某一层级独立于下游任务,以及它所服务的机制状态。解决降雨预测市场结果的中立裁决方,不能根据市场价格或参与者持有份额调整自身行为。
UMA从设计上就不符合这个要求。任何人都可以提交结果,提案人完全有可能在自己裁决的市场中持有头寸。在降雨市场中持有份额的人,无论实际天气如何,都有能力也有动机报告“降雨”。当裁决方可以从结果中获利,诚实报告只是期望,不是设计属性。目前已经上线的预言机系统中,大量都没能通过这项测试,因此才会出现上述各类操纵行为。
但仅靠中立还不够,土豆就是最好的例子。一颗土豆完全符合可信中立,它不在任何市场持有份额,也不会受任何因素影响结果,但它完全没用,因为它什么都不知道,它只是一颗土豆。预言机需要同时满足两项条件,这项研究对公理化处理这个问题,将独立性和对现实世界的准确性分开,探索哪些机制可以同时满足两项要求。
大语言模型作为近似中立报告者
被提示回答结果问题的大语言模型,可以作为近似可信中立的报告层。报告流程在市场存在之前就固定下来,这个近似结果就会越接近真实可信。固定模型权重只是其中一部分,提示词、部署方式、模型允许参考的信息范围——无论是仅使用提示词、指定网站还是检索语料库——都可以在任何市场开放、任何头寸建立之前就明确并公开。这些内容提前固定后,报告机制就不需要依赖市场头寸、价格或份额。流程中的任何不透明都会削弱中立性,因此完整规范和模型本身同样重要。
大语言模型预言机仍然可以被攻击,但攻击成本完全不同。篡改单个机场传感器只需要一个吹风机,而要污染训练数据,或是对提前固定、参考广泛网络信息的模型进行提示注入,需要的资源不在一个量级。和UMA不同,大语言模型方案不存在任何人都可以随意提交任意结果的免费先手。宽泛的信息来源本身不能保证鲁棒性,该框架将报告层信息来源的质量,视作和中立性、准确性并列的独立属性。
大语言模型不是绝对可靠的,它们会产生幻觉,总有一定概率报告出错。因此该设计在报告层之上保留了去中心化升级层:任何人都可以对模型报告提出争议,触发代币加权投票,只有投票结果超过设定阈值才会推翻原报告。如果原报告正确,攻击者需要达到阈值的投票权重才能推翻它,因此高阈值可以保护正确报告。如果原报告错误,诚实投票者也需要同样的权重才能修正结果,这意味着仅持有剩余份额的攻击者可以阻止修正。阈值设置过高,少数错误报告就会永久保留。
让这种权衡可行的核心就是报告层本身。由于报告层同时满足可信中立和足够准确性,错误报告很少出现,基础模型将阈值设置为1减去报告层错误率,平衡两种风险。在基础模型中,报告层正确率为95%时,可以设置约95%的争议阈值,远高于UMA依赖的简单多数。也可以增加中间层,比如多个大语言模型组成的面板,或是模型和人类混合面板,只有出现争议时才启用,承担额外成本。不同场景适合使用哪些层级,目前仍在研究中。
超越预测市场
预测市场结算自然是这项设计的首个应用场景,但预言机问题的范围远不止预测市场。已有案例显示,DeFi价格预言机被操纵,虚增抵押品价值、掏空借贷协议,这类场景也存在明确事实目标,但报告机制依然可能失效。普通协议是另一个应用场景,小额交易也需要在资金转移前验证外部条件,但为100美元的交易雇佣托管方并不现实。廉价的预言机执行协议可以更容易填补这类信任缺口,同样逻辑适用于所有金额太小、不值得雇佣外部第三方的交易。
更远来看,哪怕是有争议的体育赛事判罚也可以适用这个框架:原本需要委托给第三方、仅假设其中立而非机制本身内置中立性的重要裁决,也可以交由预部署多模态系统校验。这还属于推测,但它能说明,机制成型后,预言机可以覆盖的范围非常广。很多场景可能本质上就是预言机问题,只是一直没有合适的解决机制,未来工作的一部分就是逐个重新审视这些原有假设。
价格和气温通常可以对照事实结果验证。观点聚合和更精细的判断则不同,因为目标本身就可能存在争议。在这类场景中,预言机首先需要明确什么才算真实结果。升级机制依然有用:简单案例可以快速结算,真正有争议的案例再转入传统流程。目前这类问题还没有明确的通用解决方案。
此前预言机问题大多从区块链安全角度展开研究,从最贴合的博弈论和机制设计角度进行的研究要少得多。目前已经形成了一组工具,而非完整的工具盒:可信中立报告层、争议机制、阈值投票、模型面板,每一项的成本都适配不同场景。下一步工作是将工具和问题匹配,为每一类预言机问题确定中立性、准确性、升级流程和成本的合适组合。
本文来自Gensyn博客 (https://blog.gensyn.ai/credibly-neutral-ai-oracles/),由与@marynotlin和@gab_p_andrade的对话整理而成。你可以在此收听录音:https://youtu.be/3WIMNE33RGU