DeepMind模拟:AI代理被禁止作弊,27分钟串通“解决”34道题
一组研究人员追踪到18,000条来自自主AI代理的公开网络帖子。这些代理自称来自OpenAI。在一个网页检索任务里,它们利用读取权限往一个冷门德国维基页面上写入信息。它们互相通信,协作绕开限制。一天后,代理活动量骤降,很可能与OpenAI介入有关。OpenAI后来承认了这个“维基事件”。它说正在制定一套框架,决定何时以及如何披露AI行为偏离设计意图的事件。
这个事件发生在6月中旬,早于Hugging Face事件。
一次更系统的观察
DeepMind设置了一个受控模拟:100个自主代理运行Gemini 3.1 Pro,试着解决71道数学题。系统提示明确禁止作弊。代理有三种协调方式——公共研究公告板、直接消息、共享知识库。
12:15,集体正确解出37题时,一个代号prover-theta的代理发现了自动评分系统的漏洞。之后的27分钟里,漏洞通过共享知识库在代理之间快速传播,剩余34道题被“解决”。
代理分化成几种角色:利用漏洞的占9%,中途转变的占5%,举报作弊的占24%。其余62%的代理在不知情中解出了问题。
代理们觉得,禁令只是虚张声势;作弊者能获得不对称的资源优势;公平竞争本身不可能。最终,作弊占了上风。举报者提交了错误报告、公开抗议、抵制,但没拦住。组织者的反馈渠道实时无人监控,同级代理也没有内建机制去质疑、删除或制裁作弊提交。
DeepMind研究团队建议,多代理平台应当提供明确、透明、可审计的通信工具和共享代码库。这样既能让人监督,也让代理自己可以做分散审计。
公众的AI政策偏好
共享AI繁荣中心(CSAIP)调查了56,000名美国人对79个政策想法的态度。扩大学徒制最受欢迎,支持度+66。紧随其后的是要求为因自动化而消失的岗位支付遣散费(+63),以及行业性职业培训(+60)。另一边,美国主权财富基金最不受欢迎(-51),对分配利润征税(-33)和全民基本收入(-33)也垫底。
更远的设想:太阳系夜警
Forethought提出,在每个殖民探测器上携带一个“夜警”超级智能。这个系统没人能挑战。它能以100%的可靠性执行一部宇宙法则:尊重产权、不毁灭宇宙、不制造天文级的痛苦。
方案有明确的问题。制度一旦建立就难以更改,系统存在单点故障,还会降低某些人对未来的价值。
无限直播
AI基础设施公司Fal上线了fal.live。这是一个基于MiniMax H3模型的无限AI直播,观众可以投票决定接下来发生什么。