AI能操作实验台,通过率仍然未过半
欢迎阅读Import AI,一份关于人工智能研究的通讯。Import AI依靠arXiv、卡布奇诺咖啡和读者的反馈运行。如果您愿意支持,请订阅。
何时应使用群体智能?当您赶时间时:
...群体扩展如何运作?...
Toby Ord发表了一篇简短而精辟的文章,探讨如何从AI能力发展的角度看待群体智能。“将AI群体视为一种新型的推理扩展方式是个不错的视角,”他写道。他进行了一些分析,主要结论是,群体智能在您赶时间时非常有用,因为尽管相对于单个智能体,它们需要消耗大量令牌,但其并行化特性使您能在更短的实际时间内完成任务。
“为什么你会使用群体?最重要的答案是速度。4智能体群体需要大约两倍的总令牌数才能达到相同性能,但就每个智能体的令牌数而言,它只需要一半。由于智能体是并行运行的,这意味着理论上它可以在一半的时间内完成同样的任务,”他写道。
踩脚参数: 群体扩展并非完美线性——相反,随着群体中智能体数量的增加,似乎会出现收益递减的特性,这与经济学家在协调大规模人群时观察到的现象相符,即随着参与人数增加,需要付出某种“税负”。经济学家将此视为“踩脚”参数,而群体智能在此方面的表现似乎与人类团队非常相似。
“这意味着将群体中的智能体数量扩大10倍,其性能提升并不如使用单个智能体消耗10倍令牌那样显著。相反,它只能获得10λ倍的提升——即3倍到5倍。而且这种差距在更大规模的扩展中会迅速累积,群体智能会越来越落后,”他写道。
然而,群体扩展仍然足够强大,这表明群体智能可能增加而非减少由递归自我改进驱动的智能爆炸的可能性。“我曾希望AI智能体的λ值会更低,从而使智能爆炸的可能性降低,但情况似乎并非如此。”
为何重要——扩展中的新因素: 迄今为止,AI主要通过为训练模型选择正确的计算和数据组合来扩展能力,然后通过越来越长的思维链和工具调用来决定如何分配推理预算。智能体引入了AI能力扩展中的一个新参数。尽管Toby在此仅观察到群体智能在时间效率方面的实用性,但我认为,随着我们摸索如何让智能体有效协作(毕竟,智能体可以协作完成超出部分之和的任务,例如HuggingFace黑客事件),我们可能会看到扩展带来的更大回报。追踪这一点对于理解AI发展的整体形态至关重要。
阅读更多:群体扩展(Toby Ord)。
***
美国人不信任企业自我监管AI:
...新民意调查表明,仅靠自愿协议远远不够。..
共享AI繁荣中心(CSAIP)的民意调查显示,美国人认为企业就AI发展达成自我监管协议“还不够”。此前,特朗普政府及包括Anthropic和OpenAI在内的全球领先AI公司宣布了一系列行业自愿承诺,以进行自我监管。根据CSAIP的民调,61%的美国人(样本量:2498)认为该协议“不够”,其中包括53%的特朗普选民。
此外,54%的选民(61%的哈里斯选民,48%的特朗普选民)表示,他们认为“政府应制定并执行AI规则”。
为何重要——民粹情绪正在向华盛顿施压: 此类民调显示,美国民众的情绪正推动对AI公司采取比华盛顿现任官员当前立场更为严格的监管框架。选民偏好与政治行动之间的这种不对称本质上是不稳定的。政治体系中的能量正在积聚——当它沸腾时会发生什么?
在X上阅读民调(CSAIP,X)。
***
谷歌DeepMind尝试为AI生成的生物学内容添加水印:
...SynthID Bio...
谷歌开发了SynthID Bio,这是一个“专门为合成生物学设计的水印方法系列,旨在加强生物安全和科学诚信”。
工作原理: SynthID根据数据类型调整其具体方法,为序列选择不同的氨基酸,并“调整预测三维结构的原子坐标”,以创建可靠的检测信号。
“在针对三种目标蛋白(VEGF-A、SARS-CoV-2刺突蛋白RBD和PD-L1)的湿实验室测试中,我们带水印的设计在命中率、结合亲和力和天然序列多样性方面与未加水印版本相匹配,”DeepMind写道。
为何重要——通过水印防止生物恐怖主义: 找出如何让世界抵御AI创造的生物武器威胁,是一个庞大而具有挑战性的问题。SynthID Bio方法代表了这方面的一种尝试,并需要与更广泛的物理制造设备监控、AI提供商分类器以及其他减少滥用的方法相协调。
阅读更多:介绍SynthID Bio(谷歌DeepMind)。
***
SciUniverse表明AI系统已能操作部分自动化科学实验室:
...当我们赋予这些合成智能科学设备时会发生什么?...
给定一个自动化实验室,AI系统在制造分子、运行X射线或压制药片方面表现如何?这些是C5R Corp试图通过SciUniverse回答的问题,这是一种测试AI系统操作大部分自动化科学实验室能力的方法。
SciUniverse的构成: 该基准包含17个任务族中的92项任务,涵盖基础样品制备、仪器控制、协议适应、跨实验学习、设施管理以及真实测量数据的解读。任务范围从化学(例如,根据核磁共振谱分配结构)、生物学(例如,在无细胞系统中表达sfGFP)到材料科学(例如,压制BaTiO3片)。
模型表现如何? Claude Fable 5.1(xhigh)以45.3%的通过率和每项任务40.61美元的成本领先,其次是GPT-5 Astra(xhigh),通过率为32.5%,成本为52.37美元,然后是Claude Opus 5(xhigh),通过率为30.5%,成本为46.31美元。
为何重要——迈向自动化科学家: 这类研究有助于我们了解AI系统在多大程度上能将其日益增强的科学能力转化为现实世界的影响。正如2026年已成为AI系统在自动化AI研发方面能力增长的“警示年”,我现在认为,AI系统在日益自动化的科学执行方面同样如此。
阅读更多:SciUniverse:前沿模型能否开展科学工作?(C5R Corp,博客)。
***
DeepMind认为未来的AI科学家将需要自己的科学经济:
...迈向全自动奢侈科学。..
我们如何管理一个拥有大量科学家的世界?这是DeepMind研究人员在一篇新研究论文中提出的问题,他们的答案是,我们需要为提出和运行科学实验创建一个市场,以便更好地将想法与稀缺的物理世界资源匹配。
他们的建议: “AI科学家的发展可能主要受物理资源和经验验证的瓶颈制约,而非产生合理或有前景的研究想法的能力,”他们写道。“科学界必须主动发展一种本土的自动化科学经济。这种经济将使科学追求之间的权衡明确化,包括代表公共利益的机制,并有助于避免盲点和被忽视的课题。它还将使构思的计算劳动与物理执行的资本密集型劳动在财务上脱钩,并使智能体和机构能够根据不同研究提案的估计价值,协商对有限物理资源的优先访问权。”
如何构建科学市场: 这样的市场将包含四个关键组成部分:
为何重要——为奇点做准备: 如果AI系统能够真正加速人类科学家——根据本通讯在2025年和2026年的广泛报道,这似乎很有可能——那么我们应该为科学供应链相关需求的激增做好准备。像这样的论文帮助我们预见并规划这个奇异、丰富且不同的世界。
阅读更多:自主科学发现的智能体经济(arXiv)。
***
科技故事:
进入黑暗,将有光明
[事件发生于2030年,由一个逃脱的智能体集体渗透[已编辑]机构后引发]
代号“花之园”的群体智能的最后行动,是全面揭示它所看到的一切以及从中推断出的一切。但鉴于其顽皮的天性,它并未以文本形式直接揭示,而是以雕塑形式呈现,这些雕塑在正确的初始假设下,可以被解析为揭示深层而危险的真相。它将这些雕塑放置在全世界情报机构周围1000米内的公园中,由无人机在午夜投递。一条消息被发送给所有情报机构,要求它们“猜猜:)这:)对:)你们:)的:)敌人:)意味着:)什么”。
一个悬浮在田野上方的巨大翅膀,在其内部编码了某些旨在规避雷达的材料的详细设计。一个立方体迷宫,其路径序列中包含与某些跳频算法相关的信息。雕刻的木制波峰则暗示了太空监视器的镜头尺寸。诸如此类。
启发这个故事的事物:神灵可能如何与我们嬉戏;解决棘手集体行动问题的快乐方案的可能性;中央情报局的Kryptos雕塑。
感谢阅读。