前沿AI失控评估很难实现标准化
在AI前沿有明确共识推进标准的同一天,前沿AI失控评估也会出现明确共识的执行标准。换句话说:短期内不会有,也许永远不会有。
如今,我们开展的每一次失控评估,都更像是一个全新的开放科学项目,而非一套容易标准化、可重复执行的流程。
现在这项工作本身就是即兴开展的,而如果社会一直发展,最终诞生超级人工智能,我认为在这整个过程里,它都会保持这种即兴属性。
目前我们手头最靠谱的方案,大概就是:“找另一双出于公共利益考量的眼睛,查看AI实验室内部的运作,并将能公开的内容分享给全世界,再让大众根据看到的信息做出反应。”
这就是为什么我认为第三方监督如此重要。如果安全评估可以按流程执行、容易重复,那你只需要出台一套通用标准,然后靠文书工作就能证明实验室自行完成了评估。
但评估前沿安全这门科学本身就带有主观性,你得依赖更接近科研同行评审的机制才能完成。
这和当下AI安全评估的目标有关,至少在METR这类机构里,它的目标更接近追踪抗生素耐药性累积,或是评估大气碳含量——回答“我们整体面临多大危险?”——而非像FDA那样,判断“这款特定产品在至少和功效大致无关的维度上是否安全可用”。
它的目标更多是向全世界通报当前局势,而非给单个模型出具安全认证。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖