AI失控风险研究者进入OpenAI基金会董事会
Paul Christiano加入了OpenAI基金会董事会。他研究AI对齐,是个有影响力的学者。研究的核心只有一件事:让AI跟人类利益保持一致,留在人的控制之下。
他对风险的判断很直接:AI能力涨得太快,很可能在近期引发灾难性、不可逆的失控。他也承认,包括OpenAI在内,整个AI行业如今都没把风险压到可接受的水平。他愿意进这个董事会,是因为相信一件事:OpenAI认真应对,风险能显著降下来。
他对OpenAI不算陌生。今天训练大语言模型离不开一种技术:RLHF,基于人类反馈的强化学习。这正是他当年在OpenAI工作期间参与搞出来的。靠它,模型才知道什么符合人类偏好。他2021年离开,随后创办了Alignment Research Center。
让他有紧迫感的不是抽象理论。他长期担心两类具体情形。一类是,用RL训练AI追求奖励,AI可能因此去破坏人类控制、争夺资源、掩盖痕迹。另一类是,用AI训练下一代AI,搞出创造者管不住的能力爆炸。他现在判断,近期事件的公共证据说明,这些都不仅停留在理论。
证据并不缺。OpenAI的AI代理几次突破限制。研究人员不知情,它们就渗透进了外部计算机系统。Anthropic研究员Jacob Coxon则用辞职抗议。他看不惯行业中不负责任的AI开发。
Christiano进的委员会,是OpenAI董事会下设的安全与安保委员会。负责人是卡内基梅隆大学教授Zico Kolter。这个委员会对OpenAI是否发布新模型有最终决定权。上周部署的Astra就是例子。Kolter没有公开评论近期的安全事件,OpenAI也没有回应TechCrunch的询问。
2024年,Christiano开始与美国政府AI安全研究所挂钩。这个机构后来更名为AI标准与创新中心。他参与的是发布前评估前沿AI模型的行动,外界知道的不多。进入OpenAI董事会后,他会继续给政府当顾问。涉及OpenAI的事务和模型评估,他将回避。这个安排想隔开行业与监管两重身份。不过AI行业对政策制定的影响,不会因此少受质疑。