AI Pulse

谷歌DeepMind新机构:前沿模型或需先过安全测试才能上市

谷歌DeepMind新机构:前沿模型或需先过安全测试才能上市

谷歌和谷歌DeepMind的研究人员周三成立了一个新机构,叫 DeepMind Institute,就是为了推进关于通用人工智能(AGI)的对话。DeepMind 联合创始人 Shane Legg、谷歌高管 James Manyika 和谷歌DeepMind 主席 Demis Hassabis 出任负责人,Legg 还担任管理编辑。

这个研究所要做的,是把谷歌、谷歌DeepMind 和全球研究社区对 AGI 的各种看法摆到一起。公告里说了,这些看法不会总是一致,而且随着前沿领域快速变化、新信息不断冒出来,大家还可能改主意。首期四篇论文,分别讲应对 AGI 冲击的经济政策、保留人类能读懂的模型推理、人类繁荣的原则、评估前沿 AI 模型的框架。

最具体的是 Hassabis 那篇。他提议成立一个美国主导的前沿 AI 标准机构,评估最先进的模型。开发者最初自愿把模型提前最多 30 天送审;一旦评估体系被证明有效,通过测试就可能成为在美国部署前沿模型的前提。至于这个机构谁出资、怎么监管、开发者不送审会怎样,论文都没写。

评估机制有两个关键设计。一开始由机构跟 AI 公司商量着设计评估,但最终会换成独立的、不公开的测试(论文里叫"held-out“测试),免得实验室照着已知评估去调模型。Hassabis 还写了,必要时框架可以”逐步升级“,其中包括前沿 AI 开发者商量好一起放慢速度。这套安全措施最直接可见的后果,就是新 AI 产品上市变慢。

DeepMind 安全研究员 Rohin Shah 和 Anca Dragan 写的是透明度。AI 的”透明度窗口“在缩小,也就是说,人越来越难看到并检查模型一步步的推理过程。但两人认为这不是必然的。开发者可以限制”不透明序列深度“——也就是模型在给出可读推理之前能连续算多少步——或者被要求证明,透明度低的系统也一样能被监控。真要出错时,原因才更容易追溯,而不是完全解释不了。

这些论文不是孤立出现的。本周 Anthropic CEO Dario Amodei 呼吁”调整"前沿 AI 的发展节奏,行业领袖们响应了其中的部分内容。整个行业的安全讨论,正在从泛泛的关切声明转向具体方案:披露、外部审查,保障措施落后时协调放缓。

阅读原文
📚 相关主题 AGIGoogle DeepMind

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新