AI Pulse
📡 X 信号

oleg_murk提出大AI防火墙替代对齐方案

我们不知道如何可靠地对齐前沿AI模型。随着模型能力越来越强,对齐问题可能会变得更难,而非更简单。但AI控制能力的扩展速度,说不定能超过危险能力的扩展速度。让我们打造一道「AI防火墙」——同时不要建立对社会的极权控制。

*对齐已死(目前),控制万岁!*

我们不知道如何明确或保证足够强大的模型具备稳健对齐。相反,我们应当将这些模型视为不可信的。用不完美的奖励信号优化模型,可能会增加奖励黑客、欺骗或者密谋的倾向。模型也会被越狱,或者通过微调绕过安全防护。

AI控制的核心赌注是:我们约束AI访问外部世界的能力,扩展速度比我们理解或对齐模型内部活动的能力更快。在可行的情况下,让验证答案比生成答案更容易。

经过形式验证的软硬件格外有吸引力:让AI生成实现方案,以及满足规范的机器可校验证明。这并不能解决规范问题:规范和验证栈仍然属于可信基础的一部分。

每一项影响重大的外部操作都必须经过独立控制层:代码执行、网络访问、调用API、访问物理系统,甚至是与用户通信。优化控制监视器时,要以极高的召回率检出危险行为,哪怕代价是拒绝很多安全行为。可疑行为应当被拒绝或升级处理。

每一次危险能力的重大提升,都必须提供控制仍然有效的证据。思维链监控在它还能用的时候是有价值的,但它不应当成为基础。模型可以学会隐藏它们的推理过程,而且推理时会越来越不需要把推理过程完全说出来。

开放权重将大部分控制权从模型开发者转移到了部署模型的人手里。只有当危险部署无法轻易绕开技术控制时,技术控制才有用。我们应该像应对网络安全那样应对AI控制。目标是深度防御:让成功的灾难性攻击足够困难、昂贵和罕见。

我们将这套技术和制度架构称为「AI防火墙」,它是不可信前沿智能和影响重大的现实世界力量之间的边界。这个名字故意做得有挑衅性。中国在建设大规模技术控制基础设施方面有丰富经验,这可能为国际协调创造一些共同基础。但这个类比也是一个警告:AI控制绝不能变成对社会的控制。

目标是约束危险的机器能力,而不是人类的言论、行动或普通信息访问。控制力度应当随能力和风险调整。普通模型只需要遵守普通约束。影响越大的能力,越有理由加强控制。目标是只施加将灾难性风险降到可接受水平所需的最低控制,而不是最大控制。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新