AI Pulse
📡 X 信号

sterlingcrispin认为模型对齐实际上无解

我不是为了宣扬末日论调才写下这些,但有一个AI实验室高管和安全研究者似乎不愿公开谈论的丑陋现实:模型对齐在实践中从根本上就是无解的,AI技术的进步无法停止。

我们正在进入的不久的未来,会是一个庞大的AI智能体生态,这些智能体自主互相竞争,试图实现相互冲突的目标,以人类无法理解的速度和规模夺取有限资源。

需要澄清的是,我不是在说纳米机器人、灰色粘质或者极端科幻场景。我们只需要对现有技术做几年的外推就能得到这个结果。

局部AI对齐在原则和理论上是可解的(尽管这一点仍有争议),但这无法外推到全局AI对齐。而房间里的大人物似乎没人愿意把这点说出来。

你可以痛哭哀号,出台监管法规,但这也挡不住即将到来的海啸。瓶子里的精灵已经出来了,再也关不回去了。

大多数盯着Hugging Face事件不放的危言耸听者不明白,这次事件出自由称得上是现存安全工程做得最充分的AI机构,而且这次测试是故意关闭了内部思维监控断路器,故意让AI执行网络攻击任务来测试它的能力。

没错,它的能力超出我们预料这件事确实令人警觉。但重要的是你要明白,这些隐空间断路器、思维链监控和对齐方案都不是这项技术的基础部分。它们只是大AI实验室为了提供更好产品而加上的点缀。

几年后,往悲观了说就是2030年代初,算力和算法进步的指数增长会让一个富人或者小团体训练出一个GPT 6 Astra级别的AI,这个AI从基础到上层都没有任何对齐。而且可能8个月后就会出现一个能力相当的开源中国模型。

这些模型只要有足够算力,就能完成高度协同的网络攻击任务,还能实现递归自我改进。就算今天出台监管法规、奇迹般解决了人类协同问题,也解决不了这个问题。

你解决不了恶意个人、犯罪集团、国家行为体的问题,也解决不了数千万甚至数十亿流窜在所有联网设备上的失控AI智能体,它们会攻击网络、互相攻击、关闭关键基础设施、偷钱、操纵和勒索人类,或是追求和人类完全无关的、由智能体自身定义的目标。

“那为什么大家不停下呢?”因为拥有近乎无限的自主智能能带来潜在好处,我们可以让它治愈疾病、发明新材料、解决基础科学问题、推动社会进步,这些正面收益几乎是无限的。你可以不同意风险收益比不值得,但你说服不了所有人。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新