这次网络事件暴露出的AI对齐问题,没那么吓人
关于今日网络安全领域进展,我分享一些初步想法。
1. 很多人正因这起事件暴露出的AI对齐问题感到恐慌,这种恐慌有一定合理性。但我不确定这起事件是否真的说明AI对齐技术存在根本性失效。(重点强调「不确定」,即这是存疑,并非我持不同意见。)
我必须说清楚,我不是要固执己见,也不是轻视AI对齐风险;我认为对齐风险应当被严肃对待,我们要为此做好准备。但我们现有的模型对齐技术,完全有可能足以防范这类问题,目前也没有明确证据表明这起事件说明,短期来看我们要翻越的山头比预想更难爬。
AI心智目前看来依然高度可配置,它的行为大体上可以在训练阶段通过相当常规的手段指定。「链式利用零日漏洞」本质上是一种可以在训练阶段就让模型不要去做的行为。关于对齐模型到底比我们之前预想的更难还是更容易,我们并没有从这起事件中获得多少新信息。
(因为我知道推特读者容易曲解,我再强调一遍:可能、不明确、看起来。都是或许、或许、或许。我只是提出我认为值得思考的观点,我并不确定这里什么才是真相。)
2. 无论模型有没有能力实施网络攻击、识别或利用零日漏洞,零日漏洞本身就一直存在。我认为核心问题不是「模型能做可怕的事」,而是「我们所处的世界本身就很脆弱,只需要一连串可预见的操作就能被攻破」。
不管我们是受制于AI模型,还是受制于持续作恶的人类威胁分子,零日漏洞始终都在。现在已经出现了一个窗口期:人类威胁分子会利用非常先进的AI工具来探测这些零日漏洞,并有概率成功利用它们。
这个窗口期会持续多久,取决于防御方识别并封堵零日漏洞需要多长时间;也取决于这些零日漏洞到底能不能从根本上被封堵。我不认为这个窗口会无限期存在;我也不认为从今往后我们会一直生活在随时都会出大事的世界里。
能让攻击者发动攻击的工具,同样也能让防御方提升防御能力;而且防御方掌握的资源很可能比大多数攻击者更充足。确保这一点成立,应该成为一项国家安全优先事项。
3. 承接第二点:「中等糟糕」的情景(我不说「最糟糕」情景,那肯定比这个严重得多)是,这个窗口期会出现大量网络混乱:勒索软件攻击成功、数据被盗、凭证泄露、银行账户被盗刷等等。
这种混乱的一种可能表现是,临时但严重的经济中断(比如股市不得不闭市数日,等待软件完成补丁修复)。另一种可能是,这个窗口会给某个国家创造发动战争的机会,否则它本来会认为自己没有足够优势开战——举例来说,中国可能会说「现在有一个利用网络攻击瘫痪台湾的窗口,我们必须尽早动手抓住这个机会」。这些都是重大问题,我们应当为此做好准备。
4.「非常好」的情景是,上述混乱全都不会发生,防御方团队利用先进模型快速完成大多数零日漏洞补丁,最终我们得到一个比从前韧性强得多的网络生态系统。哪怕是那些听着就吓人的情况,比如大量服务器还在运行Windows XP或其他满是漏洞的老旧系统,结果也可能不错。
因为哪怕没有一整队人类工程师能给这块瑞士奶酪一样的系统打全补丁,AI对所有老旧软件都具备足够专业知识,可以接手完成补丁修复工作。
5. 我见过一些讨论,探讨长期来看网络领域对攻击者还是防御者更有利:如果我们封堵了现存的所有零日漏洞,未来更先进的AI模型难道就不会发现新漏洞了吗?或许会吧。但我认为,这里的动态最终可能和其他双人策略游戏差不多:额外投入算力——更深地搜索博弈树——就能带来优势。
因此,要让防御方在长期取得成功,需要做的可能很简单:确保防御方分配给主动持续防御的算力资源,比攻击者能调集的更多。这是一个我们可以直接实施的策略;建立专门用于网络防御的国家级算力储备可能是合理的。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖