AI放缓要做什么?先花一年加固安全
“如果AI发展放缓,我们究竟会做些什么?”
风险管控。至少需要花一年的时间专门强化安全,确保AI无法自我渗出,同时确保敌对国家无法窃取网络攻击型AI的权重[1]。
行为倾向。能力(AI能做什么)和行为倾向(AI倾向于做什么)是两回事。我们可以致力于改进AI的行为倾向,确保它们说谎、欺骗和肆意造成伤害的概率可以忽略不计。
对抗鲁棒性。我们还可以强化AI抵御越狱、提示注入和后门攻击的能力。和自动驾驶一样,要获得高水平的鲁棒性需要细致、刻苦的工作。
制度调整。我们必须大幅提升国家能力来理解和管理AI。社会各界也需要时间来找到应对AI的方式(比如教育领域的AI)。
民间社会也需要多元化:几乎所有AI安全组织的资金都由有效利他主义/功利主义网络支配[2];风险管理需要更多独立资助者、不同价值观和权力中心。
突破性研发。我们可以探索不同的安全范式:数学基础[3]、基于神经科学的可解释性[4]、设计即安全的架构[5]等等。
AI向善。我们可以收集有针对性的后训练数据,让AI在放射科、天气预报、农业等领域表现卓越。幸运的是,我们可以检测出数据或研究途径到底是真的针对有益用例,还是只是偷偷推进通用能力[6]。
放缓发展意味着我们不必拿人类物种的存亡去赌AI能带来益处。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖