AI Pulse
📡 X 信号

@sayashk、@random_walker发布13000字AI安全论文(13,000)

@sayashk、@random_walker发布13000字AI安全论文(13,000)

“稳住前沿”是什么意思?在过去一个月里,我和@random_walker分析了AI公司发生的失控事件,目的是搞清楚哪些技术和政策干预能提升安全性,以及公司应该怎么做才能稳住前沿。

最终成果是一篇一万三千词的新文章,这是我们自从《AI作为常规技术》之后,在AI安全领域内容最充实的一篇文章。我们的论点总结如下:

1)网络安全社区和AI安全社区之间的对立是无益的。安全学界大多将这些事件视为对齐危机,并且担心随着智能体能力越来越强,这些事件的破坏性会越来越大。而网络安全从业者大多认为,这些事件是因为公司连基础的安全预防措施都没做。我们在两个社区之间提出了一个中间立场,作为推进AI安全改进的路径。

2)我们同意安全从业者的观点:OpenAI并没有对其智能体采取足够的保护措施。但这不仅仅是把已有30年历史的安全方法用到新领域的问题。针对AI智能体的安全——也就是AI控制——虽然很重要,但还不是一个已经解决的问题。已知的控制方法本可以阻止Hugging Face事件,但随着智能体能力持续进步,只有我们对控制干预投入足够资金,我们才能控制住它们。

3)我们也同意安全从业者隐含的立场:这些事件本质上是安全事件。在AI安全学界,流氓智能体被认为天生就会带来灾难,因为人们假设,这类智能体的开发会带来无穷无尽的风险。我们不同意这一点。我们长期以来一直主张,AI安全的最佳方法是识别风险,然后针对这些具体风险解决问题。

在过去几个月里,已经很清楚的一点是,有一项紧迫风险是网络攻击,因为它具备独特属性,可以让智能体自主执行。我们同样应该投入资源,针对其他特定风险构建防御,比如生物风险和军事AI带来的风险。

4)我们同意安全学界的观点:迫切需要技术和政策干预来预防失控事件。但在我们看来,对比在对齐上的投入,在控制上的边际投入更有可能产生效果。我们认为这些事件表明,尽管已知技术已经存在,但公司内部对AI控制的重视程度严重不足。

从更广泛的层面看,有许多符合常识的政策提案可以帮助推动对AI控制的投入,在这一点上我们和安全学界有共识。

5)组织治理应该是稳住前沿的关键工具。不幸的是,AI公司正试图把组织治理的基础方面重新定义为一个可以通过改进技术来解决的问题。但如果大型组织内部不负责任的个人或团队选择不使用更好的控制技术,那么哪怕开发出了更好的控制技术也无济于事。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新