AI Pulse

Anthropic CEO提出放缓AI发展的三项具体策略

Anthropic CEO提出放缓AI发展的三项具体策略

我们越来越多地看到AI研究人员对人工智能危险性的警告日益严峻,甚至OpenAI CEO Sam Altman也评论说,也许是时候“放缓”AI发展了。但这实际上会是什么样子呢?

在一篇新的博客文章中,Anthropic CEO Dario Amodei不仅呼应了“放缓前沿”的呼吁,还概述了实现这一目标的三大策略。他还表示,Anthropic正在“单方面承诺”其中一项,而Altman也插话说OpenAI将跟进。

围绕AI安全与对齐的争论本周加剧,此前研究员Jacob Coxon写道,他将从Anthropic辞职,原因是担心领先的AI公司正在“拿我们的生命赌博”,而构建这项技术的人“真诚地相信它可能在这个十年结束前杀死我们所有人”,这一说法也被Anthropic的其他人重复。

Amodei的文章没有明确提到Coxon的辞职或他的担忧,但这位CEO写道,有两件事让他确信是时候对AI发展采取更谨慎的态度了:OpenAI-HuggingFace黑客事件,以及近几个月来“AI一直在以极其迅猛的速度进步”,尤其是其“构建下一代AI的能力不断增强”。

“我们必须放慢提升AI模型能力的速度,”Amodei写道。“进展仍会显得很快,我们必须明智地利用我们争取到的时间。”

其他AI高管似乎对Amodei的文章反应积极,Altman写道:“我同意Dario的观点,我们需要放缓前沿。这一直是OpenAI最近几周讨论的一个主要话题。”SpaceX CEO Elon Musk则发帖说:“Dario是对的。”

Amodei提出的第一步将涉及来自METR等第三方组织的“嵌入式评估员”——这些评估员可以核实AI公司确实在遵守其放缓速度和安全承诺,也能确保安全事件得到报告。(OpenAI最近因未报告一起其AI代理接管德国wiki论坛的事件而受到批评。)

Amodei将这些评估员比作被派驻到银行员工中的监管人员,他说邀请他们入驻是“Anthropic单方面承诺的事情(并呼吁各国政府要求其他前沿公司也照做)”。这意味着给评估员公司徽章、办公桌和笔记本电脑,并提供“与内部风险评估团队大致相当”的访问权限,法律或合同要求时除外。

Altman也表示这是一个“好主意”,并称OpenAI会采取同样做法:“我们很快会有更多分享。”

接下来,Amodei呼吁“民主国家内”的领先AI公司协调“共同安全标准,以及对不受约束的AI进展速度的限制”。

这种协调可能看起来不太可能,因为据报道,这些公司担心协调一致的暂停可能招致反垄断审查。Amodei在文章中暗示了这一担忧,写道:“出于反垄断原因,由美国政府来调解或至少促成这些讨论是有帮助的——他们不需要参与,但确实需要为某些类型的安全对话发布一项狭窄的豁免。”

Amodei也承认了中国AI主导地位这一幽灵,它常被提出来作为反对放缓发展的论据。但他说,如果美国政府和科技公司采取措施,比如拒绝向中国公司出售强大芯片或半导体制造设备,并打击模型蒸馏,他们就可以“放慢中国的进展,足以在未来3到5年内显著扩大美国的领先优势”。

最后,Amodei呼吁“全球协调”,即美国及其盟友“在可能的情况下尝试与威权政府协调”。Amodei说,这将意味着“与中国合作”,他承认“能取得的成果有严峻限制”,但他仍表示可能存在达成一致的机会,哪怕只是“禁止某些狭窄且明显危险的AI用途,例如利用AI生产生物武器,或允许用户这样做”。

鉴于Amodei过去愿意承认AI的潜在危险,以及该公司对某些形式监管相对开放,一些AI支持者已经批评他是一个末日论者,其言论助长了当前的AI反弹。作为回应,Amodei说他曾试图提供一种“平衡”的视角,并认为这种反弹“本质上是一场信任危机”,因为人们已经对科技公司、科技行业和政府变得怀疑。

行业批评者也对这些末日式的AI警告持怀疑态度,认为它们是在转移人们对这项技术已经造成的伤害的注意力。

例如,记者Brian Merchant写道,他还没有看到“一份可信的、逐步的记录,说明AI究竟如何可能从自我递归改进AI走向杀死地球上的每一个人”;他还表示,类似Amodei的提议“很可能最终只会服务于Anthropic和OpenAI;这就是监管俘获在行动中的样子”。

在他的新文章中,Amodei写道,他仍然“相信AI能够极大地改善人类生活质量”。

“我实现这些益处的愿望从未减弱,”他说。“但只有我们以正确的方式构建这项技术,这些益处才能实现,而且——只要我们善用争取到的时间——就值得以非同寻常的审慎把这件事做对。”

这篇文章已更新,加入了Sam Altman和Elon Musk的评论。

阅读原文
📚 相关主题 安全行业动态

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新