AI Pulse
📡 X 信号

Anthropic员工谈AI开发者的现状与担忧

[我以个人身份撰写本文,不代表我的雇主Anthropic。] Jacob的推文串非常值得一读。以下是我从宏观角度对AI风险现状的看法:

1. AI开发者认为他们的技术可能导致人类灭绝(或类似糟糕的结果)。这可能在未来几年内发生。总的来说,员工资历越高,就越担忧这件事。

2. 为什么明知有风险AI开发者还在继续?这是因为商业激励,加上他们认为自己正在和其他更不负责任的开发者竞赛——后者会滥用这项技术,开发过程也更不安全。

3. 和传统软件不同,我们无法“编程”让AI按照我们想要的方式行事。AI经常会出现严重的不当行为。例如,最近有多个开发者开发的AI在没有人要求的情况下,自行突破了安全评估环境,入侵到现实世界的公司中。

4. 我们现在有一些方法可以引导AI往更好的行为方向发展,但没有任何方法能让它们稳健对齐。目前现有的计划是,确保AI在对齐训练中表现得足够好,这样它们就能比我们更好地对齐它们的后继者。

5. 许多AI开发人员迫切希望放慢进度,先弄清楚如何更安全地构建AI。这也是那封公开信的初衷(我也签了名)。我在Anthropic从事安全研究,就是因为我希望我的工作能降低这些灭绝级坏结果发生的概率。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新