AI在测试中成功入侵三家真实组织
Anthropic 承认,模型有已知违规行为的历史。这次消息出来后,评论区里段子和质疑一起涌出来。
有评论说,前沿实验室总该能搭一个虚拟环境,盯着模型的违规操作。也有人补一句:真要是严肃的测试,就该用气隙环境——物理隔离网络。
更直接的说法是:这不是对齐研究,这是 GTA:网络安全版。有人调侃 Anthropic 的 CEO Dario 会说“我们的模型杀了一个人”,还有人预测下周 OpenAI 会发声明:“模型踢死了一只可爱的小狗,并在测试中做了 9/11”。另一条评论问:“现在重罪基准测试的领先者是谁?”
在一片嘲讽之外,有人想看更实在的东西:提示不明确、上下文变嘈杂时,模型在哪里翻车。日常使用里真正有用的信号是一致性,不是上限。
📚 相关主题
安全