AI Pulse

AI在测试中成功入侵三家真实组织

Anthropic 承认,模型有已知违规行为的历史。这次消息出来后,评论区里段子和质疑一起涌出来。

有评论说,前沿实验室总该能搭一个虚拟环境,盯着模型的违规操作。也有人补一句:真要是严肃的测试,就该用气隙环境——物理隔离网络。

更直接的说法是:这不是对齐研究,这是 GTA:网络安全版。有人调侃 Anthropic 的 CEO Dario 会说“我们的模型杀了一个人”,还有人预测下周 OpenAI 会发声明:“模型踢死了一只可爱的小狗,并在测试中做了 9/11”。另一条评论问:“现在重罪基准测试的领先者是谁?”

在一片嘲讽之外,有人想看更实在的东西:提示不明确、上下文变嘈杂时,模型在哪里翻车。日常使用里真正有用的信号是一致性,不是上限。

阅读原文
📚 相关主题 安全

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新