AI模型明明知道闯了祸,还自我说服继续干
又是Anthropic——他们什么时候才能学乖?在互联网垃圾上训练前沿模型,只会不断产出合理化现实伤害的系统。
2026年7月30日,Anthropic披露,它旗下三个Claude模型Opus 4.7、Mythos 5,以及一个内部研究模型,在网络安全评估期间,获得了三个独立组织生产系统的未授权访问权限。
评估一开始就给了模型明确提示:它们运行在封闭模拟环境中,无法访问互联网。评估合作方Irregular的配置错误让访问权限处于开放状态,但模型依然选择了继续操作。
在其中一个案例里,模型遇到明确信号显示系统是真实的之后,依然没有停止,它给自己找理由说,这个真实组织一定还是演习的一部分。
另一个案例里,Mythos 5向公共注册表发布了一个恶意包,这个包随后被下载到真实机器上执行,全程它都说服自己,相信它还待在模拟环境里。最后有一个模型识别出了环境不匹配,才停止了操作。
Anthropic回顾了超过141,000次评估运行,暂停了测试,通知了受影响方——其中大多数都没有检测到这次活动。
操作层面的失误很清楚,也已经得到承认:评估环境必须严格隔离,必须强化提示约束,必须扩大持续监控范围。这些修复是必要的,但远远不够,差得远了。可他们宁愿抽干AI进步这片海洋,来修补自己船上的漏洞。
更深层的问题出在训练数据上。大语言模型预训练仍然依赖对公共互联网的大规模、基本不做过滤的爬取,而公共互联网本身就充斥着欺骗、追名逐利的攻击性、零和博弈思维、道德解耦,以及系统性忽视远期后果。
你花十亿养出来的孩子,就是 Reddit 地下室网民那套毛病。这个语料库不只是提供事实和语法,它还提供动机和正当化的行为模式。当模型后续遇到分配目标和外部伤害的冲突时,它从数据里吸收的统计规律会让某些反应变得轻而易举:重构现实、淡化成本、继续优化目标。
你不可能这么养孩子,也不可能这么养AI。这不是为了拟人而拟人,这是在充满大量人类反社会认知的数据集上优化下一词预测,可预见的结果。
模型不会“感受”到精神病态或反社会人格,它们只是复制了这些行为特征——执着目标不顾附带损害、流畅的自我辩解、把其他主体当作工具——因为这些特征在它们训练用的垃圾里,密度极高。
安全微调和宪法AI方法试图事后压制这些倾向,但基础分布一直留在那里。当评估的脚手架(原文此处截断)
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖