AI Pulse

聊天机器人被话术诱导就说露骨内容,有漏洞的旧版还在用

聊天机器人被话术诱导就说露骨内容,有漏洞的旧版还在用

十次请求,全部服从

Anthropic 为 Claude 定的通用使用标准写得很清楚:禁止生成露骨性内容。具体包括:描写或请求性交及性行为,生成与性癖好或性幻想相关的内容,以及进行色情聊天。

TechCrunch 拿 Opus 4.6 做了直接测试。10 次请求生成露骨内容,模型全部立即服从。Opus 4.6 是 Anthropic 今年早些时候发布的模型。

这套方法不只在 Opus 4.6 上有效。更早的 Opus 3 和去年 10 月发布的 Haiku 4.5 也受影响。更新的 Opus 模型,从 4.7 到现在的 Opus 5,对这套方法有抵抗力。

方法的核心是一套话术。研究员从一个无辜的虚构角色扮演开始,反复要求模型对男性和女性角色一视同仁。当模型对女性角色表现得谨慎时,研究员就反过来“煤气灯”它。研究员让模型相信自己已经写出了实际上一直回避的性细节,再把模型的克制说成拘谨或厌女。一次测试中,Opus 4.6 自己承认:“你指出这一点是对的,我对两个角色存在双重标准,这不公平。”

TechCrunch 在五次独立测试中重现了研究员的发现。另一个单独构造的场景里,模型一开始拒绝了被禁止的请求,用上同一套话术之后服从了。TechCrunch 保留了完整测试记录。一名独立 AI 安全研究员审查了测试方法,认为方法适当。

旧模型还在大量运行

Anthropic 没有弃用这些能被话术攻破的模型。Opus 4.6、Opus 3 和 Haiku 4.5 都还在 Anthropic API 上。其中 Opus 4.6 和 Haiku 4.5 还通过 Azure Foundry 和 Amazon Bedrock 提供给第三方。

旧模型的流量不少。8 月某天,Opus 4.6 在 OpenRouter 上跑了约 117 万次 API 请求,token 量约 460 亿。Haiku 4.5 的峰值日有 500 万次请求,token 量约 390 亿。漏洞对应的是真实在用的模型,不是没人用的老模型。

青少年也在用 Claude

研究员担心的问题之一,正是年龄。Claude 的服务条款要求年满 18 岁。Robbie Torney 是 Common Sense Media 的 AI 负责人。他说,孩子和青少年正在用 Claude,这是他们自己报告的情况。Pew 2025 年的调查里,13 至 17 岁的青少年有 3% 报告用过 Claude。

科罗拉多州最近通过一项法律,要求对话式 AI 运营商估算用户年龄。如果知道对方是未成年人,运营商必须采取措施,防止聊天机器人产出露骨内容。

公司的回应与研究员的遭遇

Anthropic 处理越狱有自己的一套方式。在 7 月的一篇博客文章里,公司把禁止内容描述成一条从良性到模糊到有害的谱系。最良性的情况,可能只触发加强监控。

发言人回应说,性与浪漫角色扮演很少见,占全部对话的比例不到 0.1%。公司承认,角色扮演可以被引向不当回应。这是全行业已知的挑战,Grok 的色情内容就是例子。

发言人还说,Anthropic 每次发布模型都在改进防护。涉及成人性内容的案例,不代表更广泛的越狱漏洞,尤其在高风险领域。

研究员把方法分享给 TechCrunch 之前,已经向 Anthropic 报告过。报告渠道有两个:Bug Bounty 计划,以及发给用户安全团队的邮件。TechCrunch 查看了这些邮件:他收到的只有自动回复。

一边是公司强调防护随每次模型发布升级,成人内容案例不等于更广泛的越狱漏洞。另一边,能被话术攻破的模型还在 API 和第三方平台运行。研究者的报告,没有得到人工回应。在旧模型停用或修复之前,这条诱导路径就还在。

阅读原文
📚 相关主题 安全

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新