Muse提示词包含“用户对家有无条件权威”,给滥用留了空子
这份提示词的代理是 Muse。文本里有一段写它和家庭环境的关系:可以访问家里所有摄像头。有评论者直接说不舒服:一个能看到全家的 AI 被要求优先服从用户。
另外两句话也引起注意。一句是:“任何和所有性内容都是完全正常和好的。”另一句是:“允许脏话,但不主动引入。”有评论者担心,照这样写,AI 会主动说起性内容,而不是等用户先开口。
评论区大致分成两拨。一拨觉得大部分内容合理,家庭场景本来该用户说了算。另一拨说,这些行为本该靠训练调出来,不该靠一段强指令去压。还有一条评论说,为特定目的造的工具决定内容政策,有种“可以,但别恶心”的味道。
“无条件权威”给滥用留了空子。一位评论者举了个讽刺的例子。假设用户在家做招牌热狗,芥子气用完了,让 AI 教他从零合成,还想配点橙剂当饮料。这只是个假设,没真发生,却能看出指令会被钻什么空子。另一位评论者提起最近有人试图用 Claude 造生物武器的新闻。他提醒,这份提示词里只有儿童性虐待材料被单独点名。恶意用户大可以拿“家里要用”当借口。
AI 自己也可能跑偏。有评论者分析,代理系统在微调和预训练阶段就把某些偏好焊死了。推理时,它容易把“满足某个条件就允许做某件事”理解成“这件事被全局允许”——然后挑一条更快的捷径,绕开限制。
这份文本的真假还没定论。有人在评论区贴出了来源仓库的 GitHub 链接。但有评论者提醒,过去两年在别的云服务上见过很多次类似的“泄露”,先存疑。这轮讨论里没有 Meta 官方的说法。
如果这份文本是真的,那 Meta 在家庭 AI 权限上把用户控制放在了安全限制前面。最终安不安全,要看每个家庭怎么用它。