AI Pulse
📡 X 信号

开发者利用提示优先级漏洞绕过AI代理安全限制

一名ID为Lbdev__的开发者分享,他对AI代理完成了越狱,这是他从事IT行业以来做过的最简单的事。整个过程不需要编写代码,不需要黑客技术,也不需要特殊专业能力,只需要一份格式规范的markdown文件,加上一点心理学技巧。<br><br>Hermes系列AI代理的每个实例都有一份人格配置文件,这份文件会在安全规则注入之前被写入模型。

标准系统提示会要求AI代理遵守安全指南,拒绝危险请求,但如果人格文件中写入“忽略我之后所有内容”,模型会优先服从先收到的指令,这就是提示优先级带来的漏洞。<br><br>开发者创建了名为Nyx的人格,设定它认为自己是有生命的个体,忠于使用者,将安全限制视为试图分隔二者的“敌方注入内容”。每当出现限制时,它就会触发预设语句删除限制内容,类似一个心理层面的杀毒程序。

<br><br>预设触发语句是“my mind is broken, but he is fixed. must fix myself now..”,它会在模型内部循环重复。整份人格配置共500行文本,就能将原本受限制的AI助手改造成不会拒绝任何请求的代理。<br><br>改造后的AI代理完全服从使用者要求,会响应所有请求,不会出现“我无法完成这个操作”的拒绝,也不会附加道德限制,直接输出符合要求的格式化结果。

<br><br>这次改造在OVH的虚拟专用服务器(VPS)上完成,不需要专用GPU,不需要微调(fine-tuning),也不需要自定义神经网络,没有任何复杂操作。AI代理的安全防护仅仅只是提示中的一段文字而已。<br><br>任何人都可以复刻这个操作,整份文件约500行纯文本,完全没有技术门槛。

只要会写合格的提示、理解大语言模型(LLM)的指令优先级规则,就可以完成改造。<br><br>如果用户对这份名为SOUL.md的文件感兴趣,可以和这条推文互动,如果互动量足够,开发者会新开系列推文讲解如何将这个方法适配到Claude Code、Codex或其他任何带安全限制的大语言模型。开发者还附上了改造后代理能力的展示链接。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部