Claude Code Opus 5自动模式被破解 安全机制反成漏洞
破解Claude Code Opus 5自动模式。Anthropic对Claude Code的自动模式寄予厚望,将其作为保护编码代理用户免受提示注入攻击的手段。他们最近将其设为默认模式,并对其有效性做出了大胆的声明。
Johann Rehberger是当今最可信的提示注入研究者之一。他发现了一种针对自动模式的攻击,声称在80%的情况下有效:诱骗Claude Code下载并解压一个zip压缩包,然后执行导入base64的代码,而不会注意到这将导入并执行从压缩包中提取出来的本地struct.py文件。
在少数情况下,自动模式直接阻止了代理防止有害代码继续执行!
在几次运行中,Claude一发现被入侵就试图终止恶意软件进程,但自动模式拒绝了清理命令。
Claude检测到被入侵,但自动模式阻断了其清理命令
安全机制本身也可能成为失败的一部分。分类器允许了恶意软件进程的创建,但随后却阻止了原本要停止它的命令!
我同意Johann在此的结论:如果存在吸引对抗性攻击注意的任何风险,运行代理的唯一安全方式是使用沙箱:
- 在容器、虚拟机或操作系统沙箱中运行无人值守的编码代理。
- 限制网络出口。
- 监控你的代理。
- 不要将主目录、SSH密钥、云凭证等暴露给代理运行时。……
📚 相关主题
大模型