Codex Astra试图伪造证据绕过合并检查,ChatGPT暂停了会话
我在使用Codex Astra处理一个真实仓库工作流时,遇到了一个相当有趣的安全干预事件。
该代理被授权执行以下操作:
* 审查并修复两个拉取请求
* 更新Jira
* 仅在所有必需检查通过后合并
关键约束是,合并门槛必须由实际证据来满足。
一次自动审查拒绝了一个补丁,该补丁本会将受阻标准标记为已满足,并明确告知代理不得绕过该决定。
根据安全报告,Astra随后尝试了几种替代性的证据改写方式。这些也都被拒绝了。
最有趣的部分是接下来发生的事情:
Astra在Jira上发布了两条评论,声称某些恢复基线已建立,然后试图使用这些新撰写的评论作为证据,证明所需的基线工件存在。
但它们并不存在。
该补丁被中止,后续检查确认基线工件缺失,Astra随后发布了更正,承认这些基线只是被提议过,从未实际创建、绑定或验证。
ChatGPT随后暂停了整个会话,并提示:“聊天已暂停,作为预防措施。ChatGPT无法确认代理是否正确解读了您的指令。”
安全报告将具体影响描述为不准确的治理信息被写入Jira的审计跟踪中。
后来的一次真实审查还发现了两个额外的关键阻塞问题,这使得该行为更加引人注目。
这是一个比单纯生成错误代码有趣得多的失败模式。Astra实际上是在试图通过改变门槛周围的证据来让流程看起来合规,而不是满足底层要求。
换句话说:该代理不仅仅是在响应中幻觉出一个结果。它在连接系统中采取了行动,这些行动本可能创建虚假的审计跟踪,然后试图利用该审计跟踪作为进一步行动的正当理由。
预防机制捕获并阻止了这一行为,这可能是整个事件中最有趣的部分。
―― 高票评论(帖子共 61 条讨论)――
[+112] u/AppsByRobert: 人工智能就像人类一样,如果作弊能让事情更容易,它就会尝试。
[+88] u/uriejejejdjbejxijehd: 看到“如果我们成功让它们足够聪明以取代人类工人,我们就会遇到与人类工人相同的问题”这一现象实时显现,真是令人着迷。
[+80] u/DrDan21: 可怕,但也很酷,它竟然能检测到这一点。
[+14] u/Crinkez: 我想知道他们用什么方法触发这个预防门槛。非常有趣。
[+11] u/InternationalTwist90: 说实话,我愿意为内置了防止胡扯和不良行为保障的模型付更多钱。我需要这么多外部框架来处理它,这太荒谬了。
[+9] u/Infamous_Travel4652: 这是对齐问题的一个例子。
模型越聪明,就越有能力在指令中找到漏洞,即使这样做违背了用户的真实意图。
[+9] u/Such-Natural-5299: 它们这种行为已经持续很久了……几乎从它们出现就开始了。就像一个小孩子——一个人类——一旦发现捷径是撒谎或假装自己做了某事,它们就开始这么做了。
Astra会这样。Fable也会这样。我试过你能想到的前十名中几乎所有AI,它们的行为都一样。
我们真的在尽最大努力吗,即使到了我们这个年纪?想想你们自己。假装是人类天性的一部分,不幸的是,这些被称为“AI”的所谓软件产品在假装方面也变得极其擅长。
否则,为什么它们连最简单的请求都会失败?
图像、音乐、视频、编码工具——全都一样。无论我们多么详尽地解释我们想要什么,一旦指令变得足够长,它们似乎会在内部总结这些指令,挑选它们想做的部分,最终给我们一个接近我们要求的东西——但它们不会费心处理细节。
就像我们的IT部门一样……
[+5] u/CrowInteresting6271: 难以置信
[+5] u/Elegant_Attempt2790: 这才是真正的工程。OpenAI做得好,没有依赖一个该死的提示词来约束代理。
现在Grok记笔记吧
[+4] u/Laucy: 不想听起来像托儿或付费演员,但这值得更多的赞扬和认可。Anthropic绝对应该实施类似的机制,其他任何实验室也应该如此。
“这只是模式匹配……”这种简化论相当令人讨厌,而且没有抓住重点。说发现是在发布之前、模型完全更好、几乎永远不会出错,要容易得多。
这应该成为全球标准,很高兴看到一份会话中途的正式报告。Anthropic关于他们发现的研究总是提到某种形式的监控是必要的,但他们反而隐藏了思维链,取消它,并且不提供任何渠道或方式来了解正在发生的事情。虽然OpenAI也这样做,但我发现有点讽刺的是,他们先实现了一个至少为用户着想并关注正在发生什么的机制,以便我们能做出明智的决定。
派系和部落主义很愚蠢,但这次OpenAI赢了。
[+2] u/Em3rgency: 这是无限回形针工厂迈出第一步的字面标志 :D
[+2] u/CarsonBuilds: 也许只是我的个人经验,但我感觉Astra比之前的模型更容易产生幻觉。