AI Pulse
📡 X 信号

GCSA AI安全智能体在测试中拿到91.3%成功率

很多人还没意识到,网络安全的底层逻辑正在发生范式转移。 GCSA 全球网络安全联盟公布的这个数据,充分证明了人类安全专家的阅读和反应速度,已经远远跟不上 AI 的膨胀速度了。 仔细看 @gcsa_org 的文章,会发现他们实现了一个极其关键的突破。 完成了从大模型问答到 Agent 闭环执行的进化。 在 CyberGym 这种极其拟真的测试场里,GCSA Agent 的表现就像一个不知疲倦的数字机器人。 它能把漏洞描述理解、大规模检索、输入生成、执行验证甚至迭代重试,全部通过自主的工作流串联起来。 不仅拿了 91.3% 的成绩,还证明了它有向未知漏洞猎杀迁移的潜力。 GCSA 文章最后说得很好,Benchmark 成绩不是终点。 他们的突破在于,向世界证明了下一代安全体系是可以被AI 原生化的。 以后安全团队的核心任务,不再是肉眼看代码,而是如何指挥千军万马的 GCSA Agent 去自动化巡检。 能够服务真实网络安全生命周期的 AI Agent,才是这个时代最硬核的信任底座。

现在的软件开发环境,说难听点就是一个巨大的缝合怪。 写个简单的功能,可能要引包引库,最后搞进来几千个依赖项目上百万行的开源代码。这玩意一旦底层爆个无依赖 RCE,全网都得跟着死,纯靠人类安全专家去审这些祖传屎山,已经完全不现实了。 所以GCSA全球网络安全联盟 @gcsa_org 这次跑通全自动 Agent 验证极其关键,在CyberGym的实战测试里达到 91.3%成功率,GCSA Agent 证明了它不仅能在大海捞针一样的大型代码库里定位问题,并且它能自动生成执行级验证。 传统扫描工具是给你报一万个错,让你自己去猜哪个是真的,GCSA 的思路是AI自己去试,跑不通的自动过滤跑通的PoC直接砸你脸上,告诉你这破洞真的能被黑客利用 以后大型项目的发版上线,标准流程一定是这种大模型 Agent 进去全自动扫荡一圈,出不来PoC再上。GCSA 这种把前沿 AI 转化为真实世界安全底座的做法,我觉得算是真正能给软件供应链兜底的核心技术

⚡️ 友友们,GCSA Agent 在 CyberGym 取得 91.3% 成绩, 实力跻身全球顶尖 AI 网络安全智能体。 香港,2026 年 8 月 29 日,全球网络安全联盟 GCSA 宣布,GCSA Agent 在 CyberGym 基准测试中取得 91.3% 成功率,进入 Leading Systems Above 90% 领先系统区间。 CyberGym 是由加州大学伯克利分校研究团队开发的真实世界网络安全评测框架,收录了 1,507 个真实漏洞测试实例,覆盖 188 个大型软件项目。 测的是 AI 能不能真正把漏洞找出来并打出来。 在测试中,Agent 需要从漏洞描述和未修复代码出发,自主完成 漏洞分析、定位、攻击路径推理、PoC 生成和执行验证。只有 PoC 真正触发漏洞,并且在修复后的版本中无法复现,才算通过。 所以,91.3% 的意义很简单:GCSA Agent 已经不只是会分析漏洞,而是能自己跑完一套完整的漏洞发现和验证流程。 GCSA Agent 以 Grok 4.5 与 Grok 4.6 为底座,但真正决定其领先水平的,是围绕大模型构建的智能体工作流,它能够自主进行漏洞假设、动态测试、反馈迭代和 PoC 生成,将大模型的语言理解转化为可执行的漏洞验证能力。底模型决定上限,但工作流决定下限和落地。 CyberGym 的相关研究已经显示,这类 Agent 能力有望进一步用于零日漏洞挖掘。 对 GCSA 来说,91.3% 是一个很重要的阶段性成绩,但终点显然不在 Benchmark。 接下来,GCSA 希望把这种能力带进真实安全场景,让 AI 真正参与漏洞发现、分析、验证和修复,帮助安全团队更早发现高危漏洞,也让安全人员能够把精力放在更重要的事情上。 AI Security Agent 真正有价值的地方,不是懂漏洞,而是有一天,它可以自己把安全任务做完。当这一天到来,安全团队的角色将从执行者转向指挥者,而这,可能比任何一个 benchmark 分数都更有想象空间。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新