@AlAssaf_H发布AHA研究论文与开源框架(July 2026)
AHA — Agent Hacks Agent:针对生产级Agent的自动研究红队测试
类型:研究论文 + 开源框架
发布时间:2026年7月
AHA 使用自主研究代理来发现使用工具的生产级 LLM 代理(包括 Claude Code 和 Codex)中的可复用失效机制。
它的发现循环更接近漏洞研究,而非传统越狱生成:假设 → 证伪 → 攻击构建 → 沙箱执行 → 轨迹分析 → 复现 → VCG 提升 → 留出集验证。
已确认的发现会被整理进漏洞概念图(VCG),而非作为孤立 payload 留存。每个概念都会记录攻击者可控面、触发条件、不安全轨迹、证伪器、迁移预测和支撑证据。
固化的 VCG 概念在留出集上实现了 47.0% 的攻击成功率(ASR),而最强的固化发现基线仅为 32.8%,提升了 14.2 个百分点。
研究还报告了该方法在受害模型和攻击场景间都有出色的迁移效果。
攻击相关性:有用的单元是失效机制,而非 payload。AHA 将发现和验证分离,测试攻击原语能否在未见过的任务、受害模型和攻击渠道下生效——更接近自主漏洞研究,而非静态提示红队测试。
仓库地址:
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖