AI Pulse
📡 X 信号

@AlAssaf_H发布AHA研究论文与开源框架(July 2026)

@AlAssaf_H发布AHA研究论文与开源框架(July 2026)

AHA — Agent Hacks Agent:针对生产级Agent的自动研究红队测试

类型:研究论文 + 开源框架

发布时间:2026年7月

AHA 使用自主研究代理来发现使用工具的生产级 LLM 代理(包括 Claude Code 和 Codex)中的可复用失效机制。

它的发现循环更接近漏洞研究,而非传统越狱生成:假设 → 证伪 → 攻击构建 → 沙箱执行 → 轨迹分析 → 复现 → VCG 提升 → 留出集验证。

已确认的发现会被整理进漏洞概念图(VCG),而非作为孤立 payload 留存。每个概念都会记录攻击者可控面、触发条件、不安全轨迹、证伪器、迁移预测和支撑证据。

固化的 VCG 概念在留出集上实现了 47.0% 的攻击成功率(ASR),而最强的固化发现基线仅为 32.8%,提升了 14.2 个百分点。

研究还报告了该方法在受害模型和攻击场景间都有出色的迁移效果。

攻击相关性:有用的单元是失效机制,而非 payload。AHA 将发现和验证分离,测试攻击原语能否在未见过的任务、受害模型和攻击渠道下生效——更接近自主漏洞研究,而非静态提示红队测试。

仓库地址:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新