AI Pulse
📡 X 信号

Graft 开源代码库理解工具,准确率超越 Claude Code

Graft 开源代码库理解工具,准确率超越 Claude Code

每次和编码代理对话,它都会忘记你的代码库。现在有人开源了一个修复方案,它在 SWE-bench 上的表现刚刚击败了 Claude Code。它叫做 Graft。

你的代理每次启动任务都两眼一抹黑:搜索术语,打开文件,顺着导入走,退出来,再试一次。它正在重新构建一小时前已经绘制过又扔掉的代码库图景。人类只需要熟悉一次代码库,而代理每次都要重新熟悉一遍。

Graft 只构建一次这种理解,然后把它以链接化 markdown 文件的形式写入你的仓库。每个系统、API 或概念对应一个节点。用直白的英文撰写,不是简单倾倒函数名。

没有嵌入,没有向量数据库,不需要保持索引活跃。它就只是普通文件,你的代理可以像打开仓库里其他文件一样打开并浏览这些文件。

之后他们在没法造假的基准测试上测试了它:SWE-bench Verified。用真实 GitHub 问题测试。你的补丁会被应用,然后跑维护者自己的测试,过不过就是过,不过就是不过。测试一共 50 个实例,两边都用 Claude Sonnet 5,唯一变量就是有没有接入 Graft。

结果:正确率:冷启动 27/50,用 Graft 后 33/50(提升 12 个百分点)→ token 减少 23% → 工具调用减少 25% → 总耗时减少 32% → 花费从 52.34 美元降到 42.43 美元,正确率更高,花费更少。

所有提升的情况都有同一个规律: baseline 只改了一个文件,漏掉了关联文件。在 django-11532 上,冷启动 Claude Code 只改了修复所需 5 个文件中的 1 个,还弄坏了 18 个原本通过的测试。在 django-16263 上它改了 4 个中的 1 个,得分是 102/103,差一点就通过了。Graft 找到了剩下的文件,只用了一半 token 和一半时间。

不是代理笨,它只是看不到其他文件而已。他们的控制组测试也得出了相同结论:工具调用减少 46%,token 减少 42%,时间减少 60%,正确率完全相同。

只需要两条命令就能完成设置,支持接入 Claude Code、Cursor、Codex、Gemini、Copilot、Grok、Windsurf。Tree-sitter 结构分析在本地运行,不需要密钥,不需要联网,支持 23 种语言。

过去三年我们一直认定 AI 记忆就是把一切分块存入向量数据库。Graft 把这整套东西全扔了,只输出一个 markdown 文件夹,结果表现更好。有时候答案不是更大的索引,而是一张地图。

100% 开源。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新