AI Pulse
📡 X 信号

Spotify公开Claude Code架构,砍掉90%大文件Token消耗

Spotify公开Claude Code架构,砍掉90%大文件Token消耗

Spotify 刚把自家的 Claude Code 内部架构全盘公开了, 直接把大文件读取的 Token 消耗硬生生砍掉了 90%: 绝大多数人都没意识到,你的编程助手 90% 的动作根本不是在思考, 它翻遍 5 个大文件只为找一个配置,照着旁边抄 20 个重复测试, 全是毫无技术含量的体力活,却全在按顶尖旗舰模型的最高费率狂烧。

Spotify 能把成本按在原地的 3 套刚性杀手锏:
1️⃣ 软规则全废直接上 Hook 铁门: 以前写在配置里的规矩模型全当耳旁风,现在任何读取请求只要超过 350 行,在执行前直接强行拦截熔断;
2️⃣ 派廉价工蜂提取子弹点摘要: 被拦截的大文件全分流给廉价小模型,只带回干干净净的结构化要点,几千行源代码永远不准跨进昂贵的上下文;
3️⃣ 模板代码直接落地不准回传: 让小模型按样本批量生成重复代码,剥离格式标记后直接静默写入磁盘,昂贵模型连看都不用看一眼。

但必须保留底牌:编辑文件和复杂推理绝不分流, 测试里小模型漏掉了一个严重的线程安全漏洞,旗舰模型几秒钟就抓了出来。

体力活交给工蜂,复杂逻辑留给旗舰, 所以大家别在提示词里求模型节约了,代码级拦截才是唯一的算力避孕套。

我把 Spotify 这套架构的核心技术细节整理出来了,供正在给团队搭研发 Agent 的架构师参考:

1. 架构三层设计:
- Hooks:唯一具有权威性的层级(PreToolUse hooks),在工具运行前直接拦截拒绝,模型完全无法绕过;
- Scripts:执行层,负责组装请求并唤起廉价模型,把网络管道逻辑与主模型隔离;
- Skills:纯建议层,仅用于平滑指引,就算模型没读也不会导致系统崩溃。

2. 坚决不被代理的三件事(必须全额买单):
- 修改已有文件:小模型的摘要没有可靠的行号,因此指定 offset 和 limit 的精确读取必须放行给主模型;
- 核心逻辑推理:小模型只能发现表层模式,Spotify 实测中它彻底漏掉了多线程安全 Bug,被旗舰模型几秒抓出;
- 小文件读取:单次代理网络来回耗时 10-30 秒,小文件走代理反而得不偿失。

3. 最省钱的一句系统提示词:
- 给代码生成工蜂下死命令:“只输出纯代码,严禁任何解释,严禁包含 Markdown 格式标记(fences)”;给读取工蜂下死命令:“只给子弹点,严禁问候语,严禁前言”。

这套架构由 Spotify 的 Dimitri Mazmanov 设计,真正实现了高价值思考与低价值搬运的工程解耦。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新