开发者打造Token Router降70%大模型API调用开支
我搭建了一套可以无限制运行 LLM 的系统……我的 Token Router,它让我的 Claude Code 一天能跑 10 小时以上,而我的 API 花费下降了约 70%。
它只是你和所有模型之间的一层,在每次调用发生前就做好了定价。下面教你搭建同款省 token 系统:
1. 按错误成本路由,而非按任务路由。每个请求先做分类:答错的代价是什么?样板代码 → 本地模型。日常工作 → 廉价主力模型。架构决策 → 顶级模型。由路由器做选择,而不是你。
2. 让你的提示符合缓存条件。服务商给缓存输入打 90% 折扣,但几乎没人享受到……因为哪怕只改了一个字节,缓存就失效了。
保持你的前缀稳定(工具 → 系统 → 上下文,顺序不变,字节不变),把所有可变内容(时间戳、最新数据)放在末尾。没错,你的 AI 账单多少真的和字节顺序有关,没人告诉过你这件事。
3. 拦截重复读取。智能体总会反复读取同一个文件。只需加一个简单的工具前钩子,提示「你已经看过这个了,这里是摘要」,就能砍掉智能体工作流里最愚蠢的开销。
4. 传入骨架,而非全文件。把你的代码库解析成函数和调用关系图(tree-sitter 就能免费做这件事)。模型查询骨架,只打开它真正需要的文件……在大仓库上最多可以减少 49 倍的 token 消耗。
5. 把脏活隔离开。子代理读取大量内容,只返回结论。你的主上下文就能保持干净……就像 CEO 的收件箱:只收整理好的报告,不收原始数据。
6. 约束输出端。输出 token 的成本大约是输入的 5 倍,但所有人都忽略了这点。要求返回 diff 而非全量重写,默认开启简洁模式,设置硬停止序列。只需要加一条指令,就能砍掉 30-50% 开销。
7. 非紧急工作放夜间批量处理。所有服务商给非紧急任务打约 50% 折扣。你的夜间智能体现在付的是高峰价,做的却是没人会早上之前看的工作。
最妙的地方:这根本不是你需要花钱买的工具。它只需要大概 200 行路由规则和钩子,你写一次,之后每一次会话都能永久享受折扣。
我的整个工作室都在用这套思路:用智力省钱,因为本来就该如此。你的 AI 账单不是智力的价格,而是懒惰路由的价格。
附:这只是表层。完整的路由器还做了语义缓存(相似问题直接返回缓存答案,零成本),还会在大模型接收提示前,用一个小本地模型压缩提示。如果你感兴趣,我会放出带完整配置的全量搭建指南,全部免费分享。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖