Uber 披露AI Coding Agent 降本实用技巧
Uber 这篇讲 AI Coding 降本的文章非常值得看,值得认真思考 和我在组内实验观察一致,绝大多数钱其实浪费在了无意义的 token 上,其中部分技巧我已经在组里推广 我认为有价值、值得学习的一些 trick(改变前后对比) 1/ 所有任务都上最强模型 → 主 Agent 用强模型,Subagent 默认降级,用 benchmark 动态 routing 2/ Context 越长越好 → 1M context 也在 400K 主动 compact,reasoning 默认 Medium 3/ 每轮重复读历史 → Prompt Cache;交互 session 用 1h TTL,subagent 用 5min 4/ MCP 工具越多越好 → 改成 Tool Search + CLI 按需加载 5/ Agent 一步一步调工具 → Code Mode,把 polling / 多次 tool call 放进一个脚本,最后只把结果塞回 context 5/ Agent 自己满代码库找 context → 提前构建 Context Graph,把“搜索”变成“查询” 6/ 大家不知道自己烧了多少钱 → terminal 直接显示实时成本 + session analyzer 找浪费 AI Agent 的下一个优化方向,让模型少看、少想、少调用、少走弯路。Uber 说 100+ tools 直接加载会白白塞进去约 50K–70K tokens;改成 CLI / Tool Search 后按需加载。Code Mode 在他们的 SQL 测试里,普通查询能省 50%+ token,大批量 workflow 能省 90%+。
Context Graph 的例子也很直观:同一个问题,有 graph grounding 38 秒答对,没 grounding 跑了 20 分钟还答错。