9个AI代理一晚烧掉100美元,系统重建后月费只要50美元
一晚上烧掉100美元
9个AI代理同时运行,一晚上烧掉100美元。这是个人重度使用AI的真实账单。作者没有靠省着用,而是把整套系统拆了重建:月成本压到50美元。
新账单是20美元ChatGPT Plus加30美元DeepSeek API额度。需要的话,再花10美元买OpenCode Go,这个渠道能抵60美元的使用量。
省钱的逻辑来自两个模型的成本差。DeepSeek V4.1-Flash拿到GPT-6 Astra 98%的分数。成本只有后者的1.4%。OpenDesign Arena拿真实日常任务测了11个模型。11个都比Flash贵,得分也没Flash高。分数超过Flash的只有Astra,但每个任务成本是Flash的70倍。对日常任务来说,多付的差价买不回对应的能力提升。
谁思考,谁执行
分工原则是一句话:Astra思考,Flash执行。Astra当CEO,读目标、拆任务、派活;Flash当团队,用七十分之一的成本做实际工作。你要做的只是向Codex输入目标。Astra定计划,显式生成一个绑定DeepSeek模型的子任务。codex-router把子任务路由到Flash。Flash执行完,结果交回Astra审一遍,再把最终答案还给你。在显式委派的情况下,Flash承担大约95%的日常任务。
这套分工必须显式设置。装完codex-router,仪表盘会自动打开。在里面粘贴DeepSeek API密钥,启用provider。把deepseek/deepseek-v4-flash设为可用的子代理模型。根模型保持Astra,别设成新任务默认。路由没自动启用的话,在路由器目录执行一条命令:./bin/model-router codex enable。给Astra开godmode要动一个配置文件:~/.codex/config.toml。嫌麻烦也可以直接让Codex代劳。AGENTS.md保持精简。系统提示专门把Astra塑造成编排者,要求它显式委派给Flash。
路由器不会自动分类任务。Astra没有显式生成带DeepSeek模型的子任务时,工作会留在Astra。计费也按Astra的高价来。
两个省钱开关
配置里有两个开关。reasoning_effort设成low。Astra在基准测试里能跑到max,日常任务用不上那么高的推理力度。调低能少浪费令牌。experimental_mode开启后,跨上下文窗口保留笔记,自动取回旧消息。长重构、长调试时保持连贯,也能省令牌。
心跳和定时任务要单独处理。一个后台检查每天在Astra上跑48次,作者管这叫昂贵的机器人失眠。同样的结果,换成显式路由后的Flash模型,便宜70倍。
验证配置是否生效,看三处。根模型选择器显示gpt-6-astra。路由器状态报告integrated/routed模式。再跑一个委派测试任务。路由器活动记录里应显示deepseek/deepseek-v4-flash。从安装到验证,作者把整个流程整理成了10步清单。
缓存决定最终成本
价格差不全来自模型单价。DeepSeek会自动缓存系统提示前缀。缓存命中时,价格只有新鲜调用的约五十分之一。要一直吃到缓存,系统提示里不能带时间戳和会话ID,每次调用的结构要保持一致。上下文文件也要控制体积。AGENTS.md低于800令牌,SOUL.md低于500。MEMORY.md低于2000。项目细节移到按需加载的文件里。
单价之外,架构也要算进去。DeepSeek V4.1-Flash的KV缓存更少,这条对代理场景格外有利。代理反复读取同一批上下文,缓存命中率越高,实际成本越低。
还有一处要注意:直接按量调用Astra。绕过ChatGPT Plus、走API按token计费,费用可能暴涨。作者的做法是固定花20美元月费,从Codex访问Astra,避开按量计价。成本变成一笔可预期的固定支出。
OpenDesign Arena具体测了哪些任务,帖子没写。Astra和Flash的官方定价,也没公布。codex-router能不能换别的模型组合、长期跑稳不稳,同样没有答案。作者建议关注@sairahul1,后续更多类似的系统会在那里更新。