把简单编码交给本地模型 省下Claude订阅额度
一位Claude用户在max订阅下每天三次用完token额度。受够了这种中断,他设计了一套MCP(模型上下文协议)设置。Anthropic的模型(如Opus)继续担任主模型;定义明确的子任务交给本地运行的Qwen3.8-27B模型,切换在同一个会话和上下文内完成。作者说,这类似于项目中使用子代理的方式。
这套方案的逻辑是:不必为每个小任务消耗云端额度。简单明确的编码工作由本地模型承担,复杂任务仍交给顶级云端模型。省下订阅额度,也不打断工作流。
调用方式很直接。在提示词里输入"Use local agent for..."就能启动本地代理。项目已在GitHub开源(github.com/ccebelenski/localagents)。作者建议让Claude帮助设置MCP本身,降低配置门槛。
硬件要求不低。作者明确表示不提供任何保证或支持,需要相当大的上下文大小和缓存内存才能跑好。他给出的llama-server启动命令包含--batch-size 8192、--reasoning on、--cache-type-k q8_0、--parallel 2等参数。vllm路径几乎没有测试,llama.cpp似乎更稳定。--metrics和--slots参数几乎必需,但没有它们可能也能运行。
评论区里,有人提出子代理的KV缓存重用问题,认为这才是主要痛点。也有人质疑何必继续用Claude Code,觉得GLM等模型更优越。
这套方案没有声称替代云端模型,它只是让简单明确的编码任务不消耗订阅额度。代价是硬件投入和调试成本转移到了用户自己身上。项目页面没有说明能否支持Qwen之外的本地模型。KV缓存重用如何解决、GLM在哪些方面确实超过Claude Code,没有答案。这套设置对非编程任务是否同样有效,也没有说明。