大佬分享了一个能省大钱的本地AI工作流,核心理念是用高端AI模型当顾问,由本地模型负责执行具体任务,这样既能借助顶级模型的推理能力,又能大幅降低API调用费用,同时支持远程查看进度,让工作可以通宵运行直到完成[1]

这套工作流的具体实现可以借助Hermes Agent这类工具。在本地部署Hermes Agent,连接Claude Opus 4.8或ChatGPT 5.5等高端模型作为顾问,通过Telegram消息集成接收任务和反馈,让代理自动执行晨间简报、夜间应用原型生成以及LoRA定制内容创作等操作,从而把高端模型的高额调用限制在关键决策环节,日常执行由本地模型承担[4]

模型搭配需要根据任务灵活切换。轻量级任务例如消息回复或简单查询,可以用Gemma 4或Qwen 3.6等本地模型,追求速度和低成本;复杂推理、战略规划或高质量输出时,再调用Claude 5 Fable这类更强但更贵的模型。这种组合策略平衡了模型质量、调用成本、响应速度和数据隐私[18]

工作流长时间运行最怕中断丢失进度。SnapState工具只需在每步末尾加一行 client.save(),就能自动保存带时间戳和完整数据的检查点,进程崩了或电脑重启后可以精准回退到上一步继续,连中间变量都不丢。这避免了重复计算带来的额外成本,对于需要通宵跑的任务尤为重要[7]

控制成本还需要像管理投资组合一样管理AI支出。先定义“足够好”的标准,对高频高价值工作流追踪总成本,包括模型费、尝试次数、完成率和人工审核成本。把AI投资分为广泛生产力工具、特定功能工作流和战略性部署三个层次,集中建设共享能力如身份认证、模型路由和评估工具,避免重复投入[11]