开发者分享经过实战测试的多AI工作流升级方案
过去几周,我的工作流又迎来了一轮重大升级,我会在这里详细介绍。改进主要来自三点:1. 稳定了我对模型的选择;2. 用一个firstmate控制多台机器;3. 基于配额和复杂度感知的任务路由。
这套设置经过了我长时间的实战测试,非常实用,我相信很多人现在就能轻松从中受益,它不是那种只停留在纸面上好看的花哨玩具。
开始吧——
---- 设备 ----
我有一台macbook、一台mac mini、一台iphone和几台hetzner VPS,所有设备都在同一个tailscale子网里,它们互相都授权了ssh密钥,所以可以自由连接(除了VPS不能主动连接到我的本地设备)。
---- firstmate ----
如果你看过我其他的帖子,你应该已经知道我在使用一个叫firstmate的工具——它是一个单一代理,由我直接交互,帮我管理其他所有代理——不过下文提到的概念都是通用的,如果你愿意,完全可以在你自己的技术栈里复现。
我的firstmate运行在macbook上。大多数时候,它放在我的桌上,连接着我的鼠标、键盘和显示器,但如果我需要出门,我可以直接带着它走。在这里运行firstmate意味着我始终可以直接访问它,不需要依赖任何远程连接。
我的firstmate使用grok 4.5(除非我配额用完了,才会换成opus 4.8),这是我经过大量实验后做出的谨慎选择。
核心逻辑是,作为我直接交互的主编排代理,firstmate能从几个特性中获益:
- 快速:纯grok 4.5甚至比claude和gpt的快速模式还要快。它可能是唯一一个我按下回车后就能立即开始流式返回响应的顶级模型
- 长度合适的上下文窗口:500k实际上是一个非常好的平衡点,足够支持长上下文,又不会太贵,也不会产生太多噪音
- 出色的技术判断:用gpt 5.6的时候,所有东西都会被过度设计。用opus 5的时候,它不理解上下文就直接下结论,会犯各种各样的错误。目前只有fable 5、grok 4.5和kimi k3能帮我把事情保持在正轨上,清楚什么时候该提问、什么时候该继续推进。但fable和k3都太贵了
- 聊天体验舒适:grok可能是目前最不废话的模型了。opus 5在这一点上表现很差。
我用grok 4.5的主要问题是,300美元的supergrok重度订阅给的token量,甚至比不上anthropic和openai 200美元的订阅,所以我的grok token总是不够用。
---- second mates ----
我的firstmate不会直接管理所有crewmate,那样它会太忙,没法好好和我交互。相反,我给每个长期任务都配了一个second mate——比如,开发firstmate本身由一个second mate管理,而我所有的iOS应用开发归另一个second mate管。
默认情况下,second mate和firstmate设置在同一台机器上,但因为编译iOS应用非常吃CPU,我把负责iOS的second mate放到了我的mac mini上,这台mac mini无人值守放在架子上,所以它永远不会和我的交互体验争抢资源。
我在firstmate里内置了通过ssh管理远程second mate的支持,才让这一切成为可能。我选择在second mate层级而不是crewmate层级实现远程支持,是为了降低连接断开带来的影响。当我合上macbook的盖子时,second mate可以继续监督运行在我mac mini上的crewmate。
远程second mate是一个重大升级,它让我可以扩展硬件资源,同时不影响我只需要和一个代理对接所有事务的体验。
我所有的second mate都运行opus 4.8,原因如下:
1. supergrok重度订阅的配额实在太少了。如果我每个second mate都用grok 4.5,我很快就会把配额用完
2. opus 4.8在速度、成本和智能三者之间是下一个最佳平衡点
3. 我试过用opus 5和gpt 5.6做second mate——它们同样有技术判断糟糕的问题,把所有事情都搞成一团糟,而且它们搞不清楚什么时候该升级给我做决定,什么时候该自己推进,经常自作主张。
---- crewmates ----
当我的firstmate和second mate需要分发实际工作时,它会根据几个条件选择用哪个模型:
- 硬性能力要求
- 任务的模糊程度
- 我的配额剩余情况
需要生成图片的任务永远会路由给带gpt 5.6 sol的codex。OpenAI的图像模型绝对是顶级的。
需要生成视频,或者需要实时信息的任务,永远会路由给grok 4.5的grok build。目前它是唯一一个开箱就能支持这些功能的组合。
需求已经明确的错误修复和小功能开发工作,会根据我的哪个订阅剩余配额最多,分配给以下模型之一:
- gpt 5.6 luna
- sonnet 5
需求不明确、需要调查的任务会分配给以下模型(同样取决于配额):
- gpt 5.6 sol
- opus 5
高度复杂的规划任务会分配给以下模型(需要我的明确批准,因为它们很贵):
- fable 5
- kimi k3
firstmate原生支持智能任务路由,所以我基本上只需要把上面这些规则告诉firstmate,它就知道在分发crewmate的时候遵守了。配额数据来自quota-axi,这个工具也可以脱离firstmate独立使用。
我的大部分代码变更都会通过no-mistakes做验证,这里我用medium推理模式的gpt 5.6 sol。这才是gpt真正擅长的地方——它非常彻底,能很好地捕捉到边界案例。
我用这套设置完成了大量工作,整体上非常满意——希望这份分享对你来说是有用的参考!
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖