一次浏览器代理任务的成本,从36.21美元降到0.47美元
一次任务从36美元到不到半美元
自动抓网页这类浏览器代理任务,AI跑起来不便宜。Asana的客户在StackAI上跑这类任务。StackAI是Asana收购的平台,不用写代码就能构建自动化工作流。优化之前,跑一次至少要花36.21美元,耗时至少22.5分钟。有些运行还没跑完就触发了步骤上限。
优化后的浏览器代理工作流跑在GPT-6.1 Sol上,平均每次运行花0.47美元、约4分钟。比原来的生产设置便宜76倍、快5倍。项目由StackAI首席技术官Frank Hidalgo博士主导。同样的优化用在原来的模型上,成本降到每次1.24美元。相比原来的至少36.21美元,降了29倍。
问题出在缓存策略
GPT-6 Astra检查后发现,代理只缓存了固定指令和工具定义。不断增长的页面文本和截图历史不在缓存里,每次请求都要按全价重新发送越来越长的历史。代理还几乎在每一步丢弃旧截图、修剪文本,历史频繁变化,缓存整个历史也没用。丢失的事实甚至可能让代理重新访问已经读过的页面。
修复集中在三个方向:把缓存扩展到浏览历史、增加文本保留量、把截图移除改成批量进行。测试下来最有效的组合是:截图先累积到20张,再一次性削减到最近一张。这样历史能在更长时间里保持不变。
144次运行的验证
验证过程是一场144次运行的对照实验。四个模型参与:GPT-6.1 Sol,以及模型A、B、C。三个模型的具体名称没有公开。模型A来自另一个前沿实验室,型号更小,2025年秋季发布,价格是GPT-6.1 Sol的一半。模型B是生产中原用的型号,与模型A同一实验室,2026年夏季发布,价格和GPT-6.1 Sol相同。模型C是模型B的更新版,2026年秋季发布,价格也一样。
每个配置执行相同任务:从一个公开演示目录收集32本书的六个字段。这代表部分Asana客户在StackAI里实际跑的工作负载。历史预算设12万和48万字符两档,六种缓存和截图策略,每种组合在每个模型上各跑三次。
在GPT-6.1 Sol上,单靠更大的历史预算和新的缓存、截图策略,成本降了4倍。从1.97美元降到0.47美元。更大的历史预算让GPT-6.1 Sol从18次里出3次答案,变成18次全部给出正确答案。每次调用便宜约3倍,因为89%的输入来自缓存,缓存价格只有未缓存价格的5%。这轮验证只覆盖浏览器自动化一类任务,更复杂场景的表现如何,还没有数据。
AI动手,工程师审查
这次优化本身大部分是AI干的。Hidalgo估计,纯手工需要1到2个月。他在Codex里用GPT-6 Astra做实验,晚上设定目标,早上审查结果,大约一周完成。Astra运行工作流、查看请求和输出,另有独立的模型会话复查。它还重构了代码,让一个前端和后端能并行支持多个工作流,各带各的设置。所有会话的请求、数据痕迹和结果都记录在Asana的软件交付平台Command上。团队事后可以完整复盘。发现转成工单,再变成拉取请求,改动进入生产。
Asana首席产品官Arnab Bose这样概括整个过程:“工程师定方向,GPT-6 Astra跑实验,结果通过Command进入生产,这是人类和代理团队协作在实践中的样子。” Hidalgo补充说,成本过去限制了公司能给客户提供哪些模型。代理更高效之后,可以给客户更好更快的模型,同时降低运营成本。
已上线,下一步交给客户
改动已经上线。Asana发布了StackAI中浏览器导航的变更,正在开发工具让类似实验更容易重复。它还计划把这类测试纳入平台评估。客户和内部团队配置代理时,可以比较成本、运行时间和答案质量。Asana自己也用GPT-6 Astra在Codex里测试产品功能。Astra在平台上导航、尝试不同输入,把错误报告给人类QA审查。Hidalgo把这视为新软件开发流程的基础:许多云代理会话并行测试功能。他说,交付速度不再是瓶颈,人类的注意力才是。他们正在接近一个每个工程师都是项目经理、领导一群代理的世界。