GPT-6三款怎么选?缓存让输入token成本最多降95%
GPT-6 是我们迄今最先进的模型系列,为不同类型的工作提供了多种选择。无论你是在把想法变成可运行的原型、构建并测试功能,还是在跨代码仓库、数据库和外部 API 编排多步骤工作流,本指南都会教你如何选择 GPT-6 模型、给出有效指令、管理长期运行的工作并做好生产准备。
核心要点
- 在生产中高效运行:使用缓存(caching)和压缩(compaction)管理上下文和成本;衡量任务成功率和延迟,并为监控和数据控制做好规划。
- 让模型匹配工作负载:选择适合任务的模型、推理强度(reasoning effort)和速度,在能力、成本和延迟之间取得平衡。
- 调整提示词和技能:保持提示词、技能和仓库指令在“模型应交付什么、能独立做什么、什么算完成”上保持一致。
- 让长期运行的工作保持在正轨上:使用 steering(中途指导)、异步工具和委派来处理更新和独立工作;明确模型何时应向你请示。
1. 高效地投入生产
为生产环境准备你的工作流
在部署之前,有几点检查和最佳实践需要落实。
时刻考虑效率。去掉任务不需要的上下文,同时保留必要的证据。在应用支持的情况下,把独立的任务合并并行运行,这样某个慢步骤就不会阻塞无关工作。
通过提示词缓存(prompt caching)复用共享上下文,适用于重复性工作。缓存输入 token 的成本比未缓存输入 token 最多可低 95%(视模型而定)。把稳定的指令和参考资料放在会变动的任务细节之前,并保持工具定义一致。缓存仪表盘和诊断指南可以帮助你发现哪些地方复用中断。在估算完整工作流的成本时,记得计入缓存写入和长上下文费率。
对于更长的对话,压缩(compaction)可以在保留继续所需状态的同时缩小上下文体积。
决定如何监控模型行为,并检查你应用的数据控制措施。
部署前先测试:运行代表性任务,衡量任务成功率、延迟和每次成功任务的成本。可参考我们的 API 部署检查清单。
为工作负载匹配合适的模型
可以把模型选择和推理强度看作一个“智能/价格”权衡。
模型:
- GPT-6 Astra 用于最困难的推理工作,需要最大智能的场景。
- GPT-6.1 Sol 用于复杂的编码、研究和计算机操作。
- GPT-6 Luna 用于大规模聚焦任务和日常重复性工作,目标明确,例如提取发票字段、请求分类或生成结构化摘要。
评估哪个模型最适合任务时,可对比各模型的定价。
推理强度(Reasoning level):在 API 中,选择模型在任务上投入多少精力。
- 低(Low):常规任务,如提取事实或做小幅编辑。
- 中(Medium):需要判断力的工作,如规划功能或比较选项。
- 高(High):困难的调试、深入分析或仔细审查。
- 超高 / 最高(Extra high / Max):当 High 不够用时,在支持的范围内测试这些级别,只有在改善效果证明增加的时间和成本合理时才保留。
在 Codex 中,从该模型的默认推理强度开始,然后在简单任务上降低,或在需要更深入分析时提高。
速度:
- 在 API 中,当响应时间很重要时(例如聊天应用或编码工具),使用 Fast 模式。它相对于标准处理,提供更快、更一致的响应时间,但每 token 成本更高。
- 在 Codex 和 API 中,当更快的响应值得付出额外成本时(例如快速编码迭代),使用 Ultrafast。它独立于推理强度来加速 token 生成。适用于 GPT-6 Astra。
2. 调整提示词和技能
> 给模型一个清晰的任务——Eric Provencher,OpenAI 开发者体验团队
从一个明确的任务描述开始:期望的结果、为谁做、相关背景和约束,以及什么算“完成”。然后回顾以下四个领域(总结了 Rethinking skills and prompts for GPT-6 Astra 一文的要点),深入了解如何更新你的指令:
- 创建更好的技能:描述保持简短,明确每个技能何时运行;只在需要时加载支持细节;用适合你团队所用模型的指导来取代僵化的固定流程。
- 更新你的 AGENTS.md:说明特定文档和测试何时相关,并显式授权安全的常规工作流,例如使用一次性数据、无生产访问权限地运行本地测试。
- 设定决策边界:说明哪些操作可以独立进行,哪些需要批准;用清晰的边界取代一概“总是询问”的做法。
- 对持久性(persistence)做出明确要求:定义“完成”包含哪些内容——实现更改、运行、检查结果、修复失败——并指出哪些决策需要你审核。
明确你需要的输出
无论你是在 Codex 中工作,还是基于 API 构建,都要指明模型可以自行做哪些决策、何时应向你请示,以及一个有用的响应应该是什么样子。
给模型足够的指示,让工作持续推进,而不用在重要决策上猜测。告诉它可以做哪些选择,以及何时需要请你提供意见。例如,它可以自行决定如何组织摘要,但在更改项目范围之前应与你确认。描述一个有用的响应是什么样的,例如:使用通俗的语言,技术细节适合你的受众,并附上简短的交接说明,涵盖更改了什么、检查了什么、还有哪些需要注意。
3. 优化长时间运行的任务
保持复杂工作推进
GPT-6 系列模型让你能够承担持续数小时甚至数天的任务。利用以下功能,可以更好地管理代理(agent)在长时间运行任务上的表现。
API
在 API 中,使用 steering(中途指导)、异步工具和并行工作来保持长时间运行的任务持续推进。
- 在运行过程中更新指令:Mid-turn steering(中途转向)允许你在模型工作时通过 Responses WebSocket API 发送纠正。更新会排队,不会取消正在运行的工具,也不会撤销已完成的动作。
- 在工具运行时保持工作:异步工具调用(Asynchronous tool calling)允许你在应用运行较慢任务(如测试)时,模型继续独立的操作。你的应用在准备好时返回结果。在开始依赖该结果的工作之前,请先等待结果。
- 委派独立的子任务:GPT-6.1 Sol 在 Responses API 中支持多代理工作流。它可以将独立工作分配给子代理(例如,分别调查代码库的不同部分),并将它们的发现合并为最终响应。多代理目前处于 beta 阶段。
Codex
长时间运行的任务可能会暴露出你在初始提示中无法预料的决策。使用澄清和 steering 来让工作保持在正确的方向上。
- 在工作进行中回答问题:借助 GPT-6 Astra,Codex 可以在工作时请求澄清。优先解决影响下一步的问题,并说明在你做决定时哪些独立工作可以继续进行。如果你要离开,请告诉 Codex 哪些任务可以继续,以及何时应暂停等待你的答复。
- 在需求变化时调整工作方向:用新信息来引导当前任务,说明哪些应该改变、哪些应该保持不变。这有助于避免在一个已无法满足需求的方向上继续投入时间。
借助计算机操作(Computer Use)做更多事情
Computer use(计算机操作)允许 GPT-6 Astra、GPT-6.1 Sol 和 GPT-6 Luna 直接与网页和桌面应用交互,即使这些应用没有 API。例如,你可以让模型调查一个 bug,修复代码,然后在浏览器中打开你的产品来检查修复是否生效。
选择最简单可靠的方法来执行每个步骤:
- 当 API 或连接的工具能直接完成任务时,优先使用 API 或工具。
- 当模型需要为你读取屏幕、点击按钮或填写表单时,使用 computer use。
如果你正在将自己的应用集成 computer use,为模型提供一个可以运行代码来控制浏览器或桌面的工具。Playwright 可用于浏览器;PyAutoGUI 可用于桌面应用。