GPT-6指南把选模型和推理深度写成规则,用户想要自动模式
OpenAI 发布了一份 GPT-6 系列模型指南,涵盖模型选择、推理努力度和工具使用。推理努力度,就是让模型想多深。这是一份使用规则,不是模型发布。
有人看完指南,把它当作预告:推理选项会进普通聊天应用。高兴归高兴,也怕实现起来 bug 满天飞。
更多讨论指向同一个方向:别让人自己选。有人说,如果选模型的指南能写下来,那肯定也能编成程序,模型自己就决定用多少推理。另一个人提议做个前端工具,自动判断当前提示该用哪个模型。还有人更省事:想让 Chat 读一遍指南,按上下文自己设努力水平。这些建议都在要同一个东西:自动模式,把“该让 AI 想多深”从人手里交出去。
使用习惯分化得比想象中明显。有人承认所有任务都开高推理;有人把推理努力度当预算,不全开最高。后一种人算的是同一笔账:额外思考到底在哪能回本,还是只增加等待时间和费用。
在 Codex 上,一个人做业余项目时同时开着 6 个 Luna 实例、全部拉满。他说 5 小时和每周的刷新限额从没接近过。遇到特别奇怪的问题,他把那次任务升级到 Sol 去规划修复。完事再回到“几乎无限”的 Luna 上。还有人好奇,新的推理选项能不能让聊天机器人在长时间角色扮演里不跑偏。
另一批讨论放在指令上。有人提醒,别急着把所有任务都调成高推理。先检查技能配置和项目里的 AGENTS.md 文件。一个更会遵守指令的模型,也会更认真地遵守坏指令。“总是先问”听起来合理,直到它在简单任务里停下来请求五次许可。
有人猜,不少“新模型变差”的抱怨,源头其实在指令上。有些规则帮旧模型表现得更好,现在却绊住新模型。所以有人建议用精简过的指令做对比测试。也有人在找对照实验:拿现有配置和一套更短更清晰的指令比一次。还有一条操作顺序:增加推理努力度之前,先审计指令。看什么算完成、哪些决定需要批准、哪些检查还有必要。
价格也进了讨论。OpenAI 前几天的 500 美元计划一出,有人直接停掉 200 美元/月的 Pro。同一笔钱,转付给了 Anthropic。
版本这边,还有人问,是不是只有自己还在 iOS 上用 5.6。
指南把选模型、调推理从经验判断写成了文字规则。大家想接着把这些规则交给 AI 自己执行。规则能写下来,自动化才有前提;规则没写到的地方,才是误差可能冒出来的位置。