Luna 配的 Codex CLI,让本地 Qwen 反超 Luna
作者自己跑本地大模型,也有 OpenAI 订阅。DeepSeek 最新 flash 版本也试过。
硬件是两张 RTX 3090 加内存,Qwen 3.8 Flash Next 跑得飞快。
但一到严肃工作,本地模型就没法跟 GPT 5.2 比。后来的 5.6 Luna 也一样,它在基准测试里的成绩还更差。
这一次,他让 GPT-5.6 Luna 去配置 Codex CLI,用来跑本地模型。此前,他一直在用 pi.dev 和 opencode。
第一个测试,是用 Codex CLI 跑那个 3D 马里奥 prompt。结果把他惊到了,是到目前为止最好的一次。
随后,他把 Luna 跑了好几天的同一个真实项目拿出来。这次让 Luna 和 Qwen 3.8 Flash Next 并行跑。Qwen 在 Codex CLI 里完成了任务,速度远超 Luna。同一个项目,之前用 Qwen 和 DeepSeek 都跑不出结果。
有评论者写道:用 Luna 配置出让本地模型打败 Luna 的工具,这很诗意。
一半的“模型差”其实是“工具差”
帖子下面最热闹的讨论,落在工具链上。一条高赞评论说,一半的“这个模型不行”帖子,其实是“我的 harness 不行”帖子。另一条评论认为,Codex 作为 harness 被低估了。它开源,开箱就支持开放模型,是出色的编码 harness。
harness 是模型和工作任务之间的那层框架。上下文怎么分配、工具怎么调用、缓存怎么复用,都由它决定。有开发者专门总结过它的破坏力。一个笨重的 harness,一条提示就能毁掉整个上下文窗口。一个带 bug 的 harness 会让 KV 缓存失效,迫使模型从头重新计算全部输入。像 Pi 那样灵活轻量的 harness,则允许你关掉不用的功能。他还说,跑本地模型更偏好轻量、灵活、可扩展、直接、可靠的 harness。Pi 和 dsh 是代表。框架每多一层冗余,都在直接消耗本地的显存和计算时间。
Pi 与 Codex,两种路线
但 Pi 也有自己的拥护者。有评论反问:Pi 轻量,能吸收 Hermes 技能,有专门的 agents 文件。重压缩有效,更新也不破坏配置。Codex 究竟好在哪里?
另一条评论给了个折中判断:Pi 是构建 harness 的好基础。但它不是开箱就能和 Codex 竞争的 harness。这条评论还提到 oh-my-pi 项目,专门在 Pi 的基础上搭出更强的 harness。
也有人的体验完全相反。Pi 和他手里的 ChatGPT、GLM、本地 Qwen 27B 配合都很好。他也试过用 Codex 当 harness,差异不大。Pi 更容易按自己的工作流去配置。这条评论最后怀疑,整个帖子像是对 Codex CLI 的吹捧。
作者没有反驳。他说,也许自己之前用错了 pi.dev。他还问,有没有扩展能把 Pi 带到和 Codex CLI 同等的质量。另一位评论者回应说,pi.dev 的核心本来就是让 agent 自己写需要的扩展。提出需求时,系统提示会带着 agent 去查文档。言下之意,Pi 缺的部分,靠配置也能补。
等待复现
作者还把 pi-smart-web-search 移植成了 Codex 里的技能。效果很好,他计划之后放到 git 上。评论区已经有人请他把运行命令和模型配置公开,让其他人能复现测试。有人说自己已经被 Pi 的配置问题搞到绝望,DeepSeek 在 Pi 里表现糟糕。他想知道作者给 Luna 发了什么指令,Luna 又对 harness 做了哪些改动。也有人追问,Mario 测试是不是用了和之前完全相同的提示和上下文。移植搜索功能时,搜索和抓取的流程有没有改动?作者还没有回复。
除了编程,Codex CLI 也被用在别处。一名评论者用它配本地模型做角色扮演,角色一致性优于 Pi 或 OpenAI 订阅。长对话尤其明显。
整场讨论的重心,不是哪个模型赢了,而是该让哪个 harness 来指挥。作者用 Luna 配置出的 Codex CLI,让 Qwen 反超了 Luna。Pi 的支持者则强调轻量框架和可定制性的价值。两边说到的其实是同一件事:模型没变,变的是上下文窗口、缓存和工具交互方式。工具链和模型之间的分界线,比多数人以为的更值得检查。