AI Pulse

Luna 配的 Codex CLI,让本地 Qwen 反超 Luna

作者自己跑本地大模型,也有 OpenAI 订阅。DeepSeek 最新 flash 版本也试过。
硬件是两张 RTX 3090 加内存,Qwen 3.8 Flash Next 跑得飞快。
但一到严肃工作,本地模型就没法跟 GPT 5.2 比。后来的 5.6 Luna 也一样,它在基准测试里的成绩还更差。
这一次,他让 GPT-5.6 Luna 去配置 Codex CLI,用来跑本地模型。此前,他一直在用 pi.dev 和 opencode。
第一个测试,是用 Codex CLI 跑那个 3D 马里奥 prompt。结果把他惊到了,是到目前为止最好的一次。
随后,他把 Luna 跑了好几天的同一个真实项目拿出来。这次让 Luna 和 Qwen 3.8 Flash Next 并行跑。Qwen 在 Codex CLI 里完成了任务,速度远超 Luna。同一个项目,之前用 Qwen 和 DeepSeek 都跑不出结果。
有评论者写道:用 Luna 配置出让本地模型打败 Luna 的工具,这很诗意。

一半的“模型差”其实是“工具差”

帖子下面最热闹的讨论,落在工具链上。一条高赞评论说,一半的“这个模型不行”帖子,其实是“我的 harness 不行”帖子。另一条评论认为,Codex 作为 harness 被低估了。它开源,开箱就支持开放模型,是出色的编码 harness。

harness 是模型和工作任务之间的那层框架。上下文怎么分配、工具怎么调用、缓存怎么复用,都由它决定。有开发者专门总结过它的破坏力。一个笨重的 harness,一条提示就能毁掉整个上下文窗口。一个带 bug 的 harness 会让 KV 缓存失效,迫使模型从头重新计算全部输入。像 Pi 那样灵活轻量的 harness,则允许你关掉不用的功能。他还说,跑本地模型更偏好轻量、灵活、可扩展、直接、可靠的 harness。Pi 和 dsh 是代表。框架每多一层冗余,都在直接消耗本地的显存和计算时间。

Pi 与 Codex,两种路线

但 Pi 也有自己的拥护者。有评论反问:Pi 轻量,能吸收 Hermes 技能,有专门的 agents 文件。重压缩有效,更新也不破坏配置。Codex 究竟好在哪里?

另一条评论给了个折中判断:Pi 是构建 harness 的好基础。但它不是开箱就能和 Codex 竞争的 harness。这条评论还提到 oh-my-pi 项目,专门在 Pi 的基础上搭出更强的 harness。

也有人的体验完全相反。Pi 和他手里的 ChatGPT、GLM、本地 Qwen 27B 配合都很好。他也试过用 Codex 当 harness,差异不大。Pi 更容易按自己的工作流去配置。这条评论最后怀疑,整个帖子像是对 Codex CLI 的吹捧。

作者没有反驳。他说,也许自己之前用错了 pi.dev。他还问,有没有扩展能把 Pi 带到和 Codex CLI 同等的质量。另一位评论者回应说,pi.dev 的核心本来就是让 agent 自己写需要的扩展。提出需求时,系统提示会带着 agent 去查文档。言下之意,Pi 缺的部分,靠配置也能补。

等待复现

作者还把 pi-smart-web-search 移植成了 Codex 里的技能。效果很好,他计划之后放到 git 上。评论区已经有人请他把运行命令和模型配置公开,让其他人能复现测试。有人说自己已经被 Pi 的配置问题搞到绝望,DeepSeek 在 Pi 里表现糟糕。他想知道作者给 Luna 发了什么指令,Luna 又对 harness 做了哪些改动。也有人追问,Mario 测试是不是用了和之前完全相同的提示和上下文。移植搜索功能时,搜索和抓取的流程有没有改动?作者还没有回复。

除了编程,Codex CLI 也被用在别处。一名评论者用它配本地模型做角色扮演,角色一致性优于 Pi 或 OpenAI 订阅。长对话尤其明显。

整场讨论的重心,不是哪个模型赢了,而是该让哪个 harness 来指挥。作者用 Luna 配置出的 Codex CLI,让 Qwen 反超了 Luna。Pi 的支持者则强调轻量框架和可定制性的价值。两边说到的其实是同一件事:模型没变,变的是上下文窗口、缓存和工具交互方式。工具链和模型之间的分界线,比多数人以为的更值得检查。

阅读原文
📚 相关主题 大语言模型开源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新