让GPT-6 Astra全权负责微调项目结果彻底失败
我让 GPT-6 Astra 在 Codex 里全权负责一个类 Jev 的模型微调项目,结果跑完 20 次训练,浪费了两个 Pro 20× 的周额度,项目彻底失败,最后只能废弃。
项目叫 Necro,目标是把 Qwen3.5-0.8B 微调成一个能在本地做分类、条件判断和打分的小模型。实验设计、数据准备、训练和评估,都交给它推进。
最离谱的一次,新开发集的 1,600 条条件题全部答对,换到另一组完整记录上,准确率只有 58.33%。
复盘才发现,训练集和开发集漏掉了相同的情况。比如判断 a ≥ b,它生成的数据只有等于和小于,居然漏掉了大于。实际评估这一类时,16 道题全错。
开发集满分,就这样掩盖了一个检查数据生成逻辑就能发现的问题。
而且整个过程都在反复发生类似的事。修好一种错误,另一项能力又退步,然后继续补数据、继续训练。文档和检查流程写得很细,最关键的数据覆盖却一次次漏掉。最后统一重训,连中间 checkpoint 都没保存,想回头检查训练过程都缺证据。
我觉得 GPT-6 Astra 被过度营销了,实际自主完成任务的能力被吹得太强。它能写代码、调用工具、连续执行很多步骤,但到了需要自己设计实验、判断结果、调整方向的时候,就暴露出非常严重的局限。
把目标交给它之后,我仍然需要替它发现关键问题、判断什么时候该停、什么方向值得继续。这些恰恰是全权负责一个实验最需要完成的工作。
我现在的判断很明确,GPT-6 Astra 根本不具备自主完成这类实验任务的能力。时间和算力花出去了,我得到了一份很长的失败复盘。
这就是 OpenAI 的最强模型。
仓库和完整复盘: Necro 想做一个类似 Jev 的本地判断模型,接口兼容 TypeSafe SDK,也用 Jev 做了评测对照。输入上下文、问题和候选答案,直接输出选择及概率。
我想通过这个项目说明 GPT-6 Astra 的实际局限。它可以把训练流程跑通,把报告写得很完整,却反复漏掉决定实验是否有效的基础问题。每次失败后都能继续给出修复方案,执行下去又暴露新的遗漏。
宣传给我的预期是可以把复杂目标交给它,让它自主推进。实际用下来,连实验设计和结果判断都需要人持续盯着,我觉得这个能力落差太大了。
代码、训练数据、实验产物和各阶段记录都公开了,可以直接看整个失败过程。
连我给定目标的微调实验都做成这样,还想靠它搞 RSI,递归自我改进?训练方案有问题,评估也跟着漏,最后还得人来找原因。我看还是先把自主做实验这件事搞明白吧。