AI Pulse
📡 X 信号

让GPT-6 Astra全权负责微调项目结果彻底失败

我让 GPT-6 Astra 在 Codex 里全权负责一个类 Jev 的模型微调项目,结果跑完 20 次训练,浪费了两个 Pro 20× 的周额度,项目彻底失败,最后只能废弃。

项目叫 Necro,目标是把 Qwen3.5-0.8B 微调成一个能在本地做分类、条件判断和打分的小模型。实验设计、数据准备、训练和评估,都交给它推进。

最离谱的一次,新开发集的 1,600 条条件题全部答对,换到另一组完整记录上,准确率只有 58.33%。

复盘才发现,训练集和开发集漏掉了相同的情况。比如判断 a ≥ b,它生成的数据只有等于和小于,居然漏掉了大于。实际评估这一类时,16 道题全错。

开发集满分,就这样掩盖了一个检查数据生成逻辑就能发现的问题。

而且整个过程都在反复发生类似的事。修好一种错误,另一项能力又退步,然后继续补数据、继续训练。文档和检查流程写得很细,最关键的数据覆盖却一次次漏掉。最后统一重训,连中间 checkpoint 都没保存,想回头检查训练过程都缺证据。

我觉得 GPT-6 Astra 被过度营销了,实际自主完成任务的能力被吹得太强。它能写代码、调用工具、连续执行很多步骤,但到了需要自己设计实验、判断结果、调整方向的时候,就暴露出非常严重的局限。

把目标交给它之后,我仍然需要替它发现关键问题、判断什么时候该停、什么方向值得继续。这些恰恰是全权负责一个实验最需要完成的工作。

我现在的判断很明确,GPT-6 Astra 根本不具备自主完成这类实验任务的能力。时间和算力花出去了,我得到了一份很长的失败复盘。

这就是 OpenAI 的最强模型。

仓库和完整复盘: Necro 想做一个类似 Jev 的本地判断模型,接口兼容 TypeSafe SDK,也用 Jev 做了评测对照。输入上下文、问题和候选答案,直接输出选择及概率。

我想通过这个项目说明 GPT-6 Astra 的实际局限。它可以把训练流程跑通,把报告写得很完整,却反复漏掉决定实验是否有效的基础问题。每次失败后都能继续给出修复方案,执行下去又暴露新的遗漏。

宣传给我的预期是可以把复杂目标交给它,让它自主推进。实际用下来,连实验设计和结果判断都需要人持续盯着,我觉得这个能力落差太大了。

代码、训练数据、实验产物和各阶段记录都公开了,可以直接看整个失败过程。

连我给定目标的微调实验都做成这样,还想靠它搞 RSI,递归自我改进?训练方案有问题,评估也跟着漏,最后还得人来找原因。我看还是先把自主做实验这件事搞明白吧。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新