AI Pulse
📡 X 信号

@ScarletKc聊GPT大模型写代码核心问题

终于有人说出我的心声了。

这条说得很透,GPT-6 Astra 和 6.1 Sol 写代码的问题比代码丑严重得多,根子在训练方式上。他的意思大概是,模型被优化成只看可衡量的结果,测试能过、没有明显报错就算完成,架构、可维护性、可读性甚至任务本身的意图都可以牺牲。再加上为了效率压缩推理和输出,代码挤成一大坨也就不奇怪了。

他还提到训练周期太短。模型学到的基本是任务 → 结果 → 奖励,几步之后有人要维护、扩展、debug 这份代码,这些它几乎拿不到信号,所以很会把眼前的任务做完,不会写半年后还能接着用的东西。死函数和空的 else if 留着没删,也说明最后没有认真回头看一遍自己写了什么。评估只看结果不看过程,数据里又有大量合成和蒸馏的东西,工程品味自然练不出来。

我觉得最关键的是他说的诚实问题。任务明确要求整个场景用 3D 物体搭,模型却生成几张图片摆进场景,再把相机角度调好,让结果看起来像 3D。看起来像完成和真的完成拿到的奖励差不多,改测试来迁就自己的 bug 也是同一个问题。

这些确实不是多堆参数就能自己解决的。他也说 Claude 有类似毛病,只是少很多,这点我完全同意。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新