AI Pulse
📡 X 信号

实测GPT-6 Astra,5小时复刻CS,之前K3调了一周没成

实测GPT-6 Astra,5小时复刻CS,之前K3调了一周没成

GPT-6 Astra 上 ZenMux 了。这次我有个很具体的体验:5 小时,复刻 CS。

之前拿 K3 调了一周,效果一直不太理想。这次换 Astra,主提示词就是复刻 CS 冰雪地图,后面又微调了 10 轮左右,最后做成了视频里这样。

说实话,这个进步确实有点震撼。尤其是同一个项目自己已经折腾过一遍,对哪里容易卡住、哪里总是改不满意,心里都有数。换个模型再做,差距就很直观了。

复刻游戏也挺适合拿来测 coding。目标明确,有现成的参考,最后还得亲自上手验收。代码交出来以后,功能能不能一起跑、改完这里会不会影响那里,都得在实际操作里过一遍。微调那十来轮,本身也是测试的一部分。

ZenMux 这次接入 Astra,正好给手里有项目的人多了一个选择。

它支持一个 key 切模型,做这种对比很方便:把需求和验收标准固定下来,分别交给不同模型跑,再看完成效果、修改轮数、token 消耗和实际费用。尤其是手上那些反复改了几天还没满意的任务,很适合拿来试新模型,问题和难点都是现成的。

我觉得 coding 模型的成本也该这么看。一次调用的价格只是一项,整个任务需要重试多少次、自己要花多少时间检查和纠正,同样影响最后的开销。具体到自己的项目,跑完一轮才有答案。这次 CS 的开发耗时让我感受很明显,API 费用的差异则还需要单独测。

这次上线,ZenMux 还配了限时充值活动:

充 $50 得 $70,额外送 $20。

充 $100 得 $150,额外送 $50。

活动限 7 天,每个账号限兑一次。

手头正好有 coding 或 agent 任务要跑的,可以趁这次活动试一下。我这次交的是 CS,大家也可以拿一个之前没调满意的项目,看看 Astra 能做到哪一步。

入口:

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新