GesoraMeshack实测四款大模型编码能力
Hy4 预览版刚刚发布,所以我在 WorkBuddy 上用它和另外三个模型做了测试:DeepSeek V4 Flash、GPT-5.6-Luna,还有 GLM-5.3…它们都是本周 OpenRouter 代码排行榜上前四的模型。
最方便的一点是,它们都可以在 WorkBuddy 里使用,你不需要下载多个 Agent 应用。测试里,我只用了一个提示词,让模型构建一个你肯定在广告里见过的那种游戏:滑动穿过数字门,做计算,最终打败BOSS。
结果相当有意思 👇
这个难度的任务里,除了 DeepSeek 之外,其他所有模型表现都不错。DeepSeek 好像写完代码就没检查bug,游戏没法正常运行。
GPT-5.6-Luna 做出来的游戏能运行,但感觉就像个算术选择题测验,有点无聊。
GLM-5.3 和 Hy4 预览版的表现就亮眼多了。GLM 速度更慢(视频已经加速2.2倍),而且只做了三个移动位置,而 Hy4 支持连续水平移动,速度也更自然。
最让我惊讶的是 Hy4 的游戏设计:除了基础算术,它还添加了可以降低敌人伤害或提升获得点数的武器,让游戏好玩多了。
另外值得一提的是:腾讯的 Sherry 量化把 770B MoE 模型从约 1.5TB BF16 压缩到了 214GB,同时性能还和原始模型接近…让本地部署变得实际多了。
到9月10日为止,你都可以在 WorkBuddy 免费体验 Hy4 预览版。快去试试吧。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖