AI Pulse
📡 X 信号

GesoraMeshack实测四款大模型编码能力

GesoraMeshack实测四款大模型编码能力

Hy4 预览版刚刚发布,所以我在 WorkBuddy 上用它和另外三个模型做了测试:DeepSeek V4 Flash、GPT-5.6-Luna,还有 GLM-5.3…它们都是本周 OpenRouter 代码排行榜上前四的模型。

最方便的一点是,它们都可以在 WorkBuddy 里使用,你不需要下载多个 Agent 应用。测试里,我只用了一个提示词,让模型构建一个你肯定在广告里见过的那种游戏:滑动穿过数字门,做计算,最终打败BOSS。

结果相当有意思 👇

这个难度的任务里,除了 DeepSeek 之外,其他所有模型表现都不错。DeepSeek 好像写完代码就没检查bug,游戏没法正常运行。

GPT-5.6-Luna 做出来的游戏能运行,但感觉就像个算术选择题测验,有点无聊。

GLM-5.3 和 Hy4 预览版的表现就亮眼多了。GLM 速度更慢(视频已经加速2.2倍),而且只做了三个移动位置,而 Hy4 支持连续水平移动,速度也更自然。

最让我惊讶的是 Hy4 的游戏设计:除了基础算术,它还添加了可以降低敌人伤害或提升获得点数的武器,让游戏好玩多了。

另外值得一提的是:腾讯的 Sherry 量化把 770B MoE 模型从约 1.5TB BF16 压缩到了 214GB,同时性能还和原始模型接近…让本地部署变得实际多了。

到9月10日为止,你都可以在 WorkBuddy 免费体验 Hy4 预览版。快去试试吧。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新