AI Pulse
📡 X 信号

两款开源大模型实测对比,GLM-5.3-Flash最终2-1获胜

两款开源大模型实测对比,GLM-5.3-Flash最终2-1获胜

我在自己正在构建的智能体测试框架上,用完全相同的任务测试了 GLM-5.3-Flash 和 DeepSeek-V4.1-Flash:
- 代码审查
- 移动端审查
- 改进计划

随后我对照代码验证了每个模型得出的所有结论。谁是赢家?

▶️ 代码审查项目,GLM 5.3 Flash 胜出。GLM 用时 27 分钟,读取了 35 个文件,执行了 27 次搜索。DeepSeek 用时 45 分钟,运行了 55 个 shell 命令。DeepSeek 提出了 23 个问题,GLM 提出了 10 个。两者的发现大约都有 60% 是正确的。所以 DeepSeek 确实发现了更多真实问题,但也发现了更多错误问题。不过这不是决定胜负的因素。GLM 最重要的发现是正确的,DeepSeek 最重要的发现是错误的,这就是 GLM 5.3 Flash 在代码审查项目获胜的原因。

▶️ 移动端审查项目,DeepSeek-V4.1-Flash 胜出。它发现了一个 bug:当消息开始排队时,编辑器会变得无法使用。GLM 当时屏幕上正好显示了这个组件,但对它问了错误的问题,然后就跳过了。另外,我的提示词明确告诉两个模型,外观和体验非常重要。结果 GLM 查看了 14 张截图,DeepSeek 一张都没看。

▶️ 改进计划项目呢?这局还是 GLM 5.3 Flash 胜出。GLM 覆盖范围更广,优先级排序也更合理。它一共给出了 33 项改进,每一项都评估了规模并正确排序。DeepSeek v4.1 Flash 只给出了 14 项。虽然其中少数几项分析更深入,但它几乎没在 UI 和性能上花功夫,而这正是我要求的四项中的两项。两者的思考本能也不同。GLM 会主动寻找那些已经完成一半但从未连接的部分。DeepSeek 则范围狭窄,追求量化,它主张我应该先构建一个衡量改进的方法,再落实它提出的任何想法。这轮测试中,两者的结论都准确。我验证了每一条结论。

那么哪个更好?🥇 GLM 5.3 Flash 以 2-1 总比分获胜。它校正更好,速度大约快 1.3-1.7 倍,而且它知道什么时候工具本身出了问题。🥈 DeepSeek v4.1 Flash 感觉更「尖锐」,也更容易对自己刚得出的测量结果自信地犯错。对我来说,GLM 5.3 Flash 就是我日常会使用的那个。

本次测试基于 76500 行代码,共 126 个文件。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新