AI Pulse
📡 X 信号

智谱发布GLM-5.3,基础模型居然没换

智谱发布GLM-5.3,基础模型居然没换

GLM-5.3 VS GLM-5.2 - 3D model of R2-D2 GLM-5.3 目前看来前景相当不错

GLM-5.3 发布了,看了一下,着重提升的主要是两部分:
1. 安全能力:看来 Hugging Face 在拿 GLM-5.2 防御了 OpenAI 的模型入侵以后,智谱也看到了这方面的价值,尤其是大家最近都在聊这块,他们针对性地做了一些优化。
2. 长程任务的执行: 比如终端里的任务、工具调用,以及大代码库的修复任务,都有非常大的提升。

这个模型依然是只进行了后训练,没有重新进行预训练。这都几个版本了,还能有这么大的提升,确实猛啊!

事件:智谱刚刚发布了 GLM-5.3,它最大的飞跃可能在网络安全领域。

743B 基础模型和 GLM-5.2 相比(居然)完全没有变化。智谱表示,提升完全来自于在更多环境、多样任务和长周期工作流上扩大后训练规模。

它的成果:
- Terminal-Bench 3.0:4.6 → 28.3
- CyberGym:77.2% → 84.5%
- ExploitBench:24.4% → 54.4%

该公司表示,GLM-5.3 已经能够在漏洞利用的多个阶段进行推理,构建完整攻击链,速度比研究人员预期的还要快。

这次发布后,我不幸预计美国政府会对开源进行监管。疯狂的发布!

突发,智谱正式发布 GLM-5.3🔥
这次 GLM-5.3 的重点非常明确:继续强化 Coding 和 Agent,而且在部分 Agent Benchmark 上,已经直接超过 GPT-5.6 Sol、Fable 5 和 Kimi K3。

官方公布了 9 项 Benchmark。其中 GLM-5.3:
AutomationBench 48.2,超过 Kimi K3 46.7、Fable 5 46.2、GPT-5.6 Sol 45.8。

CyberGym 84.5,同样超过 Kimi K3 80.0、Fable 5 83.8 和 GPT-5.6 Sol 83.6。

GDPVal-AA v2 达到 1769,也超过 Fable 5 的 1743 和 GPT-5.6 Sol 的 1730。

更值得关注的是 GLM-5.3 相比 GLM-5.2 的提升。
Terminal Bench 3.0:4.6 → 28.3
DeepSWE:46.2 → 66.9
AutomationBench:26.2 → 48.2
HLE w/ Tools:54.7 → 62.5
ExploitBench:24.4 → 54.4
ExploitGym:39 → 130

尤其 Terminal Bench、AutomationBench 和 ExploitBench,已经不是几个点的常规迭代了。

而 GLM-5.2 才在 6 月 16 日发布。也就是说,两个月不到,智谱又把旗舰模型往前推了一代。

昨天 DeepSeek 刚发布 V4 Pro 0813,今天 GLM-5.3 就来了。

国产旗舰模型的新一轮正面竞争,已经从模型本身的 Benchmark,越来越集中到了 Coding、工具调用、长程任务和 Agent 执行能力上。

GLM-5.3现已通过GLM Coding Plan和ZCode提供。API访问和开放权重将分阶段发布,并在严格的安全评估后推出。

隆重介绍 GLM-5.3 —— 现已登陆 ZCode。今日向所有用户开放推送。我们还为所有 Coding Plan 用户重置了配额:5 小时限额和周用量都已归零。新用户可以在免费层级体验 GLM-5.3,无需订阅。了解更多:获取 ZCode:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新