Zai发布GLM-5.3,同基座后训提分翻倍
GLM-5.3 展现了当今最大规模的基础模型中,还有多少能力尚未被发掘,也体现了后训练究竟有多么重要。它和 GLM-5.2 使用的是同一个基础模型(没错,就是同一个)。
智谱称,所有性能提升全部来自后训练的规模化:更多可执行环境、更长任务、更强验证器,以及更多强化学习。
记住:预训练给模型带来知识和基础问题解决能力。后训练则教会模型如何运用这些能力:做规划、调用工具、测试方案、从失败中恢复,以及在长周期中完成工作。
在网络安全评测中,GLM-5.3 在 ExploitBench 上的得分从 24.4% 提升到了 54.4%,两小时内完成了 105 个 ExploitGym 任务,而 GLM-5.2 只能完成 29 个。
它的权重计划在两周后发布。与此同时,未来几周还会有大量其他开源权重模型发布,以下仅举几例:
-DeepSeek v4 Pro
-Qwen3.8 27b
-LTX 2.5
-Nemotron-Lighting
-DeepSeek harness(刚刚发布,但发布的是框架不是模型)
-Muse-Glimmer-30B(刚刚发布)
与此同时,美国已经创建了机密网络安全基准,以及针对「涵盖前沿模型」的自愿预发布流程。
这次发布首先向我表明的一点是:开源模型正持续不断地向前沿水平靠拢。因此,我认为美国政府现在会进一步扩张监管框架,将开源模型纳入其中。
这也是我为什么对 ChatGPT「Astra」的发布更加兴奋。因为这个模型*也*加入了新的(范围更大的)预训练组件,而我们现在已经看到后训练能解锁多少额外能力。
这就是这次发布如此重要的原因:它证明了还有多少领域可以做提升。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖