Z AI发布GLM-5.3,评测得分追平Kimi K3
GLM-5.3 在 Artificial Analysis Intelligence Index 上取得了60分的成绩,与 Kimi K3 持平,比 GLM-5.2 提升了7分。一旦权重发布,它就会并列成为领先的开放权重模型。
@Zai_org 刚刚发布了 GLM-5.3,按照 Z AI 的规划发布权重后,它将和 Kimi K3(60分)并列成为 Artificial Analysis Intelligence Index 上最智能的开放权重模型。
在 Kimi K3 和 GLM-5.3 的推动下,开放权重模型的前沿水平已经比以往任何时候都更接近闭源专有模型的前沿。
GLM-5.3 保持了 GLM-5.2 的参数量规模:总参数7530亿,激活参数400亿。Z AI 团队透露,GLM-5.3 的权重预计将在未来一周内发布。
核心要点:
➤ GLM-5.3 在智能体能力上取得了最大幅度的提升,跻身前沿模型之列。
该模型在我们的真实世界智能体知识工作评估 GDPval-AA v2 中的 Elo 评分从1524升至1770,涨幅达到246分。
这让 GLM-5.3 位列所有模型第二名,仅落后于 Claude Opus 5(1855),并且比该评估中原开放权重领头羊 Kimi K3(1668)高出100多分。
➤ GLM-5.3 的 token 效率低于前代模型。在 Artificial Analysis Intelligence Index v4.1 中,GLM-5.3 每个任务平均消耗约18700个输出token,比 GLM-5.2(15700)高出约20%,比 Kimi K3(14700)高出27%。这会对部署成本产生影响。
➤ GLM-5.3 每个 Intelligence Index 任务成本为0.68美元,是 GLM-5.2 0.44美元的1.5倍,但仍比同一智能层级的其他模型更便宜。
GLM-5.3 单任务成本比 Kimi K3(0.84美元)低19%,比 GPT-5.6 Sol(1.23美元)低45%。成本上涨的部分原因是相比前代,它的token用量提升了20%。
➤ GLM-5.3 在真实世界知识准确率上有所提升,在 AA-Omniscience 上的得分从 GLM-5.2 的4分提升至14分。
GLM-5.3 目前是 AA-Omniscience 上排名第二的开放权重模型,仅落后于 Kimi K3(20分)。
对提升部分的更详细拆解显示,这是准确率的真实提升,而非仅仅是更谨慎地拒答,因为准确率(从24%到34%)和答题率(从46%到55%)双双上升。不过 GLM-5.3 的幻觉率略有回升,从26%升至30%。
额外模型细节:
➤ 规模:总参数7530亿,激活参数400亿(MoE),与 GLM-5.2 相比没有变化
➤ 上下文窗口:1M tokens
➤ 定价:每1M输入 tokens 收费1.40美元,每1M输出 tokens 收费4.40美元。缓存命中可享受81%折扣(每1M缓存输入 tokens 收费0.26美元)
➤ 许可证:MIT
➤ 获取方式:GLM-5.3 目前可通过 Z AI 官方API访问。Z AI 团队透露他们预计很快就会发布权重
前往 Artificial Analysis 查看 GLM-5.3 的完整分析:
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖