通义千问Qwen3.8 Max将开放权重,性能对标Claude Opus
Alibaba 的 Qwen3.8 Max 在 Artificial Analysis Intelligence Index 上得分为 56,每项任务成本为 1.14 美元,但开源权重的领先者 Kimi K3 仍领先 1 分,且每项任务成本低 25%(0.86 美元)。
@Alibaba_Qwen 发布了 Qwen3.8 Max,Alibaba 称这是一个总参数量 2.4T 的 MoE 模型,每次前向传播激活 95B 参数。Alibaba 已宣布计划下周发布权重,这是战略转变,因为该公司通常将其 Max 级别模型保持为闭源专有。
发布后,Qwen3.8 Max 的规模将是 Alibaba 目前最大开源权重版本(Qwen3.5 397B)的约 6 倍,也将成为仅次于 Kimi K3(2.8T)的第二大开源权重模型。
注:我们此前发布的结果显示 Qwen3.8 Max 在 Artificial Analysis Intelligence Index 上得分为 53。那些评测运行受到我们所用评估端点间歇性问题的影响,我们已在 Alibaba 的公共 API 端点重新运行了所有评估。
核心结论:
➤ Qwen3.8 Max 在 Artificial Analysis Intelligence Index 上得分为 56,比 Qwen3.7 Max(46)提升了 10 分。与 Claude Opus 4.8(max,56)得分持平,在中国厂商模型中排名第二,领先 GLM-5.2(max,51),但落后于 Kimi K3(max,57)
➤ Qwen3.8 Max 在 GDPval-AA 上的 Elo 得分为 1739,比 Qwen3.7 Max 提升了 468 Elo。这一排名让它领先 Kimi K3(1685),与 Claude Fable 5(1743)和 GPT-5.6 Sol(max,1730)基本持平,仅落后于 Claude Opus 5(max,1852)
➤ 相对 Qwen3.7 Max 的提升覆盖智能体评测、科学推理和编码:Terminal-Bench v2.1 +6 分,CritPt +7 分,SciCode +4 分,HLE +3 分,GPQA 保持不变。AA-LCR(-2 分)和 AA-Omniscience(-10 分,原因是幻觉率上升 23% 至 40%)出现退步
➤ Qwen3.8 Max 每项 Intelligence Index 任务成本为 1.14 美元,是 Qwen3.7 Max(0.53 美元)的两倍多,约为 Kimi K3(max,0.86 美元)的 1.3 倍,约为 GLM-5.2(max,0.57 美元)的 2 倍。成本上涨部分原因来自智能体评测需要更多轮次,GDPval-AA 的输入 Token 相对 Qwen3.7 Max 增长了约 15 倍,输出 Token 用量增长 45% 至 1.45 亿
➤ 𝜏³-Bench 银行业务结果(42%)看起来属于分布外结果。它相对 Qwen3.7 Max 提升了 32 分,且让 Qwen3.8 Max 排在那些在其他评测中得分更高的模型之前
模型关键细节:
➤ 规模:总参数量 2.4T,每次前向传播激活约 95B 参数(MoE)
➤ 上下文窗口:1M Token
➤ 多模态:支持文本、图像、视频输入,文本输出
➤ 定价:@alibaba_cloud 官方 API 每 1M 输入/输出 Token 定价 2.00/6.00 美元,缓存命中价格为 0.25 美元。全价位都低于 Qwen3.7 Max(2.50/7.50 美元,缓存命中价格 0.50 美元)
➤ 可用性:已上线阿里云官方 API。Alibaba 表示权重将于下周发布
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖