AI Pulse
📡 X 信号

Mistral大新模型跑分打平中国开源第一梯队

Mistral大新模型跑分打平中国开源第一梯队

🤯我靠!Mistral Large 4 Preview 在 DeepSWE v1.1 拿到 62%,已经贴脸中国开源第一梯队!

基准对比:
🔸Mistral Large 4 Preview:62%,这组对比里最高
🔸GLM-5.3(智谱):61%,只差 1 个点,基本打平
🔸DeepSeek-V4-Pro-0813:57%,落后 5 个点
🔸Qwen 3.8 Max(阿里):51%,落后 11 个点
🔸Beam (Reflection):44%,垫底,不是中国模型

真正的结论不是欧洲是否碾压,是长程写代码这一项,Mistral 贴到 GLM 脸上,柱子从 40% 起画,1 个点的差距被放大了。

#Mistral #DeepSWE #开源模型 #GLM #DeepSeek #Qwen #AI编程 #梁文峰 #唐杰

我不会说我已经“测试几周”了,但昨天 Mistral 给我介绍了他们新的大语言模型。

今天,他们开放了 Large 团队抢先体验,这个模型被团队戏称为“胖墩(le Chonk)”。它是个拥有 10000 亿参数的庞然大物,多模态,在法国训练。

早该这样了:他们上一次大版本更新还是去年 12 月,这个时间点放在现在排名里真的很落后了。过去这十个月里,如果想要高端开源模型,你只能去找 Moonshot、DeepSeek、阿里巴巴,说白了就是去找中国模型。

Mistral 并不想让大家相信他们能和硅谷的闭源模型竞争,事实也确实不是这样。我们这里说的不是 GPT-6。就像他们的科研主管总结的:大体上,这个模型追赶上了中国顶尖实验室一两个月前的水平,完全没法撼动 Opus 5.5 或者 GPT-6.1-Sol 这类模型,这一点很明确。

真正厉害的地方在于效率。Large 只用 4000 块 GPU,两个月就做出来了。比中国厂商用的 GPU 少两到三倍,仅仅是美国服务器集群规模的 1%(OpenAI 最新大语言模型用了超过 10 万块芯片)。这说明 Mistral 确实有真本事。

另外,他们告诉我,他们很少用蒸馏(就是从竞争对手模型学习回答的方法),而中国厂商大量使用这种方法。

他们跟我讲了很多关于主权的事。今年 6 月,美国商务部盖一个章就足够让 Anthropic 在全球范围内暂停部分模型访问三周,时间长达三周。中国这边的模型虽然可以访问,但受到北京法律和自有许可证的约束。

Large 4 既可以部署在自己的服务器上运行(但最少需要 4× B300,需要 1152GB 显存,最低成本就需要 35 万欧元),也可以通过端到端的欧洲云部署,只受欧洲法律约束。

芯片用的还是英伟达的,最新一轮融资由三星领投,我们还需要等独立性能测试来验证团队对性能的说法。但 Large 4 应该能达到中国顶尖模型的水平,避免这么重要的技术完全脱离欧洲人的掌控。

这是一个出人意料的出色版本。Le Chaton fat是真的!Mistral Large 4让欧洲在编码和网络安全领域重新回到了竞争行列。没想到Mistral能和GLM 5.3竞争了!

“Le Chonk”是原生多模态模型,总参数1万亿,激活参数490亿。预览版就已经交出了不错的成绩:
- DeepSWE v1.1:得分61.7%,大致和GLM-5.3的61%处于同一水平。在Mistral的对比中,Kimi K3仍以约68%的得分领先。
- 人工分析网络安全指数:得分50,与GLM-5.3-Fras持平,高于GLM-5.3的36。
- CyberGym-E2E-AA:得分82%,领先于MiMo-V2.6-Pro的79%。

Mistral表示,该模型是在其自己的欧洲数据中心从零开始训练的。NVIDIA称训练只动用了4000块Grace Blackwell超算芯片。这一点非常令人印象深刻。

从中我们得到的启示是:用少得多的算力也能参与竞争。这太不可思议了。恭喜Mistral!

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新