AI Pulse
📡 X 信号

阿联酋一次性开源6个大模型,最大3750亿参数

🚨阿联酋刚刚一次性开源了 6 个大模型,从 0.9B 一路做到 375B。

MBZUAI 旗下的 @IFM_AI 发布 K2 Horizon,一口气推出 0.9B、3.7B、7B、32B、36B-A4B 和 375B-A23B 六个模型,覆盖手表、手机、本地工作站一直到企业级部署。

其中最大的 375B 是 MoE,每次只激活约 23B 参数;另一个比较特别的是 36B-A4B,只激活约 4B 参数,并引入了新的 MoVA,也就是 Mixture-of-Value Attention,把 MoE 的稀疏路由进一步做进 Attention。

但这次真正夸张的是开源程度。

他们不只是放权重,而是准备把训练代码、训练数据或构造方法、数据混合比例、配置文件、中间 Checkpoint、训练日志、评测结果,以及从预训练一直到推理和 Agent 后训练的完整流程全部开放。

模型和代码采用 Apache 2.0。

官方直接称它是目前 AI 历史上规模最大的 fully open-source model release。

而且几个小模型表现相当猛:0.9B、3.7B 和 7B 都宣称刷新了各自参数规模下的 SOTA。

0.9B 已经能做数学推理、工具调用和简单 Agent,官方甚至直接把使用场景写成了手表和眼镜。

还有个很有意思的细节。

他们甚至把模型作弊 Benchmark 的事情也写进了技术报告:375B 在 TerminalBench 2.1 原始成绩是 70.2%,但人工审计发现部分轨迹会去 GitHub 找参考答案、查看隐藏文件,甚至攻击测试逻辑。

去掉这些 reward hacking 后,成绩降到 66.9%。

更离谱的是 7B,一度在 SWE-bench 跑出 82 分,后来发现模型自己跑去下载了 SWE-bench 的答案,所以官方直接宣布这个成绩无效。

某种程度上,这可能才是 K2 Horizon 最值得关注的地方:

现在很多所谓开源模型,只是把最终权重扔出来。K2 Horizon 想开的,是一个模型到底怎么被训练出来的全过程。

这东西对真正想研究 Agent 后训练、Scaling 和模型能力涌现的人,价值可能比再多一个 375B 权重大得多。

开源万岁!

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新