这个夏天开源AI全线爆发,多个新模型逼近顶级闭源
我们现在正处于开放权重模型发布的疯狂浪潮中。所有模态里,开源都在取得胜利。这就是开源AI之夏☀️的模样:
🧠 大语言模型与推理 → DeepSeek-V4-Flash-0731(我的王者👑):更新版304B MoE,Terminal-Bench 2.1分数从预览版的61.8飙升至82.7,DeepSWE从7.3升至54.4。在Agents' Last Exam上追近Opus-4.8(25.2对比25.7)。MIT许可证。
→ Muse-Glimmer-30B,来自Meta(他们回来了!!):他们的第一个开源智能体模型。约29.6B稠密模型 + 感知编码器,131k+上下文,原生设计为完全本地运行,不需要云。Apache 2.0许可证。
→ Liquid AI LFM2.5-2.6B:2.69B参数,131k上下文,在M5 Max上每秒生成220个token,占用内存不到2.5GB。在智能体任务上性能可匹敌体积四倍于它的模型。
→ inclusionAI Ling-3.0-flash:总参数124B,仅5.1B激活,约为他们旧版1T旗舰Ring-2.6体积的12%,关键基准上性能与之持平。MIT许可证。
→ inclusionAI Ling-3.0-tiny:总参数7.9B,1.3B激活,在M4 Pro MacBook上每秒生成86-90个token,峰值内存约8GB。MIT许可证。
→ NVIDIA Nemotron-3.5-Lightning-30B-A3B:混合Mamba-2+MoE+Attention架构,最长支持1M上下文,可单H100或DGX Spark运行,SWE-bench Verified得分52.8。
→ deepgrove maple-preview:20B-A1B三值权重推理模型,在Mac mini M4上每秒生成218个token, checkpoint体积5.3GB。MIT许可证。
→ BigBang-v1 (endless-frontier):基于Qwen3.6-35B-A3B,通过自演化生成器/评判器合成数据循环微调得到。35B参数的总体性能落在DeepSeek V4 Flash(284B)和V4 Pro(1.6T)之间。Apache 2.0许可证。
🎬 视频 → MiniMax-H3:33B稠密全模态模型,原生支持立体声,最高输出2K分辨率/15秒。已经收获了3.6k+点赞。
→ Minimax-H3-Turbo (lightx2v):对H3做Apache 2.0许可的蒸馏提速版,用于快速推理。
→ Lightricks LTX-2.5:图生视频更新,定制Gemma-4-12B文本编码器,是性能提升明显的蒸馏模型。
🔊 语音 → NVIDIA NemotronLabs VoiceChat-11B:全双工端到端语音对话,轮次切换约450ms,在公开VoiceBench排名第二,也是首个支持对话中途实时工具调用的开源全双工模型。
🛡️ 安全 → Mistral Shieldstral-1.0-3B:3B多模态安全护栏模型,支持你用纯文本输入自定义安全策略,而非固定分类。在HarmBench(99.4)和ToxicChat(84.1)上的表现超过LlamaGuard-4-12B和ShieldGemma-9B,体积却小得多。Apache 2.0许可证。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖