开发者RoliumGens做出了只有原模型五分之一大小、性能接近大模型的AI
大家好!我刚刚发布了一个参数低于 6B 的稀疏激活 AI 模型,它采用了一种全新的架构:fusion。
我融合了来自 @liquidai 的 LFM2.5-2.6B 和 @Alibaba_Qwen 的 Qwen3.6-35B-A3B 的权重。它的性能接近 Qwen3.6-35B-A3B,体积却只有后者的大约五分之一。
这是全新系列的首个模型,到目前为止,我已经全身心投入了超过六周的时间来完成这项工作。
很快我就会推出两款采用该架构的模型:
- minimax m3 的迷你版本(顺便说一句,已经构建完成)
- deepseek v4 flash 的迷你版本(也已经构建完成)
参数分别是 26B 和 12B。不过我非常需要更多算力,来对这些模型做基准测试,开展更多实验,让它们变得更好。
我相信这是我们在本地实现前沿智能的最快途径。@0xSero 你拥有大量算力,或许可以帮我完成这项工作,让我能将这些模型开源发布,供所有人使用。
之后我就可以着手处理那些大模型了(glm 5.2、kimi k3,很快还会有 qwen 3.8,哈哈哈)。
模型链接:我仍在完成大量量化工作,以及优化一个稀疏激活效果更好的检查点。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖