Yandex发布自研基座模型,没做后训练被评只是"鹦鹉"
完全自定义的架构
Yandex发布了一个新模型,全名AliceAI-Foundation-80B-A3B-Base。这是俄罗斯从头训练的模型,定位上对标Qwen 35B和DeepSeek V4 Flash。它不是Qwen3的微调版本,而是完全自定义的架构。
有评论猜测,它采用Qwen3-Next风格的80B-A3B架构,并升级到了Kimi Delta Attention。这个说法还没有得到确认。
没经过后训练
这个版本没有做后训练。后训练是模型获得关键能力的一步,智能主要在这一阶段涌现。有评论说,没有后训练,模型就只是“鹦鹉”。也就是说,文本看着合理,但没有真正的理解和推理。
作为Yandex从头训练的第一个基座模型,它看起来相当不错。但有评论提醒,指望它击败最新的DeepSeek或Qwen并不现实,即便在俄语上。
基准上有亮点
在某些基准上,这个模型的表现超出预期。一条评论看了基准数据,说它比旧版DeepSeek v4 Flash表现更好。而且它的参数还更少。另一个评论注意到:没做后训练的基座模型,在IMO评测上超过一些做过后训练的模型。
还有一条评论起初是批评的。这个模型只跟Qwen 3.5的35B-A3B比,不跟3.6版本比。后来发现不存在Qwen 3.6 35B-A3B基座模型,这条批评站不住。
本地还跑不了
模型目前不支持Llama.cpp,本地暂时跑不起来。有评论说,没有Llama.cpp支持,它就只是基准测试里的奖杯,实际用不上。
信任问题
模型来自俄罗斯,这让部分社区成员保持距离。有人建议只在锁定的沙箱里运行它。有人说不会碰任何俄罗斯的东西。还有人觉得这个帖子底下满是机器人,就是因为模型来自俄罗斯。
下一步
一个评论者感叹,现在每天都有新东西出现,根本跟不上,但这很好。
有评论认为,Yandex这下算入局了。没做后训练就发布模型,有点离谱;但后训练完成之后,它可能成为严肃的竞争者。也有人表示,该给Qwen一些竞争了,祝好运。
后训练版本什么时候发布,目前没有说明。训练数据来自哪里、会不会集成进Yandex现有产品,同样没有交代。