AI Pulse
📡 X 信号

德国发布的kolibri模型数学正确率超专家混合模型

德国Aleph Alpha公司@Aleph__Alpha刚刚发布了一个主权开放权重模型Kolibri。该模型每个词只使用其总780亿参数中的35亿参数,它的数学能力相当惊人:在美国数学奥林匹克(AIME)测试中获得了96.9%的正确率,击败了所有测试过的混合专家模型,甚至击败了规模三倍大的混合专家模型。目前只有一个做了8倍计算量的稠密模型比它表现更好。

任何人都可以在自己的服务器上运行它,它用德语推理,在Aleph Alpha的测试中,它在同尺寸所有开放模型的英语和德语任务中都排名第一。

模型以名为token(令牌)的数据块读取文本,我用Kolibri的分块器(它的分词器)对德国宪法做了测试:相同文本,它生成的令牌数比GPT-4少15%。"bundesverfassungsgericht"(联邦宪法法院)这个词,GPT-4分成6个令牌,而Kolibri只分成2个。更少的令牌意味着处理德语成本更低、速度更快,并且模型一次能读取更多文本。

它的工作原理很简单:
1. 每一层有384个微小专家,路由会将每个词发送给其中6个专家处理。因此它推理起来就像一个35亿参数模型,但需要780亿参数模型大小的内存:大约需要78GB,也就是说需要两块大的NVIDIA显卡(H100)或者一块H200。
2. 大多数层只处理最近的512个令牌,每5层中有一层会处理全部令牌。这样它就能读取100万个令牌(几本厚书的内容),而不会产生高昂的成本。
3. 它用德语推理。该团队发现,添加少量德语推理数据还不如不加:模型会陷入德语推理循环,永远完不成。因此他们制作了大约80万个德语推理示例,为模型提供了充足的训练数据。
4. 它训练后会说“我不知道”。他们和模型玩了一个游戏:文档的部分内容被隐藏,有时是帮助模型,有时是隐藏证据,模型必须判断出哪一种情况。当它不知道答案时,有44%的概率会直接承认,而Qwen 3.5只有11%的概率会承认。

它的短板在于:记忆问答、长时间来回调用工具,以及编码智能体方面,Qwen系列模型目前更领先。

要运行它,你需要为vllm(一个流行的开源模型运行服务器)安装Aleph Alpha的附加组件。如果你有德语文档,并且需要将数据保留在自己的硬件上,这会是一件大事。非常祝贺Aleph Alpha的每一位成员,也包括我的好朋友@MichaelLHofmann!

我已经写好了它的工作原理、基准测试、运行方法以及适用场景:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新