AI Pulse

开源模型新版本免费下载,8GB显存即可本地运行

Ornith-1.5包含9B、35B和397B三种规模,其中35B和397B采用MoE架构。模型文件放在Hugging Face上,任何人都能免费下载。官方说训练过程用了自我改进策略。

MoE是混合专家架构的缩写,把模型拆成多个子模块。推理时只激活其中一部分,用更少的算力换接近大模型的性能。三种规模对应不同的硬件门槛。

官方给出了一组基准分数:Terminal-Bench 2.1得分86.1,SWE-Bench Verified得分86,SWE-Bench Pro得分65.1,SWE-Bench Multilingual得分79.6,DeepSWE得分56,HLE得分44.6,ClawEval得分81.4,Tool Decathlon得分71.2。官方称,模型在推理、代理任务和编码任务上达到与Claude Opus 4.8相当的性能。这些评测覆盖终端命令执行、真实代码问题修复和工具调用。指向同一个用途:让模型直接操作命令行和软件工具,而不是只在对话框里输出文字。

最小的9B,8GB显存就能跑

9B模型硬件要求不高。一名用户测试后认为,这是能在8GB显存上运行的最佳模型。特点是智能、不过度思考、工具调用能力强。另一位用户说,它一次性生成了一整个可用的HTML5游戏,没有任何错误。8GB显存是不少消费级显卡的配置水平。配备这类显卡的电脑有机会本地运行小尺寸模型,代码和数据不用离开自己的机器。

35B MoE也有人等了很久。评论区有人说,Ornith-1.0本来就是他目前最喜欢的模型之一。这次终于等到了想要的35B MoE版本。还有人看不懂为什么有人抱怨Ornith,他用Ornith-1.0-9B一直效果不错。

和Qwen比,互有胜负

有用户把35B-A3B和Qwen3.8-27B做了对比。Terminal-Bench 2.1上,Ornith得分68.5,Qwen得分73.0。DeepSWE上,Ornith得分22.0,Qwen得分42.2。HLE(无工具)上,Ornith得分25.6,Qwen得分30.8。这三项Qwen领先。

Ornith也有赢的地方。SWE-bench Verified上它得分79.0,Qwen没有官方结果。NL2Repo上它得分46.2,Qwen得分42.3。GPQA Diamond上双方打平,都是89.2。对比不是一边倒,但只覆盖了少量基准,不是全貌。粗略看,Ornith在代码仓库类任务上更稳,Qwen在终端操作和知识推理上更强。评论区还有人问,Ornith有没有计划微调Qwen 3.8 27B。

官方数字和第三方测试的差距

一名用户跑了几项搜索基准,结果对9B不太有利。对抗性搜索基准上,Ornith-1.5 9B得分0.21,GPT-5.4-nano得分0.47,Qwen-3.5-9B得分0.34。WideSearch上Ornith只有0.03,另外两个模型分别是0.44和0.53。他接下来还打算在9B上跑DeepSearchQA、BrowseComp-Plus等更多搜索基准。

不过这位用户也指出,WideSearch的低分很可能来自配置问题。最终答案里只有11%是有效的markdown格式。他还提到,这些基准没有统一指定运行配置,报告分数出现差异,原因可能就在这里。对抗性搜索基准的计分不是只看准确率,还奖励在搜索结果过于嘈杂时主动弃权的行为。

这些细节给出另一种解释。第三方测试和官方基准之间的差距,不一定代表模型真实水平。评测流程本身可能还没标准化。评论区有人表示不相信,也有人觉得9B非常有趣。还有人说,之前的基础版9B本来就接近半成品,这次改进最大并不意外。

还没公布的东西

官方没给9B模型的DeepSWE分数,评论区有人直接问为什么。397B的参数规模放在那里,即便采用MoE架构,也大概率超出消费级硬件能跑的范围。

阅读原文
📚 相关主题 开源大语言模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新