Ornith-1.5 35B模型登顶本地评测榜 性能超通义千问3.8 27B
Ornith-1.5在本地评测排行榜登顶,几乎所有项目表现都超过Qwen3.8-27B。
测试对象是@deep_reinforce发布的Ornith-1.5-35B-A3B-NVFP4,测试在单节点DGX Spark上借助vLLM完成,模型量化格式为NVFP4。预填充速度约为3891词元/秒,解码速度约为78词元/秒,短提示生成200词元的整体速度约为76词元/秒,并未为了性能牺牲可用的本地运行速度。
在评测者搭建的sixcat-eval评测中,Ornith-1.5总得分为85.0,其中知识85.0分、数学95.0分、事实性75.0分、指令跟随70.0分、代码85.0分、工具调用100分。该得分是评测者所有已存档的干净本地sixcat评测结果中的最高分,Qwen3.8-27B原版总得分为82.3,排名第二。
数学成绩提升幅度尤其明显,Ornith-1.0数学得分85,本次版本得分达到95;Nemotron Lightning数学得分80,Qwen3.8原版得分仅为40,AEON微调版Qwen3.8得分仅为25。
在包含20个任务的Hermes代理循环门测试中,该模型通过14项,通过率70%,平均每个任务调用3.05次工具,没有出现触发循环停止阈值的情况,仅2项任务出现重复调用。本次测试仅针对脚本化模型加服务器的Hermes格式循环门,还未对其他模型做同项测试,不做直接对比。
本次评测用到的两款评测工具均为开源,sixcat-eval和Hermes代理基准测试的链接已经公开。速度、知识储备、数学能力、指令跟随、工具调用和任务完成能力都是重要的评价标准,目前Ornith-1.5在本地评测中的表现非常出色,模型链接也已公开。