NInfer比llama.cpp快1.4-4.9倍,质量持平
NInfer是一个本地推理引擎,主打一个快。短上下文解码比llama.cpp快1.4倍,128K长上下文快2.8倍;预填充快2.6到4.7倍;首token延迟快2.6到4.9倍。
这个速度优势不在底层内核。NInfer的原始NVFP4内核速度和vLLM差不多,都在66-70 tok/s左右。拉开差距的是MTP3投机解码:76%接受率,先把后续token猜出来,解码速度从约66 tok/s拉到158-213 tok/s。
质量不会跟着牺牲。作者用相关性分类、检索、问答、推理等任务做评测,NInfer、vLLM和llama.cpp三者在统计上没有显著差异,不用在速度和质量之间做权衡。
换引擎之前,有几个点要留意。
NInfer不支持json_mode。请求里带response_format: json_object,直接返回400错误。依赖结构化JSON输出的应用,要么绕道,要么继续用其他引擎。
llama.cpp的并行数被锁在parallel=1,NInfer支持x2 lanes并发。高负载时它能同时处理更多请求,显卡利用也更充分。
上下文窗口上,NInfer 240K,vLLM 262K,llama.cpp 196K。针检索测试用了192K上下文,NInfer和vLLM都拿到100%,llama.cpp因为上下文限制跑不了。vLLM的速度数据没有进对比表,它的性能探针按墙钟时间计时,和服务器端计时不可比。社区报告和作者自己的任务级测量都显示,vLLM短上下文解码约70 tok/s,这和NInfer不开投机解码时的约66 tok/s基本一致。
实用细节
NInfer的模型文件20GB,在HuggingFace可以下载,仓库名是 neroued/Qwen3.8-27B-nvfp4-NInfer。支持视觉输入和保留思考模式(--vision --preserve-thinking)。VRAM占用30.5GB,介于vLLM的29.6GB和llama.cpp的31.6GB之间。它还提供/v1/messages/count_tokens端点,格式是Anthropic Messages。token数算得准,对成本估算和输入长度控制都有用。
作者组了一个4模型评审小组(Codex/GPT-5、DeepSeek V4 Pro、Grok 4.5、Kimi K3)审计评测方法,小组找出10个问题,其中4处是金标准标注错误。
社区争议
评论区有不同的声音。有人质疑:vLLM不跑MTP和DFlash2,基准结果还有什么意义?社区有补丁能让vLLM支持这两项,但作者没测。也有人批评拿Q5的llama.cpp和NVFP4的NInfer比,说这是“最愚蠢的评测”。理由是多数情况下,Q4_K_M反而比NVFP4好。
vLLM的MTP补丁如果有效,会不会削弱NInfer的速度优势,目前还不清楚。