Artificial Analysis 与 Liquid AI发布移动端小模型端侧推理基准测试(63)
在 iPhone 17 Pro 上应该运行哪个模型?我们现在宣布,我们联合 @liquidai 推出针对移动端小模型的全新智能与推理测试:独立测试小模型在典型端侧任务中的能力,以及它们在主流手机上的性能表现。
我们与 @liquidai 合作开展移动端推理基准测试,涵盖了iPhone 17 Pro 和 Galaxy S26 Ultra 上 4 位及更低精度的多款模型。
我们将发布我们的手机端智能评估结果,结合 @liquidai 的推理性能基准测试,为用户和开发者提供小模型在手机上表现的整体视图。
推理基准测试在受控环境中开展,使用 Liquid AI 的推理基准测试软件,该软件已经过 Artificial Analysis 检查,并已在 Liquid AI 的 GitHub 开源。结果包含端到端生成时间、输出速度、峰值内存占用等指标。
这款推理基准测试应用名为「Pipette」,可在 iOS 和 Android 免费下载,允许用户在自己的设备上测试各类模型。
我们根据每个模型在五项评估中的平均得分,对手机端模型的智能程度进行排名,这五项评估是针对这些模型实际完成的基于任务的工作选定的:BFCL、IFBench、AA-Omniscience、GPQA Diamond 和 MATH-500。这些评估由 Artificial Analysis 使用我们的独立方法开展。
默认情况下,我们在每项评估中将模型的上下文限制为 16K,这对应移动设备没有足够内存容纳大量 KV 缓存的现状。这导致一些智能但冗长的模型相对得分下滑——它们并非针对手机内存对 token 使用施加的限制设计。
我们对便携设备类别的定义是:量化后,包含 KV 缓存、8K 上下文在内可放入 8GB 内存的模型。
我们预计智能测试和推理基准都会随着时间推移演进,随着新模型、新设备、新推理框架和量化技术发布,我们的页面会持续更新,加入这些新内容。
初始结果:
➤ Nanbeige4.2-3B 和 LFM2.5-2.6B 以平均63分并列评估得分第一(上下文限制16K),领先于得分62的 Ornith-1.0-9B 和得分61的 Qwen3.5 9B (Reasoning)。LFM2.5-2.6B 实现得分的效率更高:在 iPhone 17 Pro 上,它回答标准1024 token提示耗时8.0秒,占用内存2.3GB,而 Nanbeige4.2-3B 耗时21.4秒、占用4.0GB,两款9B模型耗时超过25秒、占用6.9GB。
➤ 16K的上下文限制影响了排行榜:举例来说,Qwen3.5 9B (Reasoning) 在一轮基准测试集中一共输出了7450万个输出token,在29%的生成中触达16K限制,最终总排名第四。如果将限制提高到64K,Ling 3.0 Tiny 会以66分拿到第一,领先于 Nanbeige4.2-3B(65分)、Qwen3.5 9B (Reasoning,64分) 和 LFM2.5 2.6B(64分)。但64K窗口无法装进手机。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖