AI Pulse

餐食卡路里估算对比:Muse Spark 1.3 达标 48%,Qwen 3.8 27b 仅 16%

作者想给自己做一个快速的卡路里计数器。做法直接:把餐食照片和文字描述丢给大模型,让它估热量。核对用的是Nutrition5k的照片和真实卡路里值。

七个模型跑在同一批随机抽取的25个餐食上,误差落在20%以内算过关。所有模型都配了查卡路里数据的工具。数据源包括USDA FoodData Central和MEXT。也就是说,算之前能查表,不是靠训练记忆硬猜。

有几个模型太大,本地机器跑不动。改走OpenCode Go/OpenRouter,在云端跑。Muse Spark 1.3也进了名单,因为它预计会开放权重。

按误差落在20%以内的餐食占比排序:

- Muse Spark 1.3:48%,平均偏差 -24 kcal,中位误差 45 kcal
- DeepSeek v4 Flash Vision:40%,平均偏差 +52 kcal,中位误差 65 kcal
- Qwen 3.8 Flash:36%,平均偏差 +2 kcal,中位误差 91 kcal
- Qwen 3.8 Max:32%,平均偏差 -11 kcal,中位误差 48 kcal
- Muse Glimmer 30b:32%,平均偏差 +25 kcal,中位误差 92 kcal
- GLM 5.3 Flash:28%,平均偏差 +18 kcal,中位误差 65 kcal
- Qwen 3.8 27b:16%,平均偏差 +64 kcal,中位误差 148 kcal

平均偏差的正负,代表整体报高还是报低。七个模型里五个报高、两个报低。中位误差反映平时错多少。最低是Muse Spark 1.3,45 kcal;最高是Qwen 3.8 27b,148 kcal。一半餐食被它估偏超过148 kcal。

同样的达标率,里面差别不小。Qwen 3.8 Max和Muse Glimmer 30b都是32%。中位误差一个48 kcal,一个92 kcal。达标率一样,不代表错得一样。

作者自己也承认,25个餐食算不上严谨的基准。他更感兴趣的是另一个现象:排名没有跟着模型大小走。最典型的是Muse Glimmer 30b,估卡路里明显胜过Qwen 3.8 27b。

评论区有人追问误差出在哪:是模型认不出照片里的餐食,还是查数据时用错了工具。有人建议加测Gemma 4 31b或原生多模态12b。理由是Qwen 27b更像编码代理模型,视觉估算未必是它的强项。还有人觉得这是难得的真实用例,不是人造基准。这条评论顺带提到,Muse Glimmer在r/LocalLLaMA上已经显出黑马相。

评论区还问起模型是否被允许联网搜索,想知道放开网络后排行榜会不会改写。

作者把结论落在硬件和任务的搭配上。消费级硬件、约32GB显存的档位,没有通吃的“最佳”,全看任务。

阅读原文
📚 相关主题 大模型评测

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新