AI Pulse

开发者构建了可浏览对比模型答案的LLM测试工具lm-eval-ledger

大家好。我感觉当前的LLM基准测试工具只会给你一个总体分数,却没有提供任何工具来查看模型实际是如何回答每个问题的(它们把所有内容都转储到JSONL或Parquet文件中,所以你最终得自己写代码才能读取答案)。

因此我构建了lm-eval-ledger:一个基准测试工具,它运行基准测试、记录所有内容,并提供一个Web应用,让你可以检查并比较每个模型对每个问题的回答方式。

在演示中,我在一张5090显卡上对三个模型进行了基准测试:Qwen3.5-9B、NVIDIA-Nemotron-3.5-Lightning-30B-A3B(UD-Q4_K_XL GGUF)和Gemma-4-12B-it(QAT w4a16)。看起来Qwen的思考时间远长于另外两个模型。

* GPQA Diamond:Qwen 0.717 vs Nemotron 0.657 vs Gemma 0.601——但耗时分别为2小时26分钟 vs 1小时34分钟 vs 1小时19分钟
* LiveCodeBench:Qwen耗时22小时57分钟(对比9小时51分钟/6小时13分钟),准确率为0.713 vs 0.837/0.820

以下是lm-eval-ledger在Hugging Face Spaces上提供的完整结果:https://huggingface.co/spaces/jayminbhan/lm-eval-ledger

lm-eval-ledger记录和显示的内容

* 每个问题:系统提示、模型生成内容、提取的答案、标准答案、停止原因、生成字符数
* 每个基准测试:准确率、每秒令牌数、完成时间、样本数量、无答案数量
* 附加功能:同一任务/问题上两个模型的成对比较、跨基准测试运行中始终错误/始终正确的题目

工作原理:所有内容都写入一个SQLite数据库,Flask应用负责显示。

多模型×多任务的运行也不再需要自定义bash脚本。lm-eval-ledger由YAML驱动:复制template.yaml,列出N个模型和M个任务,运行一条命令即可。

使用方法

pip install lm-eval-ledger # 添加后端:pip install "lm-eval-ledger[vllm]"
lm-eval-ledger init # 写入template.yaml,创建results/和logs/目录
lm-eval-ledger -c bench.yaml # 运行基准测试
lm-eval-ledger serve # 在http://localhost:8090浏览

详细信息和完整任务列表见GitHub仓库:https://github.com/jayminbhan/lm-eval-ledger

我已在Linux上验证了vLLM/SGLang/HF/server(llama.cpp)后端,并在Windows上验证了HF/server(llama.cpp)后端。

这最初只是一个用来查看一个GSM8K错误答案的脚本,结果一发不可收拾。非常欢迎任何反馈、想法或拉取请求!

―― 高票评论(帖子共 10 条讨论)――

[+3] u/Rikkendo:我在做A/B测试时也做同样的事情。这非常耗时,但在关键时刻,感觉没有其他办法。好东西。

[+2] u/jjusko20:很棒的项目

[+2] u/Informal-Buy-5850:偶然发现这个,很酷的构建

[+1] u/OkFlan504:逐题比较是我觉得最有用的部分。查看实际答案后,你选择的模型是否与根据总体分数做出的选择有所不同?

阅读原文
📚 相关主题 开源大语言模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新