超越聚合分数:GWHD麦穗检测模型库的逐国域偏移
超越聚合分数:GWHD麦穗检测模型库中的逐国域偏移
(这是对GWHD麦穗检测模型库发布的一篇后续文章)
背景
几周前,我开源了9个目标检测模型——YOLOv8、YOLOv11、YOLOv26和RF-DETR,涵盖nano到x-large变体——这些模型在Global Wheat Head Dataset (GWHD) 2021上进行了微调。该数据集是一个密集的单类麦穗检测基准,由来自6个国家、18个研究机构的田间图像组成,旨在最大化基因型、生长阶段和成像条件的多样性。所有9个模型都在同一个共享流水线(DetectionBench)下进行训练和评估,并附带常规的可复现性产物:mAP/精确率/召回率、逐类细分、训练配置和定性展示。
头条结果很直白:YOLOv11x以74.25% mAP@50(34.92% mAP@50:95,83.37%精确率)位居榜首,而YOLOv26s提供了最佳的效率权衡——仅22.8 GFLOPs(10.0M参数)就达到70.49% mAP@50,与顶级模型相差不到4个百分点,同时使用的FLOPs约为YOLOv11x(196.0 GFLOPs)的8.6分之一。
然而,根据社区反馈,有人指出:
> 一个有用的下一步比较是按国家或基因型切片,因为在现场部署中,域偏移可能比聚合分数更重要。
这些指标没有包含在模型卡中——至少一开始没有。本文就是那个后续:对所有9个模型进行逐国分层评估,以及它实际意味着什么。
方法
GWHD的图像来自6个国家(澳大利亚、中国、日本、墨西哥、苏丹、美国)的18个贡献机构,每个机构在数据集自身的术语中由一个或多个“域”表示。我编制了一个逐图像清单(domain_metadata.json),将每个测试分割图像映射到其贡献国和生长阶段——这个映射不是原始GWHD发布的一部分;它是专门为本分析构建的,来自与数据集关联的逐域元数据。
对于9个训练好的模型中的每一个,我重新运行了评估,一次只限制在一个国家的图像上。关键的是,这复用了与生成每个模型已发布聚合分数完全相同的评估引擎——YOLO系列使用Ultralytics自己的model.val(),RF-DETR使用supervision.MeanAveragePrecision——只是过滤到逐国图像子集,而不是完整测试分割。因此,逐国数字与已发布的聚合数字直接可对账,而不是第二个独立实现的、可能与之微妙不一致的指标。
一张测试图像(共1,382张)在源元数据中无法解析出国家——这是一个有记录的上游重复文件名怪癖,同一个原始文件名出现在两个不同的域条目下——它在下面的每个细分中都被排除,而不是猜测。这里所有数字都基于剩余的1,381张测试图像,按国家不均匀分配:
| 国家 | 测试图像 | 占测试集比例 |
|---|---|---|
| 美国 | 605 | 43.8% |
| 澳大利亚 | 281 | 20.3% |
| 墨西哥 | 205 | 14.8% |
| 中国 | 200 | 14.5% |
| 日本 | 60 | 4.3% |
| 苏丹 | 30 | 2.2% |
事实证明,这种不平衡对解读聚合排行榜非常重要,如下面的结果所示。
结果:逐国mAP@50
| 模型 | 中国 | 苏丹 | 日本 | 墨西哥 | 澳大利亚 | 美国 |
|---|---|---|---|---|---|---|
| YOLOv11x | 92.36 | 73.01 | 69.97 | 77.92 | 69.28 | 70.42 |
| YOLOv26m | 88.99 | 66.42 | 66.21 | 71.47 | 70.30 | 66.40 |
| YOLOv26s | 90.76 | 69.65 | 67.18 | 70.73 | 66.99 | 65.43 |
| YOLOv8m | 89.49 | 72.49 | 65.96 | 72.68 | 68.99 | 60.85 |
| YOLOv8s | 89.21 | 71.88 | 67.41 | 71.27 | 63.67 | 62.88 |
| YOLOv8n | 88.87 | 69.19 | 62.35 | 70.65 | 62.26 | 58.95 |
| RF-DETR Nano | 79.78 | 61.42 | 61.07 | 54.51 | 35.40 | 58.70 |
| RF-DETR Small | 83.83 | 72.84 | 69.56 | 63.80 | 55.34 | 64.84 |
| RF-DETR Medium | 88.71 | 74.03 | 71.10 | 68.54 | 57.87 | 64.97 |
(逐国mAP@50:95可在每个模型的country_breakdown.json中获取;这里为简洁省略——两种指标的模式如下。)
发现1:对每一个模型,中国都是表现最强的国家
无一例外,所有9个模型——无论架构、大小或训练配方——都在中国子集上得分最高(79.8–92.4% mAP@50)。这是整个模型库中唯一完全一致的结果,值得坦诚说明为什么这并不特别令人惊讶:中国是数据集中较大且视觉上更一致的域之一(2个机构,200张图像),而域内一致性往往使评估更容易,无论模型在其他地方学到了什么。
发现2:YOLO和RF-DETR在它们最吃力的地方大体上意见相左
这是更有趣、真正依赖模型的结果。看看每个模型表现最差的国家:
| 模型 | 最差国家 | mAP@50 | 跨度(最好−最差) |
|---|---|---|---|
| YOLOv11x | 澳大利亚 | 69.28 | 23.08 |
| YOLOv26m | 日本 | 66.21 | 22.79 |
| YOLOv26s | 美国 | 65.43 | 25.33 |
| YOLOv8m | 美国 | 60.85 | 28.64 |
| YOLOv8s | 美国 | 62.88 | 26.33 |
| YOLOv8n | 美国 | 58.95 | 29.92 |
| RF-DETR Nano | 澳大利亚 | 35.40 | 44.38 |
| RF-DETR Small | 澳大利亚 | 55.34 | 28.49 |
| RF-DETR Medium | 澳大利亚 | 57.87 | 30.84 |
6个YOLO变体中有4个(YOLOv26s、YOLOv8m、YOLOv8s、YOLOv8n)在美国子集上最弱——而美国子集(605/1,381张图像)占整个测试集的43.8%。这意味着这四个模型的已发布聚合mAP不成比例地锚定在它们处理得最差的地区上,而不是“典型”国家表现。这两个例外本身也值得注意:YOLOv11x最差的国家实际上是澳大利亚,YOLOv26m是日本——两个模型都不符合多数模式。
相比之下,所有三个RF-DETR变体在澳大利亚(占测试集20.3%)上最弱——这与大多数YOLO系列的失效模式完全不同,尽管RF-DETR Medium的整体聚合分数(67.1% mAP@50)与几个中等大小的YOLO模型处于同一范围。
发现3:对域偏移的鲁棒性在很大程度上独立于原始精度
YOLOv26m在所有9个模型中拥有最窄的国家间跨度——22.8个百分点,从中国的88.99%到日本的66.21%——尽管它不是总体得分最高的模型(那是YOLOv11x,跨度几乎相同,23.1个百分点)。这两个模型在域间的一致性上明显优于模型库中的其他所有模型。
在另一端,RF-DETR Nano拥有任何模型中最大的跨度——44.4个百分点,从中国的79.8%到澳大利亚的仅35.4%。这比在中国上的整个模型间范围(79.8–92.4%,跨度12.6个百分点)还要大。换句话说:对于RF-DETR Nano来说,你的部署图像来自哪个国家,比你在模型库中选择哪个模型更重要。
这就是审阅者的问题真正指向的实际要点:单一的聚合mAP数字会完全隐藏那个可靠性差距。YOLOv26s和YOLOv8m发布了几乎相同的聚合分数(70.49% vs. 69.55% mAP@50——相差不到一个百分点),但它们国与国之间的跨度却相差超过3个百分点(25.3 vs. 28.6)。两个模型在排行榜上排名几乎相同,而跨域的可靠性却可测量地不同,这是单一聚合行无法承载的信息。
注意事项
样本量因国家而异。苏丹(30张)和日本(60张)是小巧的子集;少量困难或容易的图像对它们mAP的影响大于美国(605张)或澳大利亚(281张)。请将苏丹/日本的数字视为噪声高于其他数字。
这是国家层面,不是基因型层面。审阅者的评论特别提到基因型切片;本分析所基于的逐图像清单不携带基因型标签,只有国家/机构/生长阶段。基因型分层评估需要不同的元数据来源。
生长阶段分层是下一步,使用相同的每次重跑子集方法,一旦源元数据中的标签不一致(“Post-flowering” vs. “Post-Flowering”——几乎可以肯定是同一阶段,只是大小写不同)被规范化,以免它分割成两个近乎重复的组。
在哪里找到这些
每张模型卡现在都有一个“逐国表现”部分,包含该特定模型的上述表格,以及country_breakdown.json(原始结果)和domain_metadata.json(用于计算这些结果的国别/生长阶段映射),都存放在仓库中——参见模型集合。
数据集:dronefreak/GWHD
代码:DetectionBench
致谢
基础数据集的全部分数归于Etienne David、Mario Serouart、Simon Madec以及Global Wheat Head Detection联盟(Plant Phenomics,2021;2020)。本发布及上述分析是在他们的工作之上进行的非官方、独立评估,与原作者无关。
感谢推动这一点的审阅者——它浮现了一个关于模型跨域可靠性的真实、可操作的发现,而这是聚合排行榜单独永远无法显示的。