AI Pulse

超越聚合分数:GWHD麦穗检测模型库的逐国域偏移

超越聚合分数:GWHD麦穗检测模型库的逐国域偏移

超越聚合分数:GWHD麦穗检测模型库中的逐国域偏移

(这是对GWHD麦穗检测模型库发布的一篇后续文章)

背景

几周前,我开源了9个目标检测模型——YOLOv8、YOLOv11、YOLOv26和RF-DETR,涵盖nano到x-large变体——这些模型在Global Wheat Head Dataset (GWHD) 2021上进行了微调。该数据集是一个密集的单类麦穗检测基准,由来自6个国家、18个研究机构的田间图像组成,旨在最大化基因型、生长阶段和成像条件的多样性。所有9个模型都在同一个共享流水线(DetectionBench)下进行训练和评估,并附带常规的可复现性产物:mAP/精确率/召回率、逐类细分、训练配置和定性展示。

头条结果很直白:YOLOv11x以74.25% mAP@50(34.92% mAP@50:95,83.37%精确率)位居榜首,而YOLOv26s提供了最佳的效率权衡——仅22.8 GFLOPs(10.0M参数)就达到70.49% mAP@50,与顶级模型相差不到4个百分点,同时使用的FLOPs约为YOLOv11x(196.0 GFLOPs)的8.6分之一。

然而,根据社区反馈,有人指出:

> 一个有用的下一步比较是按国家或基因型切片,因为在现场部署中,域偏移可能比聚合分数更重要。

这些指标没有包含在模型卡中——至少一开始没有。本文就是那个后续:对所有9个模型进行逐国分层评估,以及它实际意味着什么。

方法

GWHD的图像来自6个国家(澳大利亚、中国、日本、墨西哥、苏丹、美国)的18个贡献机构,每个机构在数据集自身的术语中由一个或多个“域”表示。我编制了一个逐图像清单(domain_metadata.json),将每个测试分割图像映射到其贡献国和生长阶段——这个映射不是原始GWHD发布的一部分;它是专门为本分析构建的,来自与数据集关联的逐域元数据。

对于9个训练好的模型中的每一个,我重新运行了评估,一次只限制在一个国家的图像上。关键的是,这复用了与生成每个模型已发布聚合分数完全相同的评估引擎——YOLO系列使用Ultralytics自己的model.val(),RF-DETR使用supervision.MeanAveragePrecision——只是过滤到逐国图像子集,而不是完整测试分割。因此,逐国数字与已发布的聚合数字直接可对账,而不是第二个独立实现的、可能与之微妙不一致的指标。

一张测试图像(共1,382张)在源元数据中无法解析出国家——这是一个有记录的上游重复文件名怪癖,同一个原始文件名出现在两个不同的域条目下——它在下面的每个细分中都被排除,而不是猜测。这里所有数字都基于剩余的1,381张测试图像,按国家不均匀分配:

国家测试图像占测试集比例
美国60543.8%
澳大利亚28120.3%
墨西哥20514.8%
中国20014.5%
日本604.3%
苏丹302.2%

事实证明,这种不平衡对解读聚合排行榜非常重要,如下面的结果所示。

结果:逐国mAP@50

模型中国苏丹日本墨西哥澳大利亚美国
YOLOv11x92.3673.0169.9777.9269.2870.42
YOLOv26m88.9966.4266.2171.4770.3066.40
YOLOv26s90.7669.6567.1870.7366.9965.43
YOLOv8m89.4972.4965.9672.6868.9960.85
YOLOv8s89.2171.8867.4171.2763.6762.88
YOLOv8n88.8769.1962.3570.6562.2658.95
RF-DETR Nano79.7861.4261.0754.5135.4058.70
RF-DETR Small83.8372.8469.5663.8055.3464.84
RF-DETR Medium88.7174.0371.1068.5457.8764.97

(逐国mAP@50:95可在每个模型的country_breakdown.json中获取;这里为简洁省略——两种指标的模式如下。)

发现1:对每一个模型,中国都是表现最强的国家

无一例外,所有9个模型——无论架构、大小或训练配方——都在中国子集上得分最高(79.8–92.4% mAP@50)。这是整个模型库中唯一完全一致的结果,值得坦诚说明为什么这并不特别令人惊讶:中国是数据集中较大且视觉上更一致的域之一(2个机构,200张图像),而域内一致性往往使评估更容易,无论模型在其他地方学到了什么。

发现2:YOLO和RF-DETR在它们最吃力的地方大体上意见相左

这是更有趣、真正依赖模型的结果。看看每个模型表现最差的国家:

模型最差国家mAP@50跨度(最好−最差)
YOLOv11x澳大利亚69.2823.08
YOLOv26m日本66.2122.79
YOLOv26s美国65.4325.33
YOLOv8m美国60.8528.64
YOLOv8s美国62.8826.33
YOLOv8n美国58.9529.92
RF-DETR Nano澳大利亚35.4044.38
RF-DETR Small澳大利亚55.3428.49
RF-DETR Medium澳大利亚57.8730.84

6个YOLO变体中有4个(YOLOv26s、YOLOv8m、YOLOv8s、YOLOv8n)在美国子集上最弱——而美国子集(605/1,381张图像)占整个测试集的43.8%。这意味着这四个模型的已发布聚合mAP不成比例地锚定在它们处理得最差的地区上,而不是“典型”国家表现。这两个例外本身也值得注意:YOLOv11x最差的国家实际上是澳大利亚,YOLOv26m是日本——两个模型都不符合多数模式。

相比之下,所有三个RF-DETR变体在澳大利亚(占测试集20.3%)上最弱——这与大多数YOLO系列的失效模式完全不同,尽管RF-DETR Medium的整体聚合分数(67.1% mAP@50)与几个中等大小的YOLO模型处于同一范围。

发现3:对域偏移的鲁棒性在很大程度上独立于原始精度

YOLOv26m在所有9个模型中拥有最窄的国家间跨度——22.8个百分点,从中国的88.99%到日本的66.21%——尽管它不是总体得分最高的模型(那是YOLOv11x,跨度几乎相同,23.1个百分点)。这两个模型在域间的一致性上明显优于模型库中的其他所有模型。

在另一端,RF-DETR Nano拥有任何模型中最大的跨度——44.4个百分点,从中国的79.8%到澳大利亚的仅35.4%。这比在中国上的整个模型间范围(79.8–92.4%,跨度12.6个百分点)还要大。换句话说:对于RF-DETR Nano来说,你的部署图像来自哪个国家,比你在模型库中选择哪个模型更重要。

这就是审阅者的问题真正指向的实际要点:单一的聚合mAP数字会完全隐藏那个可靠性差距。YOLOv26s和YOLOv8m发布了几乎相同的聚合分数(70.49% vs. 69.55% mAP@50——相差不到一个百分点),但它们国与国之间的跨度却相差超过3个百分点(25.3 vs. 28.6)。两个模型在排行榜上排名几乎相同,而跨域的可靠性却可测量地不同,这是单一聚合行无法承载的信息。

注意事项

样本量因国家而异。苏丹(30张)和日本(60张)是小巧的子集;少量困难或容易的图像对它们mAP的影响大于美国(605张)或澳大利亚(281张)。请将苏丹/日本的数字视为噪声高于其他数字。

这是国家层面,不是基因型层面。审阅者的评论特别提到基因型切片;本分析所基于的逐图像清单不携带基因型标签,只有国家/机构/生长阶段。基因型分层评估需要不同的元数据来源。

生长阶段分层是下一步,使用相同的每次重跑子集方法,一旦源元数据中的标签不一致(“Post-flowering” vs. “Post-Flowering”——几乎可以肯定是同一阶段,只是大小写不同)被规范化,以免它分割成两个近乎重复的组。

在哪里找到这些

每张模型卡现在都有一个“逐国表现”部分,包含该特定模型的上述表格,以及country_breakdown.json(原始结果)和domain_metadata.json(用于计算这些结果的国别/生长阶段映射),都存放在仓库中——参见模型集合。

数据集:dronefreak/GWHD
代码:DetectionBench

致谢

基础数据集的全部分数归于Etienne David、Mario Serouart、Simon Madec以及Global Wheat Head Detection联盟(Plant Phenomics,2021;2020)。本发布及上述分析是在他们的工作之上进行的非官方、独立评估,与原作者无关。

感谢推动这一点的审阅者——它浮现了一个关于模型跨域可靠性的真实、可操作的发现,而这是聚合排行榜单独永远无法显示的。

阅读原文
📚 相关主题 计算机视觉

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新