遇见数据集

Varroa_ASRM_training

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

Varroa 数据集是一个用于训练和评估 YOLOv8-P2 ASRM 变体的对象检测数据集,专注于瓦螨感染图像。该数据集包含感染图像,其中类别 token 3 被映射到类别 1。原始存档保留训练/验证/测试的原始布局,通过 `prepare_dataset.py` 进行去重并创建可复现的 70/15/15 分割布局(使用固定种子 42)。训练超参数包括:图像尺寸 640、批次大小 16、100 个 epoch、早停耐心值 20、工作线程数 4,以及训练种子 42/43。数据集支持三种 ASRM 架构变体:p2_asrm_fusion、input_asrm_auxiliary 和 input_asrm_guided_p2。版本 2 暴露辅助注意力图但无辅助损失,其检测路径与 P2 基线等效。输出包括每个 case/seed 的 `test_metrics.json` 以及比较 CSV 文件(原始运行和聚合统计)。

The Varroa dataset is an object detection dataset designed for training and evaluating YOLOv8-P2 ASRM variants, focusing on Varroa mite infestation images. It contains infected images where class token 3 is mapped to class 1. The original archive retains the original train/val/test layout, and a reproducible 70/15/15 split layout is created with deduplication via `prepare_dataset.py` using a fixed seed 42. Training hyperparameters include image size 640, batch size 16, 100 epochs, early stopping patience 20, number of workers 4, and training seeds 42/43. The dataset supports three ASRM architecture variants: p2_asrm_fusion, input_asrm_auxiliary, and input_asrm_guided_p2. Version 2 exposes auxiliary attention maps without auxiliary loss, and its detection path is equivalent to the P2 baseline. Outputs include `test_metrics.json` per case/seed and comparison CSV files (raw runs and aggregated statistics).

创建时间:
2026-08-04
原始信息汇总

数据集概述

数据集名称:Varroa: three YOLOv8-P2 ASRM variants
数据集链接https://huggingface.co/datasets/HoangTrungNguyen/Varroa_ASRM_training


数据集内容

该数据集用于训练三种基于 YOLOv8-P2 的 ASRM(Attention-based Spatial Regularization Module) 变体,专门针对 Varroa(瓦螨)检测任务。数据集与 LEVIR-Ship 和原始 Varroa 项目隔离,作为独立训练包提供。

三种 ASRM 架构变体

  1. p2_asrm_fusion
  2. input_asrm_auxiliary
  3. input_asrm_guided_p2

数据划分与预处理

  • 原始划分:保留原始 train/val/test 布局。
  • 标准化划分:通过 prepare_dataset.py 脚本对正样本 CSV 记录去重,并生成可复现的 70/15/15 Ultralytics 格式划分。
  • 统一转换:所有架构变体和训练种子均使用同一转换后的数据集。

训练配置

训练流程遵循 Varroa/YOLO_custom/HF_YOLO_version_workflow.ipynb 中的规范:

配置项
训练图像 仅感染图像(gt_one
类别映射 类别 token 3 映射到类别 1
转换种子 固定为 42(split seed)
预训练模型 yolov8n.pt
图像尺寸 640
Batch Size 16
训练轮数 100
早停耐心值 20
工作线程数 4
训练种子 42 / 43

输出结果

  • 每个案例/种子生成 test_metrics.json 文件。
  • comparison_varroa_asrm.csv 包含所有原始运行结果。
  • comparison_varroa_asrm_aggregate.csv 包含跨种子的均值/标准差统计。

版本说明(Version 2)

  • Version 2 暴露了辅助注意力图,但 没有辅助损失
  • 因此,在本次实验中,其检测路径与 P2 基线故意设计为等效,用于对比分析。
搜集汇总
数据集介绍
Varroa_ASRM_training 数据集图片
构建方式
Varroa_ASRM_training数据集的构建源于对瓦螨(Varroa)检测任务中YOLOv8-P2架构变体的系统性研究。原始数据保留了train/val/test的划分,通过prepare_dataset.py脚本对阳性CSV记录进行去重,并基于固定的转换种子(seed 42)生成可复现的70/15/15 Ultralytics格式布局。该数据集整合了三种ASRM架构(p2_asrm_fusion、input_asrm_auxiliary、input_asrm_guided_p2),并统一采用仅含感染图像的gt_one模式,将类别token 3映射至类别1,确保不同变体在同等条件下进行公平对比。整个流程遵循既定工作流,固定了图像尺寸640、批次大小16、训练轮次100及worker数4等超参数,为模型评估奠定了坚实基础。
特点
该数据集的核心特性在于其精细的预处理与多架构适配性。通过去重操作确保数据干净,并通过固定的转换种子实现训练验证测试划分的高度可复现性。所有ASRM变体共享同一份转换后的数据集,排除了数据差异对实验结果的干扰。此外,版本2虽引入了辅助注意力图,但未附加辅助损失函数,因此其检测路径在实验设计上等同于P2基线,这一巧妙设计使得对模型结构贡献的归因分析更为纯粹。数据集输出涵盖每个案例与种子的测试指标,以及聚合的均值和标准差统计,便于全面评估模型性能的稳定性。
使用方法
使用者可直接利用该数据集训练三种YOLOv8-P2 ASRM变体,并通过提供的notebook工作流复现实验。建议遵循固定的训练配置,包括预训练权重yolov8n.pt、图像尺寸640等,以保持一致性。训练完成后,生成的test_metrics.json和comparison_varroa_asrm.csv文件可用于对比不同架构与训练种子(42/43)下的表现,而聚合文件则提供跨种子的统计汇总。该数据集特别适用于研究注意力机制在目标检测中的影响,并支持对模型鲁棒性的深入验证。
背景与挑战
背景概述
Varroa_ASRM_training数据集源于针对瓦螨(Varroa destructor)检测的计算机视觉研究,由相关研究团队于近年开发,旨在评估三种YOLOv8-P2变体架构(p2_asrm_fusion、input_asrm_auxiliary、input_asrm_guided_p2)在瓦螨图像识别中的性能。该数据集基于原始Varroa项目构建,采用感染图像、类别映射及固定划分种子(42)等策略,确保实验的可重复性。通过提供统一转换后的70/15/15训练-验证-测试划分,该数据集为比较不同注意力机制在目标检测中的效果提供了标准化基准,对蜂群健康监测和精准农业领域具有重要影响。
当前挑战
该数据集面临的挑战包括:1)领域问题:瓦螨个体微小且形态相似,传统图像分类方法难以精准检测,需依赖高分辨率特征提取,而YOLOv8-P2通过增强小目标检测能力应对此难题;2)构建过程:原始数据存在重复正样本记录,需通过去重脚本处理以保证数据质量;同时,训练配置需统一(如100轮、patience 20等),并需控制多种随机种子(42/43)以评估模型稳定性,这增加了数据构建的复杂度。此外,版本2模型虽引入辅助注意力图,但无辅助损失,其检测性能与基准等效,这为架构设计带来挑战,需更精细的机制创新以提升检测精度。
常用场景
经典使用场景
该数据集以瓦螨(Varroa destructor)为检测目标,其经典使用场景聚焦于蜜蜂健康监测中的精准目标检测任务。研究者利用该数据集训练并评估YOLOv8-P2架构及其三种变体(p2_asrm_fusion、input_asrm_auxiliary、input_asrm_guided_p2),旨在实现蜂巢内瓦螨的实时定位与计数。数据集精心编排了70/15/15的划分比例,并采用固定随机种子及统一的预处理流程,确保实验的可重复性与公平比较,为计算机视觉在农业害虫防治领域的模型迭代提供了标准化的测试基准。
衍生相关工作
围绕该数据集,衍生出一系列针对轻量化检测模型的改进工作,如注意力机制与特征金字塔的融合策略、不同辅助监督信号(如注意力图引导)对检测性能影响的消融研究。此外,其生成的性能对比文件(CSV格式)支持了跨模型、跨种子的大规模统计分析,为后续研究提供了基准数据与可复现模板。相关工作还可能包括基于该数据集的模型剪枝、知识蒸馏以及小样本学习研究,进而催生出一系列面向农业场景的嵌入式计算机视觉解决方案。
数据集最近研究
最新研究方向
基于大尺度昆虫图像检测的细粒度目标识别与模型架构优化是当前农业智能化领域的研究热点。Varroa_ASRM_training数据集聚焦于瓦螨(Varroa)的精准检测,其配套的三种YOLOv8-P2变体(融合、辅助注意力、引导式P2)代表了注意力机制与特征金字塔网络在微小目标检测中的前沿探索。该数据集通过严格的划分协议(固定随机种子、去重预处理)确保了实验的可重复性,为比较不同注意力强化模块对检测性能的影响提供了标准化基准。尤其值得关注的是,版本2虽引入辅助注意力图但不设辅助损失,从而在实验上隔离了注意力引导对主检测路径的纯粹增益,这一设计有助于深入理解注意力机制在检测任务中的直接贡献。该工作不仅促进了害虫监测的自动化,也为在资源受限场景下设计轻量级高精度检测器提供了重要参考,其影响延伸至农业物联网与精准施药等实际应用领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务