遇见数据集

BUTom21; BUTom-ST21

收藏
arXiv2026-07-16 更新2026-07-18 收录
官方服务:

资源简介:

BUTom21和BUTom-ST21是由波恩大学发布的番茄视觉感知数据集,旨在推动农业机器人视觉研究。BUTom21包含293张静态图像,提供像素级成熟度标注;BUTom-ST21则包含大量视频序列数据,训练集和验证集采用基于AI的伪标签,评估集为手工标注,总计图像数量达数千张,数据来源于商业温室环境中使用机器人平台采集的RGB和深度图像。数据集创建过程涉及多日采集、手动精选与标注,并利用神经辐射场技术生成时空伪标签。这些数据集主要应用于实例分割、目标检测、视频实例分割和多目标跟踪等任务,旨在解决农业领域数据稀缺问题,支持番茄植株状态估计与表型分析。

BUTom21 and BUTom-ST21 are tomato visual perception datasets released by the University of Bonn, designed to advance visual research for agricultural robots. BUTom21 comprises 293 static images with pixel-level maturity annotations; BUTom-ST21, on the other hand, contains a large volume of video sequence data. Its training and validation sets utilize AI-generated pseudo-labels, while its evaluation set is manually annotated. The total number of images in BUTom-ST21 reaches thousands, and all data are RGB and depth images collected by robotic platforms in commercial greenhouse environments. The dataset creation process involves multi-day data collection, manual screening and annotation, as well as the generation of spatio-temporal pseudo-labels using Neural Radiance Fields (NeRF) technology. These datasets are primarily applied to tasks such as instance segmentation, object detection, video instance segmentation and multi-object tracking, aiming to address the issue of data scarcity in the agricultural domain and support tomato plant status estimation and phenotyping analysis.

创建时间:
2026-07-16
原始信息汇总

BUTom21-ST21 数据集详情

该页面介绍了 BUTom21BUTom-ST21 两个数据集,以及如何下载、使用和转换为 YOLO 格式。

数据集下载

  • BUTom21 数据集:包含经过人工标注的静态图像,用于基于实例的语义分割和目标检测。标注信息存储在基于 COCO 格式的 JSON 文件中。下载地址:https://doi.org/10.60507/FK2/DHTEH1
  • BUTom-ST21 数据集:训练和验证子集包含伪标签(来自 Mask2Former 或 Yolo26),评估集包含人工标注的图像。不同来源的伪标签和人工标注存储在不同的目录中。标注信息也以 pickle 格式存储。下载地址:https://doi.org/10.60507/FK2/TTPCNV

数据集转换

代码仓库提供将两个数据集转换为 YOLO 格式的工具。

环境配置

  • 测试环境:Python 3.10
  • 使用 pip install -r requirements.txt 安装依赖
  • 安装指定版本的 PyTorch:pip install torch==2.7.0 torchvision==0.22.0 torchaudio==2.7.0 --index-url https://download.pytorch.org/whl/cu128

转换为 YOLO 格式

BUTom21 转换命令示例:

  • 多类别(未过滤深度)python convert_to_yolo.py --root_dataset_directory /path/to/your/BUTom21/dataset/directory --class_mapping_dict 0:0 1:1 2:2 3:3 4:4
  • 多类别(过滤深度):增加 --output_depth_filtered 参数
  • 单类别(未过滤深度):增加 --output_single_class 参数,并将类别映射改为 0:0 1:0 2:0 3:0 4:0
  • 单类别(过滤深度):同时增加 --output_depth_filtered--output_single_class 参数

BUTom-ST21 转换命令示例:

  • 多类别(使用 Mask2Former 伪标签):增加 --butomst21 参数
  • 多类别(使用 Yolo26 伪标签):再增加 --use_yolo_psuedo_labels 参数
  • 单类别(使用 Mask2Former 伪标签):增加 --output_single_class--butomst21 参数
  • 单类别(使用 Yolo26 伪标签):增加 --output_single_class--butomst21--use_yolo_psuedo_labels 参数

通用命令行参数

  • --output_yolo_dataset:指定输出 YOLO 格式数据的路径,默认在根数据集目录下创建 Yolo_Dataset 文件夹。
  • --annotations_only:仅生成标注文件,不重复复制图像。
  • --delete_existing_yolo_dataset:删除整个已存在的 YOLO 数据集。
  • --subsets:仅创建指定的子集。
  • --depth_distance:物体被视为前景的距离阈值。
  • --depth_count_probability:掩膜中被视为前景的像素比例阈值。

数据加载器

代码仓库提供了最小示例数据加载器:

  • BUTom21:位于 engine/dataloaders/BUTom21.py,对应类为 BUPTom21_dataloader
  • BUTom-ST21:位于 engine/dataloaders/BUTom_ST21.py,对应类为 BUTomST21Dataset

更多使用示例可参考 engine/conversions/converters.pyengine/dataloaders/example_runscript_for_BUTom-ST21

搜集汇总
数据集介绍
BUTom21; BUTom-ST21 数据集图片
构建方式
番茄作为全球范围内最广泛种植的蔬菜作物之一,其视觉感知数据集的匮乏严重制约了农业机器人领域的发展。为弥补这一空白,研究者基于商业化温室环境,利用PATHoBot机器人平台搭载两台RealSense D435i相机,在相距约一个月的时间跨度内对六个种植行进行数据采集,共获取了323帧图像。BUTom21数据集从中精心筛选并手动标注了293帧图像,划分为训练集123帧、验证集72帧和评估集98帧,确保各子集来源于不同的种植行以实现完全独立评估。所有番茄果实均被逐像素标注其成熟度子类(绿色、混合红色、红色、混合橙色、橙色),并以COCO格式的JSON文件存储。
特点
该数据集的核心特色在于其极高的标注完整性与挑战性。与多数仅标注前景番茄的数据集不同,BUTom21对所有出现在场景中(包括深层背景)的番茄果实均进行了像素级实例分割标注,提供了涵盖五类成熟度的精细语义信息。数据集特意囊括了因幼果或严重遮挡而产生的极小型目标,以及由相机振动造成的运动模糊、光照剧烈变化、复杂背景等真实挑战,使得模型训练更具鲁棒性。此外,所有图像均附带配准的深度信息,为利用深度信息进行目标过滤提供了基础支撑。
使用方法
使用该数据集时,研究人员可直接通过PyTorch风格的数据加载器读取COCO格式的JSON注释文件,获取每张RGB图像对应的深度图及实例级分割掩码。推荐在进行训练前对标注掩码进行深度过滤——仅保留位于相机1.4米范围内且至少有50%像素点在该深度区间内的目标,以抑制背景噪声。该数据集可直接支撑实例语义分割、目标检测、跨域异常分割等任务的模型训练与评估。同时,该数据集的标注也可作为训练更复杂时空模型的监督信号,为构建视频级数据集提供基础标注来源。
背景与挑战
背景概述
在园艺机器人视觉感知领域,数据匮乏始终是制约算法性能提升的关键瓶颈。针对这一困境,波恩大学研究团队于2026年发布了BUTom21与BUTom-ST21两个番茄数据集。该工作由Michael Halstead、Esra Guclu等学者主导,依托波恩大学农业机器人实验室,旨在为商业化温室环境下的番茄植株感知提供高质量视觉数据。核心研究问题聚焦于如何利用强标签与弱标签策略,分别构建静态图像与时空序列数据集,以支撑实例级语义分割、视频实例分割与多目标跟踪等下游任务。作为全球重要的园艺作物,番茄的年产量占蔬菜总产量的近20%,该数据集的发布不仅填补了番茄领域大规模标注数据的空白,更推动表型分析、产量估计等应用迈向新台阶,在农业机器人与计算机视觉交叉领域产生了深远影响。
当前挑战
该数据集所面临的挑战兼具领域普适性与构建特异性。从领域问题来看,番茄果实外观同质性强,颜色分布连续,且常呈现密集簇生与严重遮挡,这导致实例分割与跟踪任务中难以区分个体,尤其是细小或深度遮挡的果实。更为关键的是,伪标签训练集与验证集源于神经辐射场技术生成的弱标注,存在水平或垂直粘连、跟踪ID切换、小目标缺失及分割掩膜质量低下等问题,致使模型在迁移至手工标注测试集时性能显著下降,mAP降幅可达5%至24%。从构建过程审视,数据采集面临光照剧烈变化、摄像机运动模糊、行间场景复杂度差异等现实干扰;同时,机器人里程计失效迫使团队转而采用结构光运动估计与分层定位方法恢复相机位姿,额外引入了视觉导航不确定性。此外,伪标签后处理虽采用非极大值抑制等手段纠错,但小目标的分割精度依然趋近于零,进一步凸显了该数据集在感知与标注双重维度上的严峻挑战。
常用场景
经典使用场景
在农业机器人视觉感知领域,BUTom21与BUTom-ST21数据集为番茄作物的细粒度实例分割与时空追踪提供了宝贵资源。其经典使用场景聚焦于基于像素级成熟度分类的果实检测与分割,尤其适用于真实温室环境中密集、遮挡及尺度多变条件下的视觉任务。研究者可借助该数据集训练模型,实现对番茄果实从绿色到完全红色的五类成熟阶段精确辨识,并完成前景与背景中所有果实的全像素标注,从而推动实例级语义理解在园艺作物上的应用。
衍生相关工作
该数据集衍生了一系列经典工作,包括利用PAg-NeRF辐射场技术生成伪标签的弱监督框架,以及基于Mask2Former与YOLOv26的跨模型基准对比。后续研究在此基础上发展了CTVIS等视频实例分割方法,并探讨了Snapshot Ensemble、蒙特卡洛Dropout等不确定性估计策略在作物异常检测中的表现。此外,基于深度滤波与轨迹后处理优化伪标签质量的方案,进一步拓展了该数据集在无里程计条件下进行时空建模的通用范式。
数据集最近研究
最新研究方向
在农业机器人视觉感知领域,数据集匮乏长期制约着基于学习的模型在作物监测、采收与表型分析等任务中的泛化能力。BUTom21与BUTom-ST21数据集的发布,精准回应了这一核心瓶颈,为番茄这一全球产量占比近20%的重要园艺作物提供了首个兼具高分辨率RGB-D静态图像与时空视频序列的标注资源。前沿研究方向聚焦于利用弱监督与伪标签技术突破手工标注的规模限制:研究团队基于PAg-NeRF神经辐射场方法,从有限的手工标注静态图像生成大规模时空序列的伪标签,并借助Mask2Former与YOLO26等模型实现实例分割与跟踪的一致性矫正。这一范式不仅将番茄果实计数与成熟度评估从静态图像拓展至动态视频场景,更在视频实例分割与多目标跟踪任务上建立了从伪标签训练到手工人校正评估的完整基准。该数据集对于推动农业领域从封闭式检测迈向开放世界感知、降低机器人部署对昂贵标注的依赖具有里程碑式意义,为真实温室环境下同质化果实的长期追踪与精细表型分析提供了关键支撑。
相关研究论文
  • 1
    Still image and spatial-temporal tomato data enabling detection, segmentation, tracking, and video-instance segmentation using strong and weak labels波恩大学; 联邦科学与工业研究组织 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务