遇见数据集

pyro-sdis-FINAL

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

Pyro-SDIS-FINAL是一个经过精心整理的野火烟雾检测数据集,基于Pyronear的原始pyro-sdis数据集构建。该数据集专注于单类别的烟雾目标检测任务,包含来自法国SDIS(消防部门)合作伙伴部署的约40个固定摄像头在2024年采集的图像。数据集总规模为33,636张图像,其中29,537张用于训练,4,099张用于验证,共包含38,778个烟雾边界框。数据采用YOLO格式组织,包含归一化坐标的标签文件(.txt)和对应的图像文件(.jpg)。其核心价值在于标签质量:通过迭代的模型在环整理流程,对原始数据集进行了大量修正,包括添加缺失的真实框、移除被误标为烟雾的雾框、清理重叠框伪影、解决相邻帧间的不一致性,以及调整漂移的框位置和大小。经验证,使用相同模型和训练配置,整理后的数据集在验证集上的mAP@50性能比原始未整理版本提升了约5个百分点(从~0.71提升至~0.76)。数据集适用于计算机视觉领域的目标检测任务,特别是野火早期检测系统的开发与评估。数据以Apache-2.0许可证发布,使用时需同时引用原始pyro-sdis数据集和本整理版本。

Pyro-SDIS-FINAL is a meticulously curated wildfire smoke detection dataset, built upon the original pyro-sdis dataset from Pyronear. It focuses on single-class smoke object detection tasks, containing images collected in 2024 from approximately 40 fixed cameras deployed by French SDIS (fire department) partners. The dataset has a total size of 33,636 images, with 29,537 for training and 4,099 for validation, encompassing 38,778 smoke bounding boxes. Data is organized in YOLO format, including label files (.txt) with normalized coordinates and corresponding image files (.jpg). Its core value lies in label quality: through an iterative model-in-the-loop curation process, extensive corrections were made to the original dataset, including adding missing ground-truth boxes, removing fog boxes mislabeled as smoke, cleaning overlapping box artifacts, resolving inconsistencies between adjacent frames, and adjusting drifting box positions and sizes. It has been verified that, using the same model and training configuration, the curated dataset improves mAP@50 performance on the validation set by approximately 5 percentage points compared to the original uncurated version (from ~0.71 to ~0.76). The dataset is suitable for object detection tasks in computer vision, particularly for the development and evaluation of early wildfire detection systems. It is released under the Apache-2.0 license and requires citation of both the original pyro-sdis dataset and this curated version when used.

创建时间:
2026-07-23
原始信息汇总

数据集概述

Pyro-SDIS-FINAL 是基于 Pyronear 的 pyro-sdis 数据集,使用 3LC 工具进行完整标签清理后的版本。包含相同的图像,但拥有更干净的标签。所有的边界框修正均通过 3LC 的交互式、模型参与的清理工作流发现并应用。

数据集规模

  • 图像数量: 29,537 张训练图像 + 4,099 张验证图像(与源数据集 pyro-sdis 的分割一致)
  • 边界框总数: 38,778 个经过清理的烟雾边界框
  • 类别数: 1 个类别(smoke,已移除源数据集中的雾标签以形成标准的单类别格式)

数据格式

  • 数据格式: YOLO 格式(class_id cx cy w h 归一化坐标),标签存储在 .txt 文件中,图像为 .jpg 格式

  • 文件结构:

    pyro-sdis-FINAL/ ├── data.yaml # nc=1, names=[smoke] ├── images/{train,val}/.jpg └── labels/{train,val}/.txt

  • 压缩文件:pyro-sdis-FINAL.tar.gz 形式分发,解压命令:tar -xzf pyro-sdis-FINAL.tar.gz

数据来源

  • 原始图像来源: 来自法国消防服务(SDIS)合作伙伴部署在法国的约 40 个固定摄像头,在 2024 年全年拍摄

标签清理过程

使用 3LC 的紧密训练 → 检查 → 修复 → 再训练循环:

  1. 训练一个小型 YOLO 模型在当前标签上
  2. 将每个样本的指标(每张图像的 TP/FP/FN, IoU, 置信度, 嵌入)收集回 3LC
  3. 在 3LC 仪表板中标注标签噪声候选——按模型预测与真值之间的差异排序/过滤,按嵌入聚类,标记相邻帧的不一致性
  4. 直接在 3LC 仪表板中逐行编辑标签(添加、删除、移动、调整边界框大小;丢弃不良样本)
  5. 将编辑提交为新表修订版本并再训练——重复直至噪声消失

3LC 发现并修复的问题

  • 遗漏的真值框——模型自信检测到但标注者遗漏的烟雾
  • 虚假框——错误标记为烟雾的雾,以及幻觉标注
  • 重叠框伪影——源数据集的 SAM 自动标注有时在一个烟羽上堆叠重复框;3LC 的每张图像 IoU 指标使这些问题易于发现和去除
  • 相邻帧不一致——来自同一摄像头的相邻帧在烟雾存在或框数量上标签不一致
  • 框几何漂移——自动标签偏离实际烟羽的位置/大小被修正

验证集的特殊说明

验证集与训练集一样嘈杂,需要大量的修正——包括数百次框的编辑、添加和删除。使用原始的 pyro-sdis 验证标签进行基准测试会产生不可靠的信号,因为许多地方的真值本身是错误的。模型可能因验证集噪声标签中不包含的正确检测而受到惩罚,或因匹配错误标签而获得奖励。此处的清理验证集提供了更可信的评估目标。

许可证

  • 许可证: Apache-2.0(与源数据集一致)

使用示例(Ultralytics)

python from ultralytics import YOLO

model = YOLO("yolov8n.pt") model.train(data="pyro-sdis-FINAL/data.yaml", epochs=30, imgsz=640)

引用

搜集汇总
数据集介绍
pyro-sdis-FINAL 数据集图片
构建方式
Pyro-SDIS-FINAL数据集是基于Pyronear团队原始发布的pyro-sdis数据集,通过3LC工具进行系统性标签精修的产物。该精修流程采用模型在环的交互式数据调试范式:首先基于现有标签训练一个小型YOLO模型,随后收集每样本的度量指标(如每张图像的真阳性、假阳性、假阴性数量以及交并比与预测置信度)并回灌至3LC平台。在3LC仪表盘中,通过排序、过滤模型预测与真实标签之间的分歧项、按嵌入向量聚类以及标记相邻帧间不一致性等手段,精准定位噪声标签候选。最后,直接在仪表盘上以逐行方式编辑标签(包括添加、删除、移动、调整边界框尺寸以及剔除不良样本),并将编辑结果作为新版本的表修订进行提交,随即重新训练模型,如此循环直至标签噪声被有效消除。整个精修过程被3LC以版本化表修订的形式完整记录,确保了可复现性与可审计性。
特点
该数据集的核心特点在于其标签质量经过严谨且可追溯的精修流程大幅提升。3LC工具在此过程中识别并修正了多种标签问题:首先,补充了模型高置信度检测到但标注者遗漏的真实烟雾框;其次,清除了被错误标记为烟雾的雾气以及模型产生的幻觉标注;第三,剔除了原始数据集中因SAM自动标注导致的重复重叠框;第四,修正了同一相机相邻帧间在烟雾存在性或边界框数量上的不一致;最后,调整了因自动标注偏移而脱离实际烟羽的边界框位置与尺寸。值得强调的是,验证集同样经历了与训练集同等强度的精修,这一举措意义深远,因为原始验证集中的标签噪声会严重干扰模型评估的可靠性,而精修后的验证集则为模型性能提供了更值得信赖的评估基准。数据集包含29,537张训练图像与4,099张验证图像,共计38,778个精修后的烟雾边界框,仅包含单一类别“烟雾”。
使用方法
该数据集以YOLO格式提供,每个边界框由类别ID、归一化中心坐标(cx, cy)及归一化宽高(w, h)组成,并以.txt文件与对应的.jpg图像文件并行组织。用户可通过解压pyro-sdis-FINAL.tar.gz压缩包获取完整目录结构,其中包含定义类别数量的data.yaml配置文件以及分别存储于images和labels目录下的训练集与验证集图像与标签文件。该数据集无缝兼容Ultralytics框架,用户仅需加载YOLO模型(如yolov8n.pt)并调用train方法,指定data.yaml路径、训练轮数与图像尺寸即可开始训练。此外,用户若希望在自己的数据上复现这套模型在环的精修流程,可参考3LC平台及其与Ultralytics的集成实现。
背景与挑战
背景概述
Pyro-SDIS-FINAL数据集由法国非营利组织Pyronear于2024年创建,旨在提升基于计算机视觉的野外火灾烟雾检测的准确性。该数据集源自Pyronear与法国消防部门(SDIS)合作部署的约40个固定摄像头所捕获的影像,原始版本为pyro-sdis数据集。核心研究问题聚焦于如何通过精细的数据标注曲复(Curation)手段,消除自动标注过程中引入的噪声,从而为模型提供更可靠的训练与评估基准。Pyronear致力于开源人工智能在火灾早期探测中的应用,该数据集的发布对于提升野火监测系统的泛化能力和鲁棒性具有重要影响,尤其推动了烟雾检测任务中数据质量优化与模型迭代方法的结合。
当前挑战
该数据集主要应对两大挑战:其一,所解决的领域问题源于野外火灾烟雾检测的固有困难,包括烟雾形态多变、背景干扰(如雾霾、云层)以及在不同光照和天气条件下的一致性检测需求,亟需高精度标注数据以训练可靠的检测模型。其二,构建过程中面临显著的数据噪声挑战,原始pyro-sdis数据集的自动标注存在漏标、误标(如将雾误标为烟)、重叠框及相邻帧标注不一致等问题。此外,验证集同样含有大量噪声,若直接用于评估将产生误导性结果。为此,研究团队利用3LC工具开展交互式、模型引导的标注曲复,通过反复训练、检查、修正的闭环流程,完成了对近3万张训练图像和4千余张验证图像中所有边界框的精确校正,确保了数据集的高质量和可信度。
常用场景
经典使用场景
在野火烟雾检测领域,Pyro-SDIS-FINAL数据集被广泛用于训练和评估基于深度学习的视觉目标检测模型,尤其是YOLO系列模型。该数据集包含近3.4万张来自法国消防部门部署的固定摄像头的图像,每张图像均带有经过精细校验的烟雾边界框标注,使得模型能够在复杂野外环境下精准识别烟雾目标。研究者通常将其作为标准基准,以验证烟雾检测算法在真实部署场景中的鲁棒性与准确性。
衍生相关工作
基于Pyro-SDIS-FINAL衍生了一系列重要工作:3LC工具的开发者通过该数据集验证了交互式模型引导的数据校正流程,证明了在训练-检查-修复-再训练循环中持续提升标注质量的有效性。后续研究借鉴其噪声处理策略,开发了半自动标注校验方法,并催生了针对时间序列视频帧一致性的检测器改进工作。该数据集也常与其他野火数据集联合使用,构建更全面的评测协议。
数据集最近研究
最新研究方向
在森林火灾早期检测的前沿领域,Pyro-SDIS-FINAL数据集代表了基于视觉的烟雾检测从粗粒度标注向高保真标签演进的关键突破。该数据集通过3LC工具链的模型在环主动学习机制,系统性地修正了原始数据集中的漏标、误标和邻帧不一致等标注噪声,尤其针对验证集进行了同等力度的精炼,解决了因标签质量参差导致的模型性能评估失真问题。这一工作凸显了当前研究中对数据质量工程重要性的重新审视——即数据清洁度与模型鲁棒性在真实部署中的强耦合关系,为构建可信的遥感视觉管线提供了可复现的数据治理范式。随着法国SDIS消防网络持续部署固定摄像头,该数据集已嵌入到面向2024全年监控数据流的持续学习生态中,标志着烟雾检测从静态单次训练向动态数据迭代的策略转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务