遇见数据集

HotSight

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

HotSight是一个用于野火热点分割的配对RGB-热红外无人机数据集。该数据集由DJI Mavic 2 Enterprise Dual无人机在两个规定燃烧区域(Canopy单元和Graminoid单元)采集的视频中提取,共计951个同步的RGB-热红外帧对(分辨率为2688×1512,热红外为640×360)。每个RGB帧的每个像素均被手动标注为五类之一:active(明火)、smoldering(阴燃)、warm(预热)、background(背景)或unknown(未知),总计约3.87亿个标注像素。数据集还提供了将热红外图像投影到RGB图像的单应性矩阵,支持多模态联合使用。数据规模为12 GB,包含38个可用片段。此外,数据集还提供了额外的自动标注帧(PseudoDataset10s,共2214帧)和与手动标注对应的自动标注(GeneratedAnnotations10s),以及标注工具和重建脚本。基准分割将Graminoid单元的全部455帧作为测试集,Canopy单元提供427帧训练和69帧验证。该数据集适用于语义分割、多模态学习、野火监测等任务。

HotSight is a paired RGB-thermal infrared drone dataset for wildfire hotspot segmentation. The dataset is extracted from videos captured by a DJI Mavic 2 Enterprise Dual drone over two prescribed burn areas (Canopy unit and Graminoid unit), totaling 951 synchronized RGB-thermal infrared frame pairs (RGB resolution: 2688×1512, thermal resolution: 640×360). Each pixel of every RGB frame is manually annotated into one of five classes: active, smoldering, warm, background, or unknown, with approximately 387 million labeled pixels. The dataset also provides homography matrices to project thermal infrared images onto RGB images, supporting multimodal joint use. The data size is 12 GB, comprising 38 available segments. Additionally, the dataset includes extra auto-annotated frames (PseudoDataset10s, 2214 frames) and auto-annotations corresponding to manual annotations (GeneratedAnnotations10s), along with annotation tools and reconstruction scripts. The default split uses all 455 frames from the Graminoid unit as the test set, while the Canopy unit provides 427 frames for training and 69 frames for validation. This dataset is suitable for tasks such as semantic segmentation, multimodal learning, and wildfire monitoring.

创建时间:
2026-08-25
原始信息汇总

HotSight 数据集概述

基本信息

  • 数据集名称:HotSight
  • 任务类型:图像分割(语义分割)
  • 数据规模:少于1000个样本(n<1K)
  • 标签类别:野火、计划烧除、热红外、RGB-热红外多模态、无人机

数据集简介

HotSight是一个无人机拍摄的RGB-热红外配对数据集,用于在像素级别上映射燃烧状态。数据由DJI Mavic 2 Enterprise Dual无人机在两次计划烧除中采集,包含951对同步的RGB-热红外帧对(约每10秒采样一对,共38个可用片段),并对每个RGB帧的每个像素进行标注,分为五类:active、smoldering、warm、background、unknown,共手工标注了38.7亿像素。每个帧还带有将热红外图像映射到RGB图像的单应性矩阵,便于多模态联合使用。

数据划分

数据集的基准划分将全部455个Graminoid帧作为测试集,Canopy单元提供427个训练帧和69个验证帧(见Data/splits_graminoid.csv)。同一飞行块内的片段被分到一起,保证验证集包含完整飞行块。另有镜像划分方案Data/splits_canopy.csv,以Canopy作为测试集。

各划分的类别像素占比(%,Graminoid为测试集的划分):

类别 训练 验证 测试 全部
Active 1.8 1.2 3.7 2.7
Smoldering 11.3 3.2 16.2 13.0
Warm 12.4 1.4 33.9 21.9
Background 72.6 93.6 40.9 59.0
Unknown 2.0 0.6 5.2 3.4
帧数 427 69 455 951

五个类别定义

ID 类别 操作定义 叠加颜色
1 Active 有可见火焰的材料 深红 (150, 0, 0)
2 Smoldering 有可见烟雾但无火焰的材料 橙色 (255, 128, 0)
3 Warm 已燃烧但无火焰或烟雾的可见材料 黄色 (255, 230, 0)
4 Background 无燃烧迹象的植被或地面 绿色 (0, 200, 0)
5 Unknown 烟雾、植被或其他遮挡物导致无法直接判断 黑色 (0, 0, 0)

数据结构

主要目录

  • Data/:核心数据集,951对手工标注帧对,约12GB。包含Canopy(22个片段,496对帧,作为训练+验证)和Graminoid(18个片段,455对帧,作为测试)两个单元
  • PseudoDataset10s/:2,214个额外帧,带自动生成的标签,约29GB,可用于训练增强
  • GeneratedAnnotations10s/:与Data/相同帧的自动生成标签,约10GB,仅用于对比参考
  • annotation_tool/:自动标注流水线,含YOLO权重和SAM检查点,约364MB
  • html/:浏览器工具(视频同步播放器、图像配准工具等)
  • scripts/:数据集构建脚本
  • markdown/:构建笔记文档
  • AnnotationHomography/:仅掩码和单应性矩阵(无图像)
  • sync.csv:40对源视频及其手动估计的IR时间偏移
  • previews/:降采样预览数据(仅用于Dataset Viewer,不建议用于训练)

片段文件夹布局

每个片段文件夹包含:

  • rgb/fXXXXX.png:RGB帧,2688 x 1512分辨率
  • ir/fXXXXX.png:彩色热红外帧,640 x 360分辨率(部分片段含ir/fXXXXX_recovered.png清理版本)
  • mask/fXXXXX.txt:标签掩码(文本格式,每像素一位数字,值1-5)
  • mask/fXXXXX_overlay.jpg:标签叠加在RGB帧上的可视化
  • homography/homography.json:IR到RGB的单应性矩阵(每个连续帧范围一个)
  • homography/points.json:拟合矩阵所用的点对应关系

掩码格式

每个掩码文件为单行,包含2688 x 1512 = 4,064,256个ASCII数字(值1-5),按行优先排列,无分隔符或换行符。每个像素都有标签。

采集信息

  • 地点:Tall Timbers研究站和土地保护区的Livingston Place,两次计划烧除
  • 时间:2026年3月18-20日
  • 平台:DJI Mavic 2 Enterprise Dual无人机
    • RGB相机:2688 x 1512分辨率,约30fps
    • 热红外相机:非制冷FLIR Lepton(8-14微米),640 x 360彩色输出,8.7fps,板载上采样自原生160 x 120阵列,多数片段使用低增益设置以避免余烬和热点饱和
  • 飞行方式:混合了静止俯视和倾斜视角、横向和前进飞行、在阴燃区域悬停以及围绕热点进行环绕飞行,视角、运动和目标尺度多样

数据同步与配准

  • 时间同步:两相机独立记录,通过手动估计40对视频的IR起始偏移(范围-1.1至+0.15秒),每个采样RGB帧匹配时间上最近的热红外帧,残余时间间隙中位数为0.028秒,最大0.798秒
  • 空间配准:每个片段的连续帧范围有投影单应性矩阵(IR像素到RGB像素),共使用122个矩阵(38个片段),其中38个基于手动点击地标拟合,82个基于生成的网格,2个复制自同一飞行的前一片段。38个地标拟合的控制点RMSE中位数为2.03像素,最大15.13像素(2688 x 1512分辨率下)

已知问题

  • 空片段Canopy-19(0.2秒)和Graminoid-03(6秒IR)在第一个采样点(10秒)前结束,无帧
  • 混合热红外:部分片段的相机将热红外流与RGB混合(MSX风格),87个受影响帧提供清理后的ir/fXXXXX_recovered.png文件
  • 异常调色板Canopy-16使用与其他片段不一致的热红外配色方案
  • 复制的单应性矩阵Graminoid-11Graminoid-14points.json,矩阵复制自同一飞行的前一片段
  • 移除片段:不可用的视频范围(摄像机转向、移动等)在采样前被裁剪

自动生成标签

两个文件夹包含由流水线(annotation_tool/中的训练YOLO检测器和IR热点阈值提出区域,SAM生成逐像素掩码)生成的标签,格式与Data/相同:

  • PseudoDataset10s/:额外新帧(每个300帧间隔的+50、+150、+250偏移处采样),共2,214帧、33个片段,用于训练增强
  • GeneratedAnnotations10s/:与Data/现有帧对应的生成标签,共775帧、31个片段,仅用于对照参考

第三方组件

  • annotation_tool/sam_vit_b_01ec64.pth:Meta AI的Segment Anything ViT-B检查点
  • html/mp4box.all.min.js:MP4Box.js库

注意:该数据集伴随一篇处于双盲评审中的论文,作者、引用和许可证信息将在评审结束后添加。

搜集汇总
数据集介绍
HotSight 数据集图片
构建方式
HotSight数据集源于对两场计划燃烧的无人机航拍,利用DJI Mavic 2 Enterprise Dual同步采集RGB与热红外视频流。从38个有效片段中每隔约10秒采样一帧,共获得951对时空对齐的RGB-热红外图像对,并对每张RGB图像的每个像素进行手工标注,划分为活跃燃烧、阴燃、余温、背景及未知五类,累计标注像素达38.7亿。数据构建过程中,采用人工估算的同步偏移与逐片段拟合的单应性矩阵实现跨模态配准,并额外生成2214帧带自动伪标签的扩展样本,以增强训练数据多样性。
特点
该数据集的核心特色在于像素级燃烧状态标注与双模态融合设计。其五分类体系涵盖从明火到背景的完整燃烧演化阶段,且未知类被视作真实可预测类别而非忽略标签。热红外图像经由单应性映射至RGB空间,使两种模态可协同用于语义分割。数据采集航班涵盖悬停、倾斜、侧飞及环绕等多种视角,呈现目标尺度与运动状态的显著变化。基准划分采用按燃烧场地隔离的策略,考验模型跨场景泛化能力,同时类别分布极不均衡,活跃像素占比不足4%,对算法鲁棒性构成挑战。
使用方法
使用者可通过HuggingFace仓库下载完整数据(59GB)或按需选取子集。每帧样本包含RGB图像、热红外图像、像素级标注掩码及配准所需的单应性矩阵文件,掩码以紧凑的ASCII数字串存储,便于高效读取。提供了Python示例代码,展示掩码解析与热图像投影至RGB空间的方法,并附有清晰的数据索引CSV文件,便于枚举样本与划分训练集。额外提供的伪标注数据集可用于训练增强,但需注意其生成标签的参考性质。同时,开源了自动标注流水线与数据重建脚本,支持研究者复现数据集构建流程或对自有双模态影像进行标注处理。
背景与挑战
背景概述
HotSight数据集由Tall Timbers研究站与土地保护协会的研究人员于2026年3月创建,旨在应对野火热点像素级分割的挑战。该数据集利用DJI Mavic 2 Enterprise Dual无人机,在两次计划燃烧中同步采集RGB与热红外视频,精选951对已配准的RGB-热红外帧,并对每帧RGB图像的所有像素(总计38.7亿像素)进行了精细标注,分类为活跃燃烧、阴燃、温热、背景和未知五类。HotSight的发布为多模态遥感图像分割领域提供了首个带有密集手工标注的野火燃烧状态数据集,其独特的跨模态配准流程和完整的基准划分,对推动火灾监测、无人机视觉和语义分割研究具有重要影响力。
当前挑战
HotSight数据集面临多重挑战。在领域问题层面,野火热点分割需处理严重的类别不平衡(活跃像素占比不足4%)、跨场地类别分布漂移(两个燃烧单元的火势状态差异显著),以及烟雾遮挡导致的标签不确定性,这些因素考验模型的泛化与鲁棒性。在构建过程中,同步与配准是主要难点:双相机独立录制导致时间偏移(最大残差0.798秒),空间对准需拟合122个单应矩阵,控制点误差中位数2.03像素,但运动、视差和漂移仍带来不可避免的误配准。此外,手工标注38.7亿像素耗时巨大,且需定义主观的燃烧状态类别,同时还需处理红外图像饱和、色彩异常等数据质量问题,最终通过引入自动标注管道生成辅助数据集以缓解标注负担。
常用场景
经典使用场景
HotSight数据集作为首个配对RGB-热红外无人机影像的野火燃烧状态像素级分割基准,其经典使用场景聚焦于多模态语义分割模型的训练与评估。研究者可基于951对同步帧,利用其细粒度的五类标注(活跃燃烧、阴燃、温热、背景、未知)开展燃烧状态的空间精细化制图。该数据集提供的单应性矩阵使热红外与可见光影像得以精确配准,从而支持跨模态特征融合算法的开发,推动无人机遥感在火灾动态监测中的定量化应用。
实际应用
在实际应用中,HotSight直接服务于无人机(UAV)森林火灾的实时监测与应急响应系统。基于该数据集训练的模型可自动识别火线位置、阴燃区域及余火热点,为消防指挥提供关键态势信息。其配套的自动标注工具链使得将训练成果迁移至自有的RGB-热红外无人机影像成为可能,降低了技术应用门槛。此外,热红外通道对烟雾遮挡区域的穿透能力,为复杂火场环境下的火情侦察与灾后评估提供了有效的技术支撑,展现出在智慧林业与防灾减灾领域的广阔应用前景。
衍生相关工作
HotSight的发布催生了多个方向的相关研究。其基准分割任务直接推动了针对极端类别不平衡问题的损失函数与采样策略创新,如重新加权的对比学习框架。数据集提供的配对模态与单应性变换,衍生出多模态知识蒸馏与跨模态注意力融合的经典工作。此外,基于其自动标注管线(YOLO+SAM)的伪标签生成框架,启发了半监督与弱监督学习方法在遥感视频分割领域的探索。这些衍生工作共同构建了从数据构建、模型设计到应用部署的完整研究生态,持续推动野火智能感知技术的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务