遇见数据集

SegFly

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

SegFly是一个大规模航拍语义分割数据集,旨在支持RGB-热成像多模态语义分割研究。数据集包含20,606张高分辨率RGB图像和15,007组像素对齐的RGB-热成像图像对,总计35,613个样本。数据采集于多样化的环境,并在三种不同的无人机飞行高度(30米、40米、50米)下进行。数据集提供了精细的语义标注,涵盖15个基准类别,包括道路、人行道、泥土、砾石、草地、植被、树木、地面障碍物、车辆、水体、建筑物、屋顶、停车场、施工区域和卡车。数据按照场景和传感器模态(RGB或热成像)进行了划分,包含训练集、验证集和测试集。每个数据样本包含原始图像、语义分割标签、场景标识符、飞行高度和模态信息。对于热成像样本,还提供了配准后的RGB图像。该数据集适用于计算机视觉领域的语义分割任务,特别是多模态(RGB与热成像)融合、航拍图像理解、遥感分析以及相关算法的开发与评估。

SegFly is a large-scale aerial semantic segmentation dataset designed to support RGB-thermal (RGB-T) multimodal semantic segmentation research. The dataset includes 20,606 high-resolution RGB images and 15,007 pixel-aligned RGB-thermal image pairs, totaling 35,613 samples. Data was collected in diverse environments and at three different drone flight altitudes (30 meters, 40 meters, 50 meters). The dataset provides fine-grained semantic annotations covering 15 benchmark categories, including road, sidewalk, dirt, gravel, grass, vegetation, tree, ground obstacle, vehicle, water body, building, roof, parking lot, construction area, and truck. Data is divided based on scene and sensor modality (RGB or thermal), containing training, validation, and test sets. Each data sample includes the original image, semantic segmentation labels, scene identifier, flight altitude, and modality information. For thermal samples, registered RGB images are also provided. The dataset is suitable for semantic segmentation tasks in computer vision, particularly for multimodal (RGB and thermal) fusion, aerial image understanding, remote sensing analysis, and the development and evaluation of related algorithms.

创建时间:
2026-06-26
原始信息汇总

SegFly 数据集概述

SegFly 是一个大规模航空语义分割数据集,专注于 RGB 和热红外(RGB-T)多模态场景理解,总样本数为 35,613(20,606 张 RGB 图像 + 15,007 张热红外图像),图像分辨率为高分辨率,采集自 9 个不同场景三种飞行高度(30m、40m、50m)。

数据集结构

特征 类型 描述
image Image 原始传感器帧(RGB 或长波红外热成像)
label Image 8 位单通道语义掩码,映射到 15 个基准类别
RGB_aligned Image 已配准的 RGB 图像(仅热红外模态提供;RGB 模态返回 None
scene string 场景标识符("scene_01""scene_09"
altitude string 飞行高度("30m""40m""50m"
modality string 传感器模态("RGB""thermal"

数据集划分与统计

模态 划分 场景 样本数
RGB 训练集 scene_01 ~ scene_05 14,738
验证集 scene_06scene_07 1,965
测试集 scene_08scene_09 3,842
热红外 训练集 scene_03 ~ scene_05 12,063
验证集/测试集 scene_09 2,944

类别映射(15 个基准类 + 未标注类)

类别 ID 类别名称 RGB 颜色
0 未标注/忽略 [0, 0, 0]
1 道路 [128, 0, 128]
2 人行道 [204, 163, 72]
3 泥土 [128, 0, 0]
4 砾石 [192, 192, 192]
6 草地 [0, 255, 0]
7 植被 [112, 148, 32]
8 树木 [64, 64, 0]
9 地面障碍物 [255, 255, 0]
13 车辆 [0, 128, 128]
14 水体 [0, 0, 255]
16 建筑物 [255, 0, 0]
17 屋顶 [64, 160, 120]
33 停车场 [128, 64, 128]
34 施工区域 [240, 120, 120]
36 卡车 [128, 128, 64]

使用方式

通过 Hugging Face datasets 库加载:

python from datasets import load_dataset

dataset = load_dataset("markus-42/SegFly")

引用信息

bibtex @inproceedings{gross2026segfly, title={{SegFly: A Dataset and 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale}}, author={Markus Gross and Sai Bharadhwaj Matha and Rui Song and Viswanathan Muthuveerappan and Conrad Christoph and Julius Huber and Daniel Cremers}, booktitle = {Proceedings of the European Conference on Computer Vision (ECCV)}, year={2026}, }

许可协议

采用 CC BY-NC-SA 4.0 许可协议。

搜集汇总
数据集介绍
SegFly 数据集图片
构建方式
无人机遥感领域的语义分割研究长期受限于多模态数据的匮乏与标注规模的不足,SegFly数据集应运而生。该数据集由20,606张高分辨率RGB图像与15,007组精确像素对齐的RGB-热红外(RGB-T)对构成,总计35,613个样本,所有数据均通过无人机在三个飞行高度(30米、40米、50米)采集,覆盖9个多样化场景。数据集依据场景划分为训练集、验证集与测试集,RGB模态中的5个场景用于训练,2个场景用于验证,2个场景用于测试;热红外模态则采用3个场景训练,以1个场景作为验证与测试。这一精心设计的划分策略确保了多模态数据在空间分布上的独立性与评价的公平性。
特点
SegFly数据集的核心特色在于其大规模的多模态融合能力与精细的语义标注体系。数据提供像素级别对齐的RGB与热红外图像对,支持跨模态语义分割模型的训练与评估。标注体系涵盖了包括道路、步行道、草地、植被、车辆、建筑、水体等在内的15个地物类别,每类均赋予明确的RGB颜色编码,便于可视化与模型评估。数据集内嵌的元数据(如场景标识、飞行高度、传感器模态)为研究环境变化对分割性能的影响提供了丰富维度。此外,其引入的2D-3D-2D范式预示着在多模态信息交互与空间理解方面的创新潜力。
使用方法
研究者可通过Hugging Face Datasets库便捷地加载SegFly数据集,只需一行代码即可获取完整的35,613个样本,极大降低了数据准备的复杂性。加载后,每个样本以字典形式呈现,包含RGB或热红外图像、类别标签掩膜、对齐图像(针对热红外模态)、场景ID、飞行高度以及传感器模态等字段。数据集采用标准的Hugging Face Image格式,可直接与Torchvision、PyTorch等深度学习框架结合,用于语义分割模型的训练与评估。标注掩膜为单通道8位图像,需根据提供的类别映射表进行可视化或转换,以匹配特定模型的输入格式。
背景与挑战
背景概述
SegFly是由Markus Gross、Sai Bharadhwaj Matha、Rui Song等来自慕尼黑工业大学等机构的研究者于2026年在欧洲计算机视觉大会(ECCV)上提出的大规模航拍RGB-热红外语义分割数据集。该数据集包含20,606张高分辨率RGB图像和15,007对齐的RGB-热红外图像对,覆盖多个场景与三种飞行高度(30m、40m、50m),并标注了15个精细的地物类别。SegFly填补了航拍多模态语义分割领域大规模基准数据的空白,为无人机在复杂环境下的自主感知与环境理解提供了关键支撑,有效推动了遥感与计算机视觉交叉方向的研究进展。
当前挑战
SegFly数据集主要应对以下挑战:其一,航拍场景中RGB与热红外成像存在显著模态差异,如何在光照不足、遮挡等复杂条件下实现像素级精确对齐与语义分割,是提升无人机全天候感知能力的关键问题;其二,构建过程中需解决多源传感器同步、跨高度几何畸变校正以及大规模像素级标注所带来的高昂人力成本,数据集通过引入2D-3D-2D范式实现了高效热红外像素标注,为后续多模态航拍基准的建立提供了方法论参考。
常用场景
经典使用场景
SegFly数据集专为空中RGB-热红外语义分割任务而设计,其独特的2D-3D-2D范式为多模态遥感图像分析提供了强大的数据支撑。该数据集涵盖了9个不同场景和3种飞行高度(30米、40米、50米),采集了超过2万张高分辨率RGB图像与1.5万对齐的RGB-热红外图像对。经典使用场景聚焦于利用可见光与热红外模态的互补信息,实现复杂环境下的像素级语义理解。研究者常借助该数据集训练跨模态分割模型,以同时捕获目标的纹理细节与温度特征,从而提升对车辆、建筑物、植被、道路等15个地物类别的识别精度,尤其适用于光照变化剧烈或夜间条件下的场景解析。
衍生相关工作
围绕SegFly数据集,学术界已衍生出一系列经典研究工作。其中,原始的2D-3D-2D跨模态学习范式成为核心贡献,启发了后续利用三维几何信息辅助多模态分割的思路。后续工作包括提出面向空中视角的轻量化跨模态注意力模块,以及设计热红外增强的知识蒸馏框架。此外,该数据集被广泛用作基准,评估各类多模态融合网络如RGB-T深度交互模型、双流Transformer架构的性能。其高分辨率、多高度变化的特性也催生了多尺度语义分割新方法,推动了无人机视觉领域在动态场景理解与迁移学习方向上的持续突破。
数据集最近研究
最新研究方向
SegFly数据集的出现,为航空航拍领域中的多模态语义分割研究注入了全新活力。该数据集不仅提供了大规模、高分辨率的RGB与热红外对齐图像对,还创新性地提出了2D-3D-2D的跨维度分析范式,使得模型能够在不同飞行高度(30m、40m、50m)及多样化场景下,更精准地识别道路、车辆、建筑等15类地物要素。结合近期无人机自主巡检与低空经济热潮,SegFly在强化弱光照、烟雾遮挡等复杂环境下的感知鲁棒性方面展现出巨大潜力,为推动全天候、高可靠性的无人系统环境理解奠定了关键数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务