遇见数据集

AerialPS

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

AerialPanoptic是一个面向无人机航拍图像的开源词汇全景分割基准数据集。它整合了来自五个不同无人机数据集的图像,构建统一的基准用于评估和推进无人机场景下的全景分割技术。数据集采用基础模型辅助的标注流程,经过类别归一化、分类审核和确定性后处理生成标注。训练集和验证集使用冻结的伪全景标注,测试集则经过人工精修和独立审核,确保评估可靠性。数据规模在10,000到100,000张图像之间。该数据集主要支持以下任务:全景分割(联合识别和分割可数物体“things”和不可数区域“stuff”)、实例分割与目标检测(利用实例掩码及其导出边界框)、语义分割(将全景图转换为类别级语义图)、视觉定位(以类别名称为文本查询,对应全景掩码和边界框作为定位目标)、以及小目标感知(高分辨率无人机图像适合研究尺度变化、密集小目标、精细边界和高效推理)。当前标注不包含自由形式的指代表达,但研究者可扩展添加自然语言描述。数据集文件、格式文档和评估说明将随仓库发布。

AerialPanoptic is an open-vocabulary panoptic segmentation benchmark dataset for drone aerial images. It integrates images from five different drone datasets, constructing a unified benchmark for evaluating and advancing panoptic segmentation in drone scenarios. The dataset uses a foundation model-assisted annotation pipeline, with category normalization, classification review, and deterministic post-processing. The training and validation sets use frozen pseudo-panoptic annotations, while the test set undergoes manual refinement and independent review to ensure reliable evaluation. The dataset size ranges from 10,000 to 100,000 images. It supports tasks including panoptic segmentation (joint recognition and segmentation of countable things and uncountable stuff), instance segmentation and object detection (using instance masks and derived bounding boxes), semantic segmentation (converting panoptic maps to class-level semantic maps), visual grounding (using category names as text queries with corresponding panoptic masks and bounding boxes as localization targets), and small object perception (high-resolution drone images suitable for studying scale variation, dense small objects, fine boundaries, and efficient inference). Current annotations do not include free-form referring expressions, but researchers can extend with natural language descriptions. Dataset files, format documentation, and evaluation instructions will be released with the repository.

创建时间:
2026-07-30
原始信息汇总

AerialPanoptic是一个面向航空开放词汇全景分割(aerial open-vocabulary panoptic segmentation)的基准数据集,旨在将开放词汇全景场景理解扩展到无人机(UAV)影像领域。

数据集概况

  • 名称:AerialPanoptic(pretty_name)
  • 任务类型:图像分割(image-segmentation)
  • 规模:10K < 样本数 < 100K(10K<n<100K)
  • 标签:航空影像、无人机、全景分割、开放词汇分割、计算机视觉
  • 配置:默认配置(default),包含测试集(test)数据文件(viewer/udd_test.parquet)

数据来源与构建

该数据集整合了来自五个无人机数据集(包括AerialVG、AerialSense、UDD、VDD、MESSI)的影像,统一为一个基准。构建过程采用:

  1. 基础模型辅助的标注流程(foundation-model-assisted annotation pipeline)
  2. 类别归一化(category normalization)
  3. 分类体系审计(taxonomy auditing)
  4. 确定性后处理(deterministic post-processing)

训练集和验证集使用冻结的伪全景标注,完整测试集经过人工精修并独立审计,以保证评估的可靠性。

设计用途与扩展任务

该数据集主要面向航空开放词汇全景分割,其统一类别体系与像素级全景标注还使其适用于多种航空视觉任务:

任务类型 说明
全景分割 在统一场景表示中联合识别并分割可数对象(things)与不定形区域(stuff)
实例分割与目标检测 thing类别的实例掩膜可直接用于实例分割,包围框可自动派生用于目标检测
语义分割 将全景掩膜按类别合并为类级语义图
视觉定位 以类别名称或模板短语作为文本查询,对应全景掩膜及派生框作为定位目标,无需额外几何标注
小目标航空感知 高分辨率无人机影像适用于研究尺度变化、密集小目标、精细边界及高效推理

当前标注不包含自由形式的指代表达,如需进行指代表达定位或短语定位,研究者可自行添加自然语言描述,并复用现有掩膜与派生框作为空间监督。

可用性

数据集文件、详细格式文档及评估说明将在该仓库中发布。

标注贡献者

  • Jiaxu Tian
  • Jingjun Sun
  • Ming Yang

引用

引用信息将在正式发表时补充。

搜集汇总
数据集介绍
AerialPS 数据集图片
构建方式
AerialPanoptic数据集的构建依托于一种融合基础模型的辅助标注流程,并辅以类别归一化、分类体系审计及确定性后处理等环节,确保标注的一致性与可靠性。该数据集整合了来自五个无人机视觉数据集的高分辨率影像,通过统一的分类体系与像素级全景标注,构建了一个面向航空开放词汇全景分割任务的综合性基准。训练与验证阶段采用冻结的伪全景标注,而测试集则经过人工精细修正与独立审核,以保障评估的严谨性。
特点
该数据集的核心特色在于其面向航空影像的开放词汇全景分割能力,支持对"物体"与"背景"的统一识别与分割。其分类体系与像素级标注不仅适用于全景分割,还可灵活转换以支持实例分割、目标检测、语义分割乃至视觉定位等多类下游任务。高分辨率无人机影像的引入,使其在尺度变化、小目标密集场景及边界精细处理等研究方向具备独到价值。此外,数据集的构建方式与人工审核机制确保了标注质量,为航空视觉感知研究提供了可靠基准。
使用方法
使用AerialPanoptic数据集时,研究者可直接将其用于开放词汇全景分割模型的训练与评估,借助测试集的人工审核标注获得可靠的性能指标。针对特定任务,用户可依据需求将全景掩码转换为实例掩码、包围框或语义图,从而无缝适配实例分割、目标检测及语义分割等框架。对于视觉定位任务,可利用类别名称或模板化短语作为文本查询,将全景掩码及衍生框作为定位目标,无需额外几何标注。数据集还支持扩展,研究者可添加自然语言描述以开展指代表达式定位研究,同时复用现有掩码与框作为监督信号。
背景与挑战
背景概述
AerialPanoptic(简称AerialPS)是由Jiaxu Tian、Jingjun Sun与Ming Yang等研究者于近期构建的面向航空开放词汇全景分割的基准数据集。该数据集旨在突破传统航空影像理解局限于固定类别语义分割的桎梏,通过整合来自AerialVG、AerialSense、UDD、VDD及MESSI五个无人机数据集的丰富影像资源,构建统一的大规模基准。其核心理念在于将开放词汇分割能力引入低空遥感领域,使模型能够识别并分割任意文本描述的物体与区域,从而支撑无人机自主导航、灾害监测及智慧城市等复杂场景的精细感知任务。作为该领域的先驱性工作,AerialPanoptic为航空视觉与多模态理解交叉研究提供了标准化评测平台,有望推动开放世界感知技术在航空影像上的落地与演进。
当前挑战
AerialPanoptic面对的首要挑战在于解决航空影像中物体尺度剧烈变化、密集小目标堆叠以及复杂背景干扰等特性,这对全景分割的粒度与鲁棒性提出了严苛要求。此外,构建过程遭遇多重难题:多源无人机数据集的类别体系差异显著,需设计复杂的类别归一化与语义层级统一流程;采用基座模型辅助标注虽提升效率,但自动化标注伪影需通过人工精细修正与独立审核来确保测试集质量;同时,高分辨率影像与密集实例共存引发的计算资源消耗与标注一致性控制,亦是贯穿数据制作全程的棘手问题。最终,该基准经由确定性后处理与审计,虽攻克了上述壁垒,但仍需在更大规模与更复杂开放词汇场景中持续验证其泛化能力。
常用场景
经典使用场景
AerialPanoptic数据集的核心用途在于推动航空图像开放词汇全景分割技术的发展。该数据集整合了来自五个无人机数据集的图像,构建了统一的基准,支持在无人机视角下对任意语义类别进行像素级识别与分割。其经典使用场景包括全景分割、实例分割、语义分割以及视觉定位等任务,尤其适用于研究高分辨率无人机图像中的尺度变化、密集小目标、精细边界和高效推理等问题。
解决学术问题
该数据集解决了航空图像语义理解中缺乏统一开放词汇基准的学术难题。通过引入基础模型辅助的标注流程和人工精修测试集,它提供了可靠且独立审计的评估依据,使得研究者能够在同一框架下比较不同算法在开放词汇全景分割上的性能。此外,其统一的类别分类法和像素级标注也促进了跨数据集的迁移学习和多任务学习研究,推动了航空视觉感知领域向更通用、更灵活的方向发展。
衍生相关工作
基于该数据集,研究者可以拓展出多项相关经典工作。例如,利用其标注的thing类别可生成实例掩模和边界框,用于训练和评估实例分割与目标检测模型;将全景掩模转换为语义图,可推动语义分割任务的发展;通过将类别名称或模板短语作为文本查询,可衍生出掩模级或框级的视觉定位研究,进一步探索航空图像中的跨模态理解。此外,其高分辨率特性为小目标感知和高效推理算法的设计提供了宝贵的实验平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务