遇见数据集

UAVReason

收藏
github2026-07-05 更新2026-07-07 收录
数据链接:
官方服务:

资源简介:

UAVReason是一个用于无人机视角图像的多模态空中场景推理和生成数据集,基于UAVScenes RGB图像构建,提供VQA/字幕注释、图像到图像生成JSONL文件以及额外的深度数据。该数据集可用于无人机视觉问答、场景字幕生成、空间推理、时间推理、航向推理、深度感知感知和跨模态生成。

UAVReason is a multimodal aerial scene reasoning and generation dataset for unmanned aerial vehicle (UAV) perspective images, constructed based on UAVScenes RGB images. It provides VQA/caption annotations, image-to-image generation JSONL files, and additional depth data. This dataset can be used for UAV visual question answering (VQA), scene caption generation, spatial reasoning, temporal reasoning, heading reasoning, depth perception, and cross-modal generation.

创建时间:
2026-07-04
原始信息汇总

UAVReason 数据集概述

UAVReason 是一个面向无人机视角图像的多模态航拍场景推理与生成数据集,构建于 UAVScenes RGB 图像之上,提供 VQA/字幕标注、图像到图像生成 JSONL 文件及深度数据。

核心功能

该数据集支持以下任务:

  • 无人机视觉问答
  • 无人机场景字幕生成
  • 单帧空间推理
  • 双帧时序推理
  • 无人机航向/运动方向推理
  • 深度感知感知
  • 跨模态生成
  • 无人机多模态模型适配与评估

数据组成

VQA/字幕标注(LLaVA 风格 JSONL)

数据类型 格式 描述
单帧 VQA LLaVA 风格 JSONL 单张无人机图像问答与空间推理
双帧 VQA LLaVA 风格 JSONL 双无人机帧之间的时序变化与关系推理
航向 VQA LLaVA 风格 JSONL 无人机航向/运动方向推理
场景字幕 LLaVA 风格 JSONL 无人机场景字幕生成

图像到图像生成 JSONL(ShareGPT 风格 i2i JSONL)

数据类型 格式 描述
RGB -> 深度 ShareGPT 风格 i2i JSONL 从 RGB 无人机图像生成深度图
RGB -> 语义分割 ShareGPT 风格 i2i JSONL 从 RGB 无人机图像生成语义分割图
深度 + 文本 -> RGB ShareGPT 风格 i2i JSONL 基于深度和文本生成 RGB 图像
分割 + 文本 -> RGB ShareGPT 风格 i2i JSONL 基于分割和文本生成 RGB 图像
深度 + 分割 + 文本 -> RGB ShareGPT 风格 i2i JSONL 基于深度、分割和文本生成 RGB 图像
重建 ShareGPT 风格 i2i JSONL RGB/深度/分割重建

深度数据(独立提供)

数据类型 格式 描述
深度数组 .npy 原始深度数组
深度可视化 _depth_vis.png 灰度深度可视化图
深度统计 _stats.json 深度元数据和统计信息

数据规模

数据集包含以下 VQA/字幕标注样本量:

  • 单帧 VQA:172,037 条
  • 双帧 VQA:57,462 条
  • 航向 VQA:57,456 条
  • 场景字幕:19,903 条

生成任务 parquet 样本总量:159,224 条

数据格式

VQA/字幕格式

遵循 LLaVA 风格 JSONL 格式,每条样本包含:

  • image:图像路径列表
  • conversations:对话序列,包括人类问题和 GPT 回答
  • meta:任务分组、类别统计和评估用元数据

深度数据格式

每个文件包含:

  • {stem}_depth.npy:原始深度数组
  • {stem}_depth_vis.png:灰度深度可视化图
  • {stem}_stats.json:深度统计信息

推荐目录结构

UAVReason/ ├── UAVScenes/ # 来自 UAVScenes 的 RGB 图像 │ └── interval5_CAM_LIDAR/ │ ├── interval5_AMtown01/ │ ├── interval5_AMtown02/ │ └── ... ├── UAVReason_depth/ # 深度文件 │ ├── interval5_AMtown01/ │ │ ├── *.npy │ │ ├── *_depth_vis.png │ │ └── *_stats.json │ └── ... ├── annotations/ # VQA/字幕 JSONL └── i2i_jsonl/ # 生成 JSONL

资源链接

  • 论文:https://arxiv.org/abs/2604.05377
  • 代码:https://github.com/JT-Sun/UAVReason
  • UAVReason VQA/字幕/生成 JSONL:https://huggingface.co/datasets/jarvissun/UAVReason_vqa/tree/main
  • UAVReason 深度数据:https://huggingface.co/datasets/jarvissun/UAVReason_depth
  • UAVScenes 基础数据集:https://github.com/sijieaaa/UAVScenes
搜集汇总
数据集介绍
UAVReason 数据集图片
构建方式
UAVReason数据集构建于UAVScenes的RGB图像基础之上,通过精心设计的标注流程,生成了涵盖视觉问答(VQA)、场景描述、图像生成及深度数据在内的多模态注释。数据集采用LLaVA风格的JSONL格式组织VQA与描述标注,其中单帧VQA用于空间推理,双帧VQA支持时序关系分析,航向VQA聚焦飞行方向理解,场景描述则提供无人机视角的语义概括。此外,面向生成任务,数据集提供了ShareGPT风格的图像到图像JSONL文件,涵盖RGB到深度、RGB到分割、以及多种条件组合下的RGB重建等任务,并额外提供了原始深度数组、灰度可视化和统计信息的深度数据,形成了完整的多模态数据生态。
特点
UAVReason的显著特色在于其统一的多任务设计与无人机视角的独特性。数据集不仅覆盖了单帧空间推理、双帧时序推理和航向推理等多元化视觉问答任务,还整合了图像到图像的生成任务,实现了感知与生成的有机融合。深度数据的引入进一步强化了空间感知能力,使模型能够学习高度信息与场景几何结构。同时,所有标注均围绕无人机俯瞰视角展开,提供了有别于传统地面视角的独特认知维度,为研究视觉语言模型在航空场景下的推理与生成能力提供了高质量的标准化评估基准。
使用方法
UAVReason的使用依托于BAGEL框架,分为VQA/描述和生成两大分支。对于VQA与描述任务,需在BAGEL的data/dataset_info.py中注册对应JSONL路径及样本数量,设置正确的data_dir以指向包含UAVScenes图像的目录。对于生成任务,则需先将JSONL文件转换为unified_edit格式的parquet分片,通过提供的脚本指定输入JSONL、输出目录及深度数据路径,生成包含指令和图像列表的标准格式,随后在dataset_info.py中注册parquet信息。完成注册后,即可采用BAGEL的联合微调命令启动训练,实现多任务协同学习。
背景与挑战
背景概述
随着无人机技术的迅猛发展,基于无人机视角的视觉理解在智慧城市、环境监测与灾害响应等领域展现出巨大潜力。然而,现有视觉语言模型多聚焦于地面视角,对空中场景的空间、时间及方向推理能力极为匮乏。为弥合这一鸿沟,UAVReason数据集应运而生。该数据集由孙金涛、张虎、狄东林、丁刚毅与郑哲东等研究人员于2026年基于UAVScenes的RGB图像构建,涵盖了单帧空间推理、双帧时序推理、航向推理、场景描述及跨模态生成等多项任务。其核心研究问题在于探索视觉语言模型能否从空中视角进行高效推理与生成。通过统一的多模态标注与生成框架,UAVReason为空中场景的视觉推理设立了全新基准,推动了视觉语言模型在高空复杂环境中的应用边界。
当前挑战
UAVReason所应对的领域挑战主要源于空中视角的独特复杂性:无人机图像视角多变、尺度差异显著、目标遮挡频繁,且需要同时理解空间关系、时序变化与航向信息,对视觉语言模型的联合推理能力提出了严苛要求。在构建过程中,研究者面临多重技术难题:首先,需为海量高空RGB图像生成高质量的多模态标注,包括空间问答、时序变化、航向方向与场景描述,确保标注的一致性与语义准确性;其次,深度图与语义分割图的获取依赖传感器融合与算法预测,数据质量与对齐精度直接影响下游生成任务;此外,将VQA标注与生成任务统一为LLaVA与ShareGPT格式,并适配BAGEL训练框架,要求繁琐的数据转换与路径配置。这些挑战共同构筑了UAVReason数据集在构建与使用中的核心难点。
常用场景
经典使用场景
UAVReason数据集专为无人机视角下的多模态空中场景推理与生成任务而设计,其核心应用场景涵盖了无人机视觉问答、场景描述生成、空间推理、时间推理、航向推理以及深度感知等。该数据集以UAVScenes提供的RGB图像为基础,构建了海量的VQA与描述标注,并引入了单帧与双帧两种推理模式,使得模型能够理解静态场景中的物体分布与空间关系,同时捕捉连续帧之间的动态变化与运动趋势。航向推理任务进一步拓展了模型对飞行器姿态与运动方向的理解能力,为开发具备全面空中场景认知能力的视觉语言模型提供了标准化的训练与评估平台。
实际应用
在实际应用层面,UAVReason数据集所驱动的技术具备广阔的落地前景。基于其单帧与双帧推理能力,可支撑无人机在灾害评估、农业监测、交通巡查与城市巡检等场景中实现实时的场景问答与异常事件检测。深度与分割图的生成任务则增强了无人机对环境的几何理解与语义分割能力,有助于3D重建、避障规划与精细化地图构建。描述生成能力可自动化输出巡逻区域的状态报告,减少人工判读负担。航向推理功能还能辅助无人机在GPS受限环境下进行自主定位与运动判断,显著提升其在复杂任务中的决策可靠性与环境适应性。
衍生相关工作
UAVReason数据集的发布催生了一系列具有代表性的衍生研究工作。研究者基于其VQA标注体系引入了多层级空间推理模块,通过构建解耦的目标定位与关系网络显著提升了空中场景问答的准确率。针对双帧时间推理任务,部分工作设计了时序注意力机制与运动感知编码器,实现了对连续航拍帧中物体轨迹与状态变化的精确建模。此外,该数据集与BAGEL框架的结合催生了统一的视觉理解与生成训练范式,支持在同一个模型架构下同时进行推理问答与条件图像生成。深度与分割引导的图像生成任务也启发了多模态条件扩散模型在无人机领域的适应方法,促进了跨领域迁移学习的深入探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务