UAVReason
收藏资源简介:
UAVReason是一个用于无人机视角图像的多模态空中场景推理和生成数据集,基于UAVScenes RGB图像构建,提供VQA/字幕注释、图像到图像生成JSONL文件以及额外的深度数据。该数据集可用于无人机视觉问答、场景字幕生成、空间推理、时间推理、航向推理、深度感知感知和跨模态生成。
UAVReason is a multimodal aerial scene reasoning and generation dataset for unmanned aerial vehicle (UAV) perspective images, constructed based on UAVScenes RGB images. It provides VQA/caption annotations, image-to-image generation JSONL files, and additional depth data. This dataset can be used for UAV visual question answering (VQA), scene caption generation, spatial reasoning, temporal reasoning, heading reasoning, depth perception, and cross-modal generation.
UAVReason 数据集概述
UAVReason 是一个面向无人机视角图像的多模态航拍场景推理与生成数据集,构建于 UAVScenes RGB 图像之上,提供 VQA/字幕标注、图像到图像生成 JSONL 文件及深度数据。
核心功能
该数据集支持以下任务:
- 无人机视觉问答
- 无人机场景字幕生成
- 单帧空间推理
- 双帧时序推理
- 无人机航向/运动方向推理
- 深度感知感知
- 跨模态生成
- 无人机多模态模型适配与评估
数据组成
VQA/字幕标注(LLaVA 风格 JSONL)
| 数据类型 | 格式 | 描述 |
|---|---|---|
| 单帧 VQA | LLaVA 风格 JSONL | 单张无人机图像问答与空间推理 |
| 双帧 VQA | LLaVA 风格 JSONL | 双无人机帧之间的时序变化与关系推理 |
| 航向 VQA | LLaVA 风格 JSONL | 无人机航向/运动方向推理 |
| 场景字幕 | LLaVA 风格 JSONL | 无人机场景字幕生成 |
图像到图像生成 JSONL(ShareGPT 风格 i2i JSONL)
| 数据类型 | 格式 | 描述 |
|---|---|---|
| RGB -> 深度 | ShareGPT 风格 i2i JSONL | 从 RGB 无人机图像生成深度图 |
| RGB -> 语义分割 | ShareGPT 风格 i2i JSONL | 从 RGB 无人机图像生成语义分割图 |
| 深度 + 文本 -> RGB | ShareGPT 风格 i2i JSONL | 基于深度和文本生成 RGB 图像 |
| 分割 + 文本 -> RGB | ShareGPT 风格 i2i JSONL | 基于分割和文本生成 RGB 图像 |
| 深度 + 分割 + 文本 -> RGB | ShareGPT 风格 i2i JSONL | 基于深度、分割和文本生成 RGB 图像 |
| 重建 | ShareGPT 风格 i2i JSONL | RGB/深度/分割重建 |
深度数据(独立提供)
| 数据类型 | 格式 | 描述 |
|---|---|---|
| 深度数组 | .npy |
原始深度数组 |
| 深度可视化 | _depth_vis.png |
灰度深度可视化图 |
| 深度统计 | _stats.json |
深度元数据和统计信息 |
数据规模
数据集包含以下 VQA/字幕标注样本量:
- 单帧 VQA:172,037 条
- 双帧 VQA:57,462 条
- 航向 VQA:57,456 条
- 场景字幕:19,903 条
生成任务 parquet 样本总量:159,224 条
数据格式
VQA/字幕格式
遵循 LLaVA 风格 JSONL 格式,每条样本包含:
image:图像路径列表conversations:对话序列,包括人类问题和 GPT 回答meta:任务分组、类别统计和评估用元数据
深度数据格式
每个文件包含:
{stem}_depth.npy:原始深度数组{stem}_depth_vis.png:灰度深度可视化图{stem}_stats.json:深度统计信息
推荐目录结构
UAVReason/ ├── UAVScenes/ # 来自 UAVScenes 的 RGB 图像 │ └── interval5_CAM_LIDAR/ │ ├── interval5_AMtown01/ │ ├── interval5_AMtown02/ │ └── ... ├── UAVReason_depth/ # 深度文件 │ ├── interval5_AMtown01/ │ │ ├── *.npy │ │ ├── *_depth_vis.png │ │ └── *_stats.json │ └── ... ├── annotations/ # VQA/字幕 JSONL └── i2i_jsonl/ # 生成 JSONL
资源链接
- 论文:https://arxiv.org/abs/2604.05377
- 代码:https://github.com/JT-Sun/UAVReason
- UAVReason VQA/字幕/生成 JSONL:https://huggingface.co/datasets/jarvissun/UAVReason_vqa/tree/main
- UAVReason 深度数据:https://huggingface.co/datasets/jarvissun/UAVReason_depth
- UAVScenes 基础数据集:https://github.com/sijieaaa/UAVScenes




