OpenUAV-QA
收藏资源简介:
OpenUAV-QA是一个面向无人机导航决策的大规模多项选择问答基准数据集,基于TravelUAV(OpenUAV)数据集构建。它将原始无人机飞行轨迹转化为结构化的、经过文本润色的四选项问答对,旨在评估多模态模型从第一人称无人机视频片段中推理路径规划、动作序列和空间动态的能力。数据内容涵盖22个不同的模拟环境,包括城市街道、沙漠、森林、港口、热带岛屿等多种地理场景,提供多样化的测试平台。数据集包含15,371个问答对,其中训练集11,476个,测试集3,895个。每个数据样本包含唯一标识符、视频序列名称、视频帧目录路径、任务类型、自然语言描述的问题、地面真值动作序列摘要、四个选项、正确答案标签、源地图环境、源轨迹UUID、目标视觉描述、目标物体名称、总飞行距离和总帧数等关键字段。适用于视觉语言导航、空间推理、零样本迁移、多选择视频问答和模拟到真实研究等任务,特别用于评估多模态大语言模型在无人机导航决策中的表现,并在相关研究中用作下游迁移基准。
OpenUAV-QA is a large-scale multiple-choice question-answering benchmark dataset for UAV navigation decision-making, built upon the TravelUAV (OpenUAV) dataset. It transforms original UAV flight trajectories into structured, text-polished four-option QA pairs, aiming to evaluate multimodal models ability to reason about path planning, action sequences, and spatial dynamics from first-person UAV video clips. The data covers 22 different simulated environments, including urban streets, deserts, forests, ports, tropical islands, and other geographical scenes, providing a diverse testing platform for assessing visual-language models in real-world UAV navigation scenarios. The dataset contains 15,371 QA pairs, with 11,476 in the training set and 3,895 in the test set. Each data sample includes key fields such as a unique identifier (id), video sequence name (video_name), video frame directory path (video_path), task type (task_type), natural language question (question), ground truth motion intention summary (motion_intention), four options (options, labeled A-D), correct answer label (answer), source map environment (source_map), source trajectory UUID (source_traj), target visual description (target_description), target object name (target_object), total flight distance (total_distance_m), and total frames (total_frames). It is suitable for tasks like visual-language navigation, spatial reasoning, zero-shot transfer, multiple-choice video QA, and simulation-to-real research, particularly for evaluating multimodal large language models in UAV navigation decision-making, and has been used as a downstream transfer benchmark in related studies.
数据集概述
OpenUAV-QA 是一个大规模的多选题问答基准,用于评估无人机(UAV)导航决策能力。该数据集基于 TravelUAV (OpenUAV) 数据集构建,将原始的无人机飞行轨迹转换为结构化、文本精炼的四选一问答对,用于测试多模态模型从第一人称无人机视频中推理路径规划、动作序列和空间动态的能力。
基本信息
- 语言: 英语
- 许可证: Apache 2.0
- 任务类别: 视觉问答、视频分类、问答
- 具体任务: 视觉问答、多项选择问答
- 标签: 无人机、导航、路径规划、多模态、视频理解、空中机器人、视觉语言模型、视觉语言动作、世界模型、多项选择、合成数据、机器人学、计算机视觉、仿真到现实
- 数据规模: 10,000 到 100,000 条数据
- 配置: 包含
train(训练集)和test(测试集)两个配置
数据集规模
| 数据划分 | 问题数量 |
|---|---|
| 训练集 (Train) | 11,476 |
| 测试集 (Test) | 3,895 |
| 总计 | 15,371 |
数据集结构
数据集文件组织如下:
text OpenUAV-QA/ ├── TravelUAV_train.jsonl # 11,476 个训练问答对 ├── TravelUAV_test.jsonl # 3,895 个测试问答对 ├── TravelUAV_dataset/ # 视频帧序列(托管在 ModelScope 上) │ ├── TravelUAV_Train_00001/ │ │ ├── 00001.png │ │ ├── 00002.png │ │ └── ... │ ├── TravelUAV_Train_00013/ │ └── ... ├── demo/ # 用于快速检查的样本视频 │ ├── TravelUAV_Train_00003/ │ └── ... └── images/ └── openuav-qa-poster.jpeg # 数据集海报
数据格式
每个 JSONL 文件中的每一行是一个 JSON 对象,包含以下字段:
| 字段 | 类型 | 描述 |
|---|---|---|
id |
string | 唯一的问题标识符 |
video_name |
string | 视频序列名称 |
video_path |
string | 视频帧目录的相对路径 |
concat_num |
integer | 连接的轨迹段数量 |
task_type |
string | 任务类别(全部为 path_planning) |
question |
string | 描述导航目标的自然语言问题 |
motion_intention |
string | 真实运动序列的简洁总结 |
options |
object | 四个选项(A、B、C、D),包含完整的动作描述 |
answer |
string | 正确选项的标签(A–D) |
source_map |
string | 仿真环境名称 |
source_traj |
string | 在 OpenUAV 中源轨迹的 UUID |
target_description |
string | 导航目标和周围环境的详细视觉描述 |
target_object |
string | 目标物体的 3D 资源名称 |
total_distance_m |
float | 总飞行距离(米) |
total_frames |
integer | 视频序列中的帧数 |
数据构建流程
- 视频序列提取:从 OpenUAV 数据集中提取无人机飞行轨迹,收集每个时间步的前视图像帧,并将其组织成每个轨迹的视频序列。
- 飞行阶段标注:根据轨迹的相对坐标序列计算每个步骤的操作阶段,包括起飞、降落、左转、右转和巡航,并将连续相同阶段的帧合并为飞行段。
- 多项选择问答构建:将视频数据和路径描述转换为适合多模态大语言模型评估的四选一格式。一个大型语言模型将基于规则的描述润色为自然流畅的提问文本,并根据真实路径构建正确选项,同时使用方向反转、距离偏差、阶段插入/删除、高度数值错误等策略生成三个干扰选项。
- 数据集规模:从 22 个不同的仿真地图中进行采样,最终产生 15,371 个问答对。
环境多样性
数据集涵盖了 22 个不同的仿真环境,包括:
- 城市街道:
Carla_Town*,ModernCityMap,NYCEnvironmentMegapa,NewYorkCity - 沙漠:
BattlefieldKitDesert - 森林:
BrushifyForestPack - 乡村:
BrushifyCountryRoads - 港口:
NordicHarbour - 热带岛屿:
TropicalIsland - 风格化设定:
Japanese_Street,London_Street,WesterTown
应用场景
- 视觉语言导航(VLN): 从第一人称视频评估多模态大语言模型在现实无人机飞行决策中的表现。
- 空间推理: 测试模型是否可以从视觉序列中推断距离、转弯方向和高度变化。
- 零样本迁移: 评估预训练视频表示对特定领域机器人任务的泛化能力。
- 多项选择视频问答: 用细粒度动作序列选项对长视频理解进行基准测试。
- 仿真到现实研究: 使用多样化的合成环境作为现实世界无人机部署场景的代理。
下游任务基准结果
该数据集被用于评估模型的零样本迁移能力。在包含 3,895 个问题的测试集上,关键结果如下:
| 模型 | 准确率 |
|---|---|
| Qwen2.5-VL 3B (基准) | 71.2% |
| SIS-Motion | 92.2% |
SIS-Motion 模型相比基准模型提升了 21.0 个百分点,证明了基于运动感知的自我空间建模能够有效迁移到实际的导航决策任务中。




