遇见数据集

OpenUAV-QA

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

OpenUAV-QA是一个面向无人机导航决策的大规模多项选择问答基准数据集,基于TravelUAV(OpenUAV)数据集构建。它将原始无人机飞行轨迹转化为结构化的、经过文本润色的四选项问答对,旨在评估多模态模型从第一人称无人机视频片段中推理路径规划、动作序列和空间动态的能力。数据内容涵盖22个不同的模拟环境,包括城市街道、沙漠、森林、港口、热带岛屿等多种地理场景,提供多样化的测试平台。数据集包含15,371个问答对,其中训练集11,476个,测试集3,895个。每个数据样本包含唯一标识符、视频序列名称、视频帧目录路径、任务类型、自然语言描述的问题、地面真值动作序列摘要、四个选项、正确答案标签、源地图环境、源轨迹UUID、目标视觉描述、目标物体名称、总飞行距离和总帧数等关键字段。适用于视觉语言导航、空间推理、零样本迁移、多选择视频问答和模拟到真实研究等任务,特别用于评估多模态大语言模型在无人机导航决策中的表现,并在相关研究中用作下游迁移基准。

OpenUAV-QA is a large-scale multiple-choice question-answering benchmark dataset for UAV navigation decision-making, built upon the TravelUAV (OpenUAV) dataset. It transforms original UAV flight trajectories into structured, text-polished four-option QA pairs, aiming to evaluate multimodal models ability to reason about path planning, action sequences, and spatial dynamics from first-person UAV video clips. The data covers 22 different simulated environments, including urban streets, deserts, forests, ports, tropical islands, and other geographical scenes, providing a diverse testing platform for assessing visual-language models in real-world UAV navigation scenarios. The dataset contains 15,371 QA pairs, with 11,476 in the training set and 3,895 in the test set. Each data sample includes key fields such as a unique identifier (id), video sequence name (video_name), video frame directory path (video_path), task type (task_type), natural language question (question), ground truth motion intention summary (motion_intention), four options (options, labeled A-D), correct answer label (answer), source map environment (source_map), source trajectory UUID (source_traj), target visual description (target_description), target object name (target_object), total flight distance (total_distance_m), and total frames (total_frames). It is suitable for tasks like visual-language navigation, spatial reasoning, zero-shot transfer, multiple-choice video QA, and simulation-to-real research, particularly for evaluating multimodal large language models in UAV navigation decision-making, and has been used as a downstream transfer benchmark in related studies.

创建时间:
2026-07-12
原始信息汇总

数据集概述

OpenUAV-QA 是一个大规模的多选题问答基准,用于评估无人机(UAV)导航决策能力。该数据集基于 TravelUAV (OpenUAV) 数据集构建,将原始的无人机飞行轨迹转换为结构化、文本精炼的四选一问答对,用于测试多模态模型从第一人称无人机视频中推理路径规划、动作序列和空间动态的能力。

基本信息

  • 语言: 英语
  • 许可证: Apache 2.0
  • 任务类别: 视觉问答、视频分类、问答
  • 具体任务: 视觉问答、多项选择问答
  • 标签: 无人机、导航、路径规划、多模态、视频理解、空中机器人、视觉语言模型、视觉语言动作、世界模型、多项选择、合成数据、机器人学、计算机视觉、仿真到现实
  • 数据规模: 10,000 到 100,000 条数据
  • 配置: 包含 train(训练集)和 test(测试集)两个配置

数据集规模

数据划分 问题数量
训练集 (Train) 11,476
测试集 (Test) 3,895
总计 15,371

数据集结构

数据集文件组织如下:

text OpenUAV-QA/ ├── TravelUAV_train.jsonl # 11,476 个训练问答对 ├── TravelUAV_test.jsonl # 3,895 个测试问答对 ├── TravelUAV_dataset/ # 视频帧序列(托管在 ModelScope 上) │ ├── TravelUAV_Train_00001/ │ │ ├── 00001.png │ │ ├── 00002.png │ │ └── ... │ ├── TravelUAV_Train_00013/ │ └── ... ├── demo/ # 用于快速检查的样本视频 │ ├── TravelUAV_Train_00003/ │ └── ... └── images/ └── openuav-qa-poster.jpeg # 数据集海报

数据格式

每个 JSONL 文件中的每一行是一个 JSON 对象,包含以下字段:

字段 类型 描述
id string 唯一的问题标识符
video_name string 视频序列名称
video_path string 视频帧目录的相对路径
concat_num integer 连接的轨迹段数量
task_type string 任务类别(全部为 path_planning
question string 描述导航目标的自然语言问题
motion_intention string 真实运动序列的简洁总结
options object 四个选项(ABCD),包含完整的动作描述
answer string 正确选项的标签(AD
source_map string 仿真环境名称
source_traj string 在 OpenUAV 中源轨迹的 UUID
target_description string 导航目标和周围环境的详细视觉描述
target_object string 目标物体的 3D 资源名称
total_distance_m float 总飞行距离(米)
total_frames integer 视频序列中的帧数

数据构建流程

  1. 视频序列提取:从 OpenUAV 数据集中提取无人机飞行轨迹,收集每个时间步的前视图像帧,并将其组织成每个轨迹的视频序列。
  2. 飞行阶段标注:根据轨迹的相对坐标序列计算每个步骤的操作阶段,包括起飞、降落、左转、右转和巡航,并将连续相同阶段的帧合并为飞行段。
  3. 多项选择问答构建:将视频数据和路径描述转换为适合多模态大语言模型评估的四选一格式。一个大型语言模型将基于规则的描述润色为自然流畅的提问文本,并根据真实路径构建正确选项,同时使用方向反转、距离偏差、阶段插入/删除、高度数值错误等策略生成三个干扰选项。
  4. 数据集规模:从 22 个不同的仿真地图中进行采样,最终产生 15,371 个问答对。

环境多样性

数据集涵盖了 22 个不同的仿真环境,包括:

  • 城市街道: Carla_Town*, ModernCityMap, NYCEnvironmentMegapa, NewYorkCity
  • 沙漠: BattlefieldKitDesert
  • 森林: BrushifyForestPack
  • 乡村: BrushifyCountryRoads
  • 港口: NordicHarbour
  • 热带岛屿: TropicalIsland
  • 风格化设定: Japanese_Street, London_Street, WesterTown

应用场景

  • 视觉语言导航(VLN): 从第一人称视频评估多模态大语言模型在现实无人机飞行决策中的表现。
  • 空间推理: 测试模型是否可以从视觉序列中推断距离、转弯方向和高度变化。
  • 零样本迁移: 评估预训练视频表示对特定领域机器人任务的泛化能力。
  • 多项选择视频问答: 用细粒度动作序列选项对长视频理解进行基准测试。
  • 仿真到现实研究: 使用多样化的合成环境作为现实世界无人机部署场景的代理。

下游任务基准结果

该数据集被用于评估模型的零样本迁移能力。在包含 3,895 个问题的测试集上,关键结果如下:

模型 准确率
Qwen2.5-VL 3B (基准) 71.2%
SIS-Motion 92.2%

SIS-Motion 模型相比基准模型提升了 21.0 个百分点,证明了基于运动感知的自我空间建模能够有效迁移到实际的导航决策任务中。

搜集汇总
数据集介绍
OpenUAV-QA 数据集图片
构建方式
OpenUAV-QA基于TravelUAV(OpenUAV)数据集构建,该数据集原本服务于视觉语言导航任务,但原始注释中的连续位姿坐标难以被多模态大语言模型直接处理。为此,研究团队设计了一套精细的数据处理管线:首先从无人机飞行轨迹中提取前视图像帧,构成逐轨迹的视频序列;随后依据相对坐标序列计算每个时间步的飞行阶段——包括起飞、降落、左转、右转和巡航等——并将连续相同阶段的帧合并为飞行段,记录实际飞行距离、高度变化和转角等参数,生成规则化的路径描述。最终,数据被转换为四选一的多选题形式,其中正确选项基于真实路径构建,三个干扰选项则通过方向反转、距离偏差、阶段增删或高度错误等策略生成,确保了选项间清晰且无歧义的差异。整个流程覆盖22个不同的仿真环境,共产生15371条问答样本。
特点
该数据集的核心特点在于其大规模、多样化的仿真环境覆盖以及细致的选项构建策略。22个仿真地图囊括了城市街道、沙漠、森林、港口、热带岛屿等多种地貌,有效检验模型在跨地理场景下的泛化能力。每个问答样本均包含一段第一视角的无人机视频、一个自然语言导航目标描述,以及四个包含完整动作序列的选项。干扰选项的设计策略——如方向反转、距离偏差、阶段插入或删除、高度数值错误——确保了错误选项在逻辑上与正确选项存在明确区分,避免了模糊或混淆的情况。此外,数据集中每条样本还记录了任务类型(均为路径规划)、源地图名称、源轨迹UUID、目标物体描述等丰富元信息,为深入分析模型行为提供了支持。
使用方法
数据集通过Hugging Face和ModelScope两个平台分发。Hugging Face提供问答注释文件(JSONL格式)及其下属的demo子集,而完整的视频帧数据则托管于ModelScope。用户可根据需求选择两种获取方式:一是从Hugging Face下载注释文件,再从ModelScope单独获取视频帧目录;二是直接从ModelScope一站式下载全部数据。加载后,可逐条读取JSONL文件获取问题、四个选项和正确答案标签;同时,根据记录中的video_path字段定位并加载对应的视频帧序列。在模型评估时,以视频帧序列、问题和四个选项作为输入,让模型预测正确选项标签(A-D),并通过精确匹配计算准确率。该数据集已作为Self-in-Space论文中下游任务迁移的零样本评估基准,在3895条测试样本上验证了运动感知视觉表征的有效性。
背景与挑战
背景概述
无人机自主导航与决策是具身智能领域的核心研究问题之一,然而现有数据集多侧重于地面机器人或静态场景理解,难以支撑从第一人称视角对无人机飞行轨迹进行语义推理与路径规划。OpenUAV-QA数据集由Zou等研究者于2026年提出,基于TravelUAV(OpenUAV)平台构建,旨在将原始的连续运动轨迹转化为结构化的多选问答任务,评估多模态大模型在无人机导航决策中的空间推理能力。该数据集涵盖22种模拟环境,包括城市街道、沙漠、森林、港口等多样化地理场景,总计15,371个问答对,为视觉-语言导航(VLN)、零样本迁移及仿真到真实(Sim-to-Real)研究提供了标准化的评测基准,显著推动了无人机具身智能的跨场景泛化研究。
当前挑战
当前领域面临的核心挑战在于,多模态大模型难以直接从无人机第一人称视频中精准推断连续的行动序列(如转向角度、飞行距离与高度变化),而传统的视觉问答任务往往忽略时空连续性。OpenUAV-QA通过将原始轨迹转化为离散的四选一问答形式,要求模型在视频理解与空间推理的交叉点上做出决策,这直接检验了模型对运动意图、路径分段及环境语义的综合建模能力。数据集构建过程中亦面临严峻挑战:原始OpenUAV数据仅含坐标注释,需设计自动化流水线提取飞行阶段(起飞、转向、巡航、着陆),并通过规则与LLM协作生成语义自然且干扰项具有明确区分度的问答对,同时确保22种环境间的风格与光照差异不引入额外的视觉混淆因素。
常用场景
经典使用场景
在无人机自主导航与视觉语言导航的交叉领域中,OpenUAV-QA数据集构建了一个大规模多选问答基准,用于评估多模态大模型在无人机第一视角视频基础上的路径规划决策能力。该数据集将原始无人机飞行轨迹转化为结构化的四选一问答对,涵盖城市街道、沙漠、森林、港口、热带岛屿等22种多样化仿真环境。经典使用方式是将第一人称无人机视频与自然语言导航问题输入模型,要求模型从四个候选动作序列中选出正确选项,从而检验模型对飞行阶段识别、距离判断、转向方向及高度变化等空间动态的推理能力。
衍生相关工作
OpenUAV-QA数据集作为Self-in-Space论文的下游迁移基准,推动了运动感知视觉表征学习在无人机导航领域的发展。相关工作表明,基于自我中心视频学习的运动感知模型(如SIS-Motion)在该数据集上取得了显著性能提升(准确率从71.2%提升至92.2%),验证了运动感知预训练策略的有效性。此外,该数据集还激发了视觉-语言导航、多模态时空推理、仿真到现实迁移等方向的后续研究,成为评估无人机具身智能体空间认知能力的重要标准平台。
数据集最近研究
最新研究方向
OpenUAV-QA数据集的最新研究方向聚焦于利用第一人称无人机视频进行多模态大模型的零样本导航决策推理。该领域的前沿动向体现在Self-in-Space工作中,通过引入运动感知的自在空间表征学习,模型在未见过的无人机飞行场景中展现出了卓越的迁移能力——在3895道选择题的测试集上,SIS-Motion模型以92.2%的准确率显著超越基线模型Qwen2.5-VL 3B(71.2%),提升了21个百分点。这一突破性的进展不仅验证了运动感知视觉表征在时空推理中的泛化潜能,更为无人机智能体在复杂环境的自主路径规划、视觉问答和空间认知等任务中提供了新的评测标杆,推动了仿真环境向真实世界部署的跨越,对具身智能在航空机器人领域的应用具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务