遇见数据集

SpatialUAV

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

SpatialUAV是一个用于评估真实低空无人机(UAV)场景中空间智能的诊断性基准数据集,专注于视觉问答任务,旨在测试模型在复杂无人机感知环境下的空间推理能力。数据集共包含4,331个精心构建的视觉问答实例,覆盖14种不同的任务类型,主要分为五大类:语义判别(例如区域识别)、空间关系理解、无人机-无人机协作(空-空协作)、无人机-地面协作(空-地协作)以及运动理解。它采用统一的“视觉输入-问题-答案”模式,提供七种不同的视觉输入配置(例如单张图像、多视角图像序列、视频帧序列)和九种答案格式,数据规模属于1K到10K的范畴。数据集仅包含一个test拆分,专门用于基准测试和模型评估,并提供两种配置:full配置包含全部4,331个实例,用于完整评估;subset_20pct_per_task配置从每种任务类型中抽取20%的样本,共863个实例,用于快速开发和建立人工参考基准。每个样本由五个字段构成:唯一标识符id(其前缀指明了任务类型)、有序的图像或视频帧路径列表image、采用{from, value}对话格式存储的问题或指令conversations、标识数据集来源的标签source(固定为“SpatialUAV”)以及标准的真实答案GT。视觉数据(图像/视频帧)需要从压缩包中单独下载并解压,解压后包含多个子目录,对应不同的任务和视觉输入配置。该数据集整合了来自BEDI、AirCopBench、MAVREC、AirScape、University-1652等多个上游数据集的数据,因此使用需遵守这些原始数据集的许可证和条款。

SpatialUAV is a diagnostic benchmark dataset for evaluating spatial intelligence in real-world low-altitude unmanned aerial vehicle (UAV) scenarios. It focuses on visual question answering tasks, aiming to test models spatial reasoning capabilities in complex UAV perception environments. The dataset contains a total of 4,331 carefully constructed visual question answering instances, covering 14 different task types. These task types are mainly divided into five categories: semantic discrimination (e.g., region recognition), spatial relationship understanding, UAV-UAV collaboration (air-air collaboration), UAV-ground collaboration (air-ground collaboration), and motion understanding. The dataset designs a unified visual input-question-answer pattern, providing seven different visual input configurations (e.g., single image, multi-view image sequences, video frame sequences) and nine answer formats. The data scale falls within the 1K to 10K range. The dataset includes only a `test` split, specifically for benchmark testing and model evaluation. For convenience, two configurations are provided: the `full` configuration contains all 4,331 instances for complete benchmark evaluation, while the `subset_20pct_per_task` configuration samples 20% from each task type, totaling 863 instances, for rapid development and establishing human reference benchmarks. Each data sample consists of five fields: a unique identifier `id` (whose prefix indicates the task type), an ordered list of image or video frame paths `image`, questions or instructions stored in a `{from, value}` conversation format `conversations`, a label `source` identifying the dataset source (fixed as SpatialUAV), and the standard ground truth answer `GT`. Visual data (images/video frames) need to be downloaded separately from a compressed package and extracted, containing multiple subdirectories corresponding to different tasks and visual input configurations. The dataset integrates data from multiple upstream datasets such as BEDI, AirCopBench, MAVREC, AirScape, and University-1652, so its use must comply with the licenses and terms of these original datasets.

创建时间:
2026-06-16
原始信息汇总

数据集名称

SpatialUAV

数据集简介

SpatialUAV 是一个用于评估低空无人机(UAV)场景中空间智能的诊断性基准数据集。它包含 4,331 个精心策划的视觉问答实例,覆盖 14 种任务类型,涉及语义判别、空间关系、空中-空中协作、空中-地面协作和运动理解。

语言与任务

  • 语言:英语
  • 任务类别:视觉问答(Visual Question Answering)
  • 标签:无人机、空间推理、多视图、空中-地面、运动理解、基准测试

数据集规模

  • 总实例数:4,331
  • 数据大小范围:1K < 样本数 < 10K

数据集配置

配置名称 分割 行数 用途
full test 4,331 完整的基准评估
subset_20pct_per_task test 863 更快的开发和人工参考子集

数据记录结构

每条记录包含 5 个字段:

字段 类型 描述
id 字符串 唯一标识符;其前缀表示任务类型
image 字符串列表 图像或视频帧的有序路径
conversations 对象列表 {from, value} 格式存储的问题或指令
source 字符串 数据集来源标签(SpatialUAV
GT 字符串 标准真实答案

视觉输入配置

该基准提供七种视觉输入配置和九种答案格式。视觉数据需下载并解压以下文件:

  • samples_Single_Image/
  • samples_A2A_Pured/
  • samples_A2A_detected/
  • samples_A2A_Occlusion_Removal/
  • samples_A2G_Pured/
  • samples_A2G_detected/
  • samples_A2G_Path_Planning/
  • samples_Motion_Understanding_Frames/

数据来源

数据集衍生自多个源数据集,包括 BEDI、AirCopBench、MAVREC、AirScape、University-1652 等。用户需自行审查并遵守这些源数据集的许可条款。

许可证

  • 代码:MIT 许可证
  • 基准数据license: other(未以 MIT 重新授权,受源数据集各自许可证约束)

引用

若使用 SpatialUAV,请引用以下文献:

bibtex @article{zhang2026spatialuav, title = {SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion}, author = {Zhang, Haoyu and Liu, Meng and Xiang, Qianlong and Wang, Kun and Wang, Yaowei and Nie, Liqiang}, journal = {arXiv preprint arXiv:2606.27876}, year = {2026} }

更多信息

有关任务定义、数据集构建、评估指标、模型推理和基准结果,请访问 GitHub 仓库SpatialUAV 论文

搜集汇总
数据集介绍
SpatialUAV 数据集图片
构建方式
SpatialUAV是一个面向低空无人机空间智能诊断的基准测试数据集,它通过融合BEDI、AirCopBench、MAVREC、AirScape及University-1652等多个来源的视觉素材,构建了4331个精心策划的视觉问答实例。数据集以统一的视觉输入-问题-答案模式为核心,囊括了七种视觉输入配置与九种答案格式,其注释文件以Parquet和JSONL格式存储,每个记录包含唯一标识符、有序图像路径、对话内容、数据源标签及标准答案,确保了结构与内容的高度一致性。
使用方法
用户可通过Hugging Face的datasets库便捷加载注释表,指定'full'或'subset_20pct_per_task'配置并选择'test'分割即可获得测试实例。使用前需通过Git LFS克隆仓库,分割后的压缩包需先拼接并校验哈希值,随后解压各视觉档案以恢复图像目录。由于注释仅记录图像路径而非嵌入图像数据,评估时必须从仓库根目录的外层父目录启动,以确保路径解析正确,最终将注释与视觉数据结合完成模型推理与性能评测。
背景与挑战
背景概述
SpatialUAV是由Haoyu Zhang、Meng Liu、Qianlong Xiang、Kun Wang、Yaowei Wang和Liqiang Nie等研究人员于2026年构建的一个诊断性基准数据集,旨在评估低空无人机(UAV)场景下的空间智能。该数据集聚焦于无人机感知、协作与运动理解,包含4,331个精心设计的视觉问答实例,覆盖语义判别、空间关系、空中-空中协作、空中-地面协作及运动理解等14类任务。SpatialUAV提供了七种视觉输入配置和九种答案格式,为多视角、多模态的无人机视觉理解研究提供了统一评估框架。该基准的提出填补了现有数据集在无人机空间推理能力系统性评估方面的空白,对推动无人机自主导航、协同作业及智能感知领域的发展具有重要影响。
当前挑战
SpatialUAV所解决的领域核心挑战在于:现有视觉问答与空间推理基准多面向地面或静态场景,难以直接迁移至低空无人机的动态、多视角及协作感知环境。无人机场景中,空间智能需融合单视角语义、多视角几何关系、空中-地面异构协作及运动时序信息,对模型的跨模态对齐、对抗遮挡及路径规划能力提出严苛要求。在构建过程中,数据集的创建面临多重挑战:需从BEDI、AirCopBench、MAVREC等异构源数据中提取并标准化多类型视觉线索,确保样本覆盖不同光照、高度及动态复杂度;同时,须设计统一的问题模板与答案格式,兼顾14类任务的特异性与评估的一致性,以避免任务间的标注偏差与冗余,最终生成高质量、可复现的基准测试集。
常用场景
经典使用场景
SpatialUAV数据集专为评估低空无人机的空间智能而设计,其核心经典使用场景涵盖五大维度:语义判别、空间关系理解、空中-空中协同、空中-地面协同以及运动感知。通过4331个精心构建的视觉问答实例,覆盖14类任务类型,该数据集为无人机在多视角、多agent协作环境中的空间推理能力提供了统一的测试基准。研究者可利用其七种视觉输入配置与九种答案格式,系统性地测试模型在复杂低空场景下对空间信息的感知、理解与交互能力,从而推动无人机视觉智能的标准化评估。
解决学术问题
SpatialUAV直面当前计算机视觉与机器人学交叉领域中的关键瓶颈——缺乏专为低空无人机设计的空间智能诊断基准。传统数据集多聚焦于固定视角或地面场景,难以捕捉无人机特有的俯视、多机协同及动态运动特性。该数据集通过系统化设计,解决了空间关系推理在无人机场景中的评估碎片化问题,提供了从语义判别到多agent协作的全链路衡量尺度。其意义在于为空间智能研究确立了更具生态效度的测试场,促使模型从静态识别迈向动态环境中的实用化推理。
实际应用
在现实部署中,SpatialUAV所评测的能力直接支撑起无人机集群作业中的关键任务:巡检机器人需要精准判别区域属性并理解物体间的空间关系,救灾无人机在空中-地面协同中依赖稳定的空间推理来规划路径,而物流配送场景则要求无人机准确感知自身与目标的动态空间变化。该数据集的评估框架可应用于无人系统导航、多机编队控制及视觉定位等实际场景,为研发人员提供从实验室到田间地头的技术验证桥梁。
数据集最近研究
最新研究方向
在当前低空经济与无人机自主智能迅猛发展的时代背景下,SpatialUAV数据集开创性地聚焦于无人机在真实低空场景中的空间智能评估,涵盖了语义判别、空间关系推理、空中-空中协作、空中-地面协同以及运动理解等14类任务,通过4331个精心构建的视觉问答实例,系统性地衡量模型在多视角、多模态输入下的空间感知与推理能力。该基准的提出不仅回应了无人机群体协同与复杂环境交互中对空间认知的迫切需求,更通过标准化测试范式推动了视觉语言模型在具身智能与自主导航前沿的落地验证,其多输入配置与多元答案格式为后续研究提供了可复现的评估框架,对促进低空智联网、智慧城市监测及应急响应等热点领域的技术演进具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务