遇见数据集

SIS-Bench, SIS-Motion-54K, OpenUAV-QA

收藏
github2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

SIS-Bench是一个基准数据集,包含来自1,646个真实世界无人机视频的4,856个问答对,用于评估空间认知和自我意识两个维度的具身空间智能,涵盖感知、记忆和推理三个认知水平。SIS-Motion-54K是一个训练数据集,用于空间推理。OpenUAV-QA是一个下游任务数据集。

SIS-Bench is a benchmark dataset comprising 4,856 question-answer pairs from 1,646 real-world drone videos, used to evaluate embodied spatial intelligence across two dimensions: spatial cognition and self-awareness, covering three cognitive levels: perception, memory, and reasoning. SIS-Motion-54K is a training dataset for spatial reasoning. OpenUAV-QA is a downstream task dataset.

创建时间:
2026-07-12
原始信息汇总

数据集概述

Self-in-Space 是一个面向无人机具身智能中自我意识与空间认知的基准测试、训练数据集与运动感知模型集合。

核心组成

  • SIS-Bench:包含 4,856 个问答对,来源于 1,646 个真实世界无人机视频。该基准测试从两个维度(空间认知与自我意识)和三个认知层面(感知、记忆、推理)评估具身空间智能,涵盖 13 项任务
  • SIS-Motion-54K:包含 54K 个训练样本,用于训练运动感知模型。
  • OpenUAV-QA:下游任务数据集,包含 3,895 个问答对
  • SIS-Motion:一个运动感知视频多模态大语言模型,融合光流运动线索与视觉特征,以提升空间认知与自我意识。

数据来源

基准测试和训练数据的视频来源于以下公开数据集:

  • AirScape
  • UrbanVideo-Bench
  • VisDrone
  • OpenUAV

数据集结构与格式

下载后的数据目录结构如下:

data/ ├── SIS-Bench/ │ ├── SIS-Bench.jsonl # 4,856 个问答对 │ └── video/ │ ├── AirScape/ # 1,156 个视频 │ ├── UrbanVideo/ # 427 个视频 │ └── VisDrone/ # 63 个视频 ├── SIS-Motion-54K/ │ ├── SIS-Motion-54K.jsonl │ └── AirScape_dataset/ # 训练视频 ├── OpenUAV-QA/ │ ├── TravelUAV_test.jsonl # 3,895 个问答对 │ └── TravelUAV_dataset/ # 帧序列 └── checkpoints/ └── VideoFlow/ └── MOF_kitti.pth

数据构建流程

SIS-Bench 采用四阶段任务条件化协议构建:

  1. 异构视频处理
  2. 任务特定标注
  3. 大语言模型辅助问答构建
  4. 双专家验证

相关链接

许可协议

Apache 2.0

搜集汇总
数据集介绍
构建方式
在无人机具身智能领域,空间认知与自我意识的评估是赋予机器自主导航能力的关键。SIS-Bench数据集基于1,646段真实无人机航拍视频,通过一个四阶段任务条件化协议构建:首先对异构视频进行统一处理,随后针对13项具体任务进行标注,接着借助大语言模型辅助生成问答对,最后经由双专家验证机制确保数据质量。这一流程最终产出了4,856个高质量的问答对,覆盖空间认知与自我意识两个维度及感知、记忆、推理三个认知层次。
特点
SIS-Bench数据集的核心特色在于其对无人机空间智能的精细化评估能力。它首次将空间认知与自我意识作为互补视角引入具身智能评测,构建了涵盖感知、记忆、推理的三级认知体系。数据集包含13项多样化任务,从环境中的物体定位到无人机自身的运动状态理解,充分体现了对现实复杂场景的适应力。此外,双专家验证机制保障了问答对的准确性与可靠性,使其成为衡量无人机具身空间智能的权威基准。
使用方法
使用SIS-Bench进行评测时,推荐采用vLLM框架。用户需先通过Conda或uv工具安装评估环境,随后配置数据路径——数据集默认下载至data/目录,也可通过环境变量SIS_DATA_ROOT指定外部存储位置。运行基于vLLM的评测脚本时,只需设定模型ID与张量并行规模,即可对任意支持的视频多模态大模型在SIS-Bench上进行推理。评测结果可配合下游数据集OpenUAV-QA进一步验证模型的泛化能力。
背景与挑战
背景概述
随着无人机具身智能技术的飞速发展,如何赋予飞行器对自身状态与周围环境的深度理解,成为跨越感知到认知鸿沟的关键议题。在此背景下,北京邮电大学、湖南师范大学与清华大学的研究团队于2026年联合构建了Self-in-Space基准体系,旨在系统评估无人机在具身场景中的空间智能。该体系的核心数据集SIS-Bench包含1,646段真实世界无人机视频衍生出的4,856个问答对,从空间认知与自我意识两大维度,以及感知、记忆、推理三个认知层次,全面度量智能体的空间推理能力。同时,SIS-Motion-54K训练数据集的发布为运动感知模型提供了规模化训练基础,而OpenUAV-QA则拓展了下游任务的评测边界。该工作已被ACM MM 2026接收,标志着无人机具身空间智能评测迈入标准化新阶段。
当前挑战
构建SIS-Bench面临的核心挑战首先在于领域问题的复杂性:无人机空间智能需同时处理环境静态要素(如地标方位)与动态要素(如自身轨迹),对模型的时空耦合推理能力提出极高要求,传统图像或视频问答基准难以覆盖此类自我意识与空间认知的协同评估。其次,构建过程中遭遇双重技术壁垒:其一,异构视频数据(来自AirScape、UrbanVideo-Bench、VisDrone等来源的多样化场景与分辨率)需经由四阶段任务条件化协议实现标准化处理,包括视频切割、任务特定标注、大模型辅助问答生成以及双专家校验,流程繁琐且容错率低;其二,运动模态的引入——如融合光流运动线索——在训练SIS-Motion模型时面临特征对齐与计算开销的平衡难题,对视频多模态大模型的扩展架构提出严峻挑战。
常用场景
经典使用场景
在无人机具身智能领域,空间认知与自我意识的评估是衡量智能体环境理解与自主决策能力的关键。SIS-Bench作为一项标杆性基准,专为评测无人机在真实场景中的空间推理与自我感知能力而设计,涵盖三维空间定位、相对位姿估计、运动轨迹记忆与状态回馈等任务。其依托涵盖4,856个问答对与1,646段真实无人机视频的多样化数据集,跨越多源场景与认知层级,为研究者提供了统一的评测范式。该基准的经典使用场景集中于系统性地评估视频多模态大模型在感知、记忆与推理三个认知层次上的表现,尤其关注无人机在面对复杂动态环境时,对自身位置、姿态与运动状态的理解能力。
实际应用
在实际应用中,SIS-Bench与SIS-Motion-54K及OpenUAV-QA所形成的完整体系,推动了无人机在低空经济、智慧城市与应急响应等场景中的智能化部署。例如,通过利用运动感知模型SIS-Motion,无人机在物流配送时可实现精确的空间避障与动态路径规划;在搜救任务中,能够基于自感知能力判断机体姿态并调整飞行策略;在城市空中巡检中,可结合空间记忆功能完成高效的区域覆盖与目标重定位。这些模型的训练与评测依赖于基准数据集所构建的统一评估流程,从而确保实际部署中的鲁棒性与可靠性,加速了无人机具身智能从实验室研究向真实任务应用的转化。
衍生相关工作
SIS-Bench与SIS-Motion的提出激发了多项衍生研究。在模型架构层面,其将光流运动特征融入视频多模态大模型的设计思路,推动了运动感知与视觉-语言结合的新范式,催生了一批基于光流注意力机制的增强模型。在基准扩展方面,后续工作借鉴其双维度-三层级评测体系,将评估范围拓展至无人车、服务机器人等具身智能体,形成了更广泛的具身空间智能基准家族。此外,SIS-Motion-54K训练数据的发布,为微调小参数量的轻量级模型提供了高质量训练资源,催生了面向边缘设备的压缩模型研究,显著提升了嵌入式无人机平台上的实时推理能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务