遇见数据集

UAV-DualCog

收藏
arXiv2026-07-18 更新2026-07-21 收录
数据链接:
官方服务:

资源简介:

UAV-DualCog是由西北工业大学等机构构建的无人机多模态推理基准数据集,旨在评估多模态大语言模型在无人机场景中的双认知能力。该数据集包含18个场景中的746个有效地标,最终发布版本采用12个场景和512个地标,构建了4,096个图像样本和2,048个视频样本,涵盖六种任务类型,通过高度自动化的语义点云处理流程生成可扩展的观测数据。数据集采用基于场景级语义点云的自动构建流程,融合LiDAR、RGB和姿态数据,生成具有几何与语义标注的多视角观测样本,并设计分层飞行行为模式生成合理的轨迹视频。该数据集主要应用于无人机自主智能领域,旨在解决现有模型在无人机自身状态认知与环境状态认知联合推理方面的不足,推动面向无人机的多模态大语言模型发展。

UAV-DualCog is a multimodal reasoning benchmark dataset for unmanned aerial vehicles (UAVs) developed by Northwestern Polytechnical University and other institutions, which aims to evaluate the dual cognitive capabilities of multimodal large language models (LLMs) in UAV scenarios. This dataset includes 746 valid landmarks across 18 scenarios. The final released version adopts 12 scenarios and 512 landmarks, constructing 4,096 image samples and 2,048 video samples covering six task types. Scalable observational data is generated via a highly automated semantic point cloud processing pipeline. The dataset adopts an automatic construction workflow based on scene-level semantic point clouds, which fuses LiDAR, RGB and pose data to generate multi-view observation samples with geometric and semantic annotations, and designs a hierarchical flight behavior pattern to generate plausible trajectory videos. This dataset is primarily applied in the field of UAV autonomous intelligence, aiming to address the limitations of existing models in joint reasoning of UAV's own state cognition and environmental state cognition, and advance the development of multimodal LLMs tailored for UAVs.

创建时间:
2026-07-18
原始信息汇总

数据集概述:UAV-DualCog

UAV-DualCog 是一个面向无人机(UAV)具身智能的时空推理基准(Spatio-temporal Reasoning Benchmark),核心评估多模态大语言模型在自认知(self-state cognition)和环境认知(environment-state cognition)两个维度上的表现,同时覆盖图像视频两种观测模式。

核心设计理念

  • 双认知框架:将无人机在开放3D空间中连续运动时所需的推理能力分为“自认知推理”(对自身位置、飞行行为、视角变化的推理)和“环境认知推理”(对外部目标、障碍物、可达方向的推理),而非视为独立的孤立下游任务。
  • 全自动工具链:从语义点云和地标资产出发,构建多视图图像问答、分层飞行行为视频问答及统一的实验输出。

数据集规模

当前稳定版本包含:

  • 场景:12个 AirSim 场景
  • 地标:512 个有效地标
  • 图像样本:4,096 个
  • 视频样本:2,048 个
  • 源图像:4,840 张
  • 视频总时长:5小时27分13秒

未来扩展池已涵盖 18 个场景、746 个有效地标和 166 个细分子类别。

任务定义(共6项任务)

任务 模态 认知维度 输出类型
地标相对位置推理 (Landmark-Relative Position Reasoning) 图像 自认知 选项 + 边界框
未来观测预测 (Future Observation Prediction) 图像 自认知 选项
自相对位置推理 (Self-Relative Position Reasoning) 图像 环境认知 选项 + 边界框
地标驱动动作决策 (Landmark-Driven Action Decision) 图像 环境认知 选项 + 边界框
飞行行为识别与时域定位 (Flight Behavior Recognition and Temporal Localization) 视频 自认知 行为选项 + 时间区间
地标可见性计数与区间推理 (Landmark Visibility Counting and Interval Reasoning) 视频 环境认知 计数 + 时间区间

当前领先模型表现

综合排名(Top-3)

  1. Gemini 3 Flash:48.4%
  2. Qwen 3.5-Flash:38.9%
  3. Qwen 3.5-35B-A3B:37.9%

图像模态

  1. Gemini 3 Flash:50.2%
  2. GPT 5.3 Chat:47.8%
  3. Qwen 3.5-27B:44.3%

视频模态

  1. Gemini 3 Flash:46.5%
  2. Mimo v2 Omni:38.8%
  3. InternVL 3.5-38B:37.8%

自认知维度

  1. Gemini 3 Flash:44.4%
  2. GLM 4.6V:30.9%
  3. Qwen 3.5-Flash:28.7%

环境认知维度

  1. Qwen 3.5-35B-A3B:54.9%
  2. Gemini 3 Flash:54.2%
  3. Qwen 3.5-27B:53.3%

关键发现

分析表明,当前 MLLM 已具备部分双认知能力,但尚未形成稳定统一的能力。存在两个主要问题:

  • 证据支撑不足:语义成功比空间或时间证据更容易实现,许多看似正确的决策缺乏可靠的证据支撑。
  • 认知发展不平衡:环境认知推理整体强于自认知推理,且两种认知维度在不同媒体设置下表现差异明显。
搜集汇总
数据集介绍
UAV-DualCog 数据集图片
构建方式
UAV-DualCog的构建依托于一套高度自动化的四阶段流水线。首先,在AerialVLN仿真场景中通过覆盖感知的无人机位姿采样,融合LiDAR、RGB、分割与位姿数据,构建场景级语义点云并赋予逐类与逐实例标注。其次,从点云中依据实例聚合候选地标,结合多视角观测进行人工校验与几何、语义属性标注,形成可复用的地标资产库。随后,在层次化飞行行为框架下生成可执行的无人机任务与轨迹,经几何与碰撞约束验证后录制为带注释的第一人称视频。最后,通过可控视点采样、可见性检查与结构化注释,从地标资产中生成图像问答样本,涵盖六类任务,每类均要求输出离散答案与空间或时间证据。
使用方法
使用UAV-DualCog时,需严格遵循其结构化JSON输出协议。对于图像任务,模型需返回离散选项与归一化的地标边界框,评估指标包括答案准确率、边界框IoU≥0.5的准确率及平均IoU。视频任务则要求输出行为类别或可见性计数,并附带时间区间,使用任务级与原子级准确率、时间IoU≥0.5的准确率及平均tIoU进行评估。所有样本以标准化图像或视频格式提交,推理时禁用显式思考模式以模拟边缘部署场景。数据集不仅可用于评测,还提供了与评测场景不重叠的训练子集UAV-DualCog-Train,支持通过监督微调与强化学习联合优化模型的答案预测与证据定位能力,其收益可部分迁移至视频任务。
背景与挑战
背景概述
无人机(UAV)自主智能的核心在于其不仅需要感知外部环境,还需对自身状态进行实时推理,这种双重认知能力是当前多模态大语言模型(MLLM)在无人机场景中应用的关键瓶颈。西北工业大学刘力等研究人员于2026年提出了UAV-DualCog基准数据集,旨在从双认知视角系统评估无人机在空基多视角时空推理中的表现。该数据集基于场景级语义点云构建,通过自动化管线生成涵盖18个场景、746个地标及6144个图像与视频样本的评测任务,聚焦于自我状态认知(如相对位置、运动行为)与环境状态认知(如目标方向、可见性)的联合建模。UAV-DualCog的发布填补了现有无人机基准(如AerialVLN、CityEQA)在自我状态推理与证据定位方面的空白,为MLLM驱动的无人机代理研究提供了统一且精细的评估平台,推动了具身空中智能的标准化发展。
当前挑战
UAV-DualCog面临的挑战主要源于双认知任务的内在复杂性与构建过程的技术难度。在领域问题层面,现有MLLM在无人机场景中表现出的核心瓶颈包括:自我状态推理能力显著弱于环境状态认知,尤其在视角变换、精确空间定位与时间区间定位方面持续受阻;视频任务中的行为层次理解面临原子动作识别与复合行为组合的鸿沟,且多数模型无法将答案预测与时空证据有效绑定。在构建过程中,挑战体现为:需从大规模仿真场景中自动提取可靠的地标语义信息与无人机位姿数据,同时保证多视角观测的可见性校验、轨迹生成的几何可行性与语义一致性;此外,如何在有限标注资源下平衡任务难度、模态覆盖与评估效率,并通过严格的质量检查确保数据集的可靠性,亦是设计中的严峻考验。
常用场景
经典使用场景
UAV-DualCog作为首个聚焦双认知能力的无人机时空推理基准,其经典使用场景在于系统性地评估多模态大语言模型在无人机视角下的自状态认知与环境状态认知能力。通过精心设计的图像与视频任务,该基准要求模型不仅理解外部地标、场景结构,还需准确推理自身相对于地标的方位、运动状态及未来观测变化,为无人机具身智能研究提供了统一的测试平台。
解决学术问题
该数据集解决了当前无人机基准测试中普遍忽视的自我状态与环境状态联合推理这一学术空白。现有研究多侧重于单一的外部场景理解或任务完成,而UAV-DualCog首次将双认知维度作为核心评估目标,并引入显式的空间与时间证据定位要求,揭示了现有MLLM在视角变换、精确空间定位、时间间隔定位等维度的持久瓶颈,为无人机具身智能的评测体系提供了范式性的补充。
实际应用
在实际应用中,UAV-DualCog为无人机自主导航、目标搜索与监视等部署场景提供了关键的评估与训练资源。通过模拟无人机在三维空间中的连续运动与视点变化,该基准可用于验证MLLM在边缘计算约束下执行实时空间推理的可靠性,其结构化的标注方案也有助于开发更鲁棒的无人机自主决策系统,推动低空经济、城市巡检等领域的智能化落地。
数据集最近研究
最新研究方向
当前,无人机(UAV)智能体的研究正从单一的环境感知向“自省与察世”的双重认知范式演进。UAV-DualCog数据集应运而生,它首次将无人机自身的运动状态、视角变换与外部环境的时空推理作为统一评价维度。该数据集构建了大规模、可扩展的语义点云自动标注管线,包含图像与视频两类任务,不仅评估模型对地标可见性、行为识别等环境线索的解析能力,更要求模型在多变视角下精准推断自身的相对位置与飞行行为。前沿研究显示,现有多模态大模型(MLLMs)在无人机双重认知任务上表现远未可靠,尤其在自我状态推理、时空证据定位等方面存在显著瓶颈。UAV-DualCog的提出不仅填补了无人机具身推理评估的空白,也为推动MLLMs在动态空域环境中的结构化监督学习与跨模态一致性研究提供了关键数据基础与训练资源。
相关研究论文
  • 1
    Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs西北工业大学; 中国石油大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务