遇见数据集

UAV-VLN-FOV

收藏
github2026-06-21 更新2026-06-22 收录
数据链接:
官方服务:

资源简介:

UAV-VLN-FOV基准测试是为3DG-VLN任务构建的高分辨率基准测试,用于精确的目标可见无人机导航。该数据集包含2,717条轨迹、简洁的高级指令、高分辨率双视图图像、连续的3D路径点标注,以及用于可见、未见对象和未见场景测试的评估分割。数据集旨在评估精确的看见并到达导航,其中目标从初始人类视角可见,无人机需要准确接近目标。

The UAV-VLN-FOV benchmark is a high-resolution benchmark dataset constructed for the 3DG-VLN task, targeting precise object-visible drone navigation. This dataset contains 2,717 trajectories, concise high-level instructions, high-resolution dual-view images, continuous 3D waypoint annotations, as well as evaluation splits for testing on visible targets, unseen objects and unseen scenes. The dataset is designed to evaluate precise see-and-reach navigation, where the target is visible from the initial human perspective, and the drone is required to accurately approach the target.

创建时间:
2026-06-01
原始信息汇总

数据集概述:UAV-VLN-FOV

该数据集是 3DG-VLN 项目的一部分,专为高精度无人机视觉语言导航任务构建。

核心特点

  • 任务导向:针对“看得到且能到达”的精准导航设计,目标在初始视角可见,无人机需准确接近目标。
  • 高分辨率双视角:提供无人机前视与下视的双视角图像,支持细粒度视觉定位与局部导航。
  • 在线方向更新:推理过程中,根据当前观测动态更新目标相对方向,减少空间漂移。

数据集规模

  • 包含 2,717 条轨迹
  • 每条轨迹配有简洁的高级语言指令
  • 提供高分辨率双视角图像连续的 3D 航点标注

数据划分

数据集包含三个评估子集:

  • seen(已见场景)
  • unseen-object(未见物体)
  • unseen-scene(未见场景)

下载与组织

  • 下载链接(百度网盘):Dataset Download(提取码: ymav)

  • 目录结构

    3DG-VLN/ ├── data/ │ └── UAV-VLN-FOV/ │ ├── train/ │ ├── test/ │ ├── unobject/ │ ├── unscene/ │ └── meta/

相关资源

  • 预训练权重(百度网盘):Pretrained Weight Download(提取码: sasg)
  • 代码仓库:官方代码、预训练权重及数据集均在此仓库中发布。
搜集汇总
数据集介绍
UAV-VLN-FOV 数据集图片
构建方式
UAV-VLN-FOV数据集的构建旨在支持无人机在视场范围内进行精确的视觉-语言导航任务。该数据集包含2,717条轨迹,每条轨迹配有简洁的高层指令、高分辨率双视图图像(前视与下视)以及连续的3D航点标注。数据集的构建基于TravelUAV模拟器环境,覆盖多种场景,并划分为训练集、测试集、未见物体集与未见场景集,以全面评估模型在不同条件下的泛化能力。
特点
该数据集的核心特点在于其高分辨率双视图观测机制,无人机通过前视与下视图像实现精细的视觉定位与局部导航。同时,数据集引入了粗粒度3D方向引导,为目标导向的航点预测提供空间先验,并在推理过程中动态更新相对目标方向,有效减少空间漂移。这些设计使得数据集特别适用于评估精确的“所见即所达”导航任务,其中目标在初始视角中可见,无人机需准确接近目标。
使用方法
使用UAV-VLN-FOV数据集时,需先通过百度云链接下载数据,并按指定目录结构组织,包括train、test、unobject、unscene和meta文件夹。评估模型时,运行bash脚本执行3DG-VLN_eval.sh进行测试,随后运行metric.sh计算导航指标,包括成功率、Oracle成功率、路径加权成功率和导航误差。此外,还需从TravelUAV项目下载模拟器环境并保持目录结构不变,以确保环境配置正确。
背景与挑战
背景概述
无人机视觉-语言导航(UAV-VLN)旨在通过自然语言指令引导无人机在复杂三维环境中自主飞行并精准抵达目标。然而,现有研究工作多聚焦于低分辨率图像和宏观路径规划,忽略了高分辨率视野下目标可见性对精确‘看见并抵达’任务的关键作用。2026年,由Fanfu Xue、En Yu、Yantian Shen等来自学术界的研究人员提出了UAV-VLN-FOV基准数据集,该数据集包含2,717条轨迹、高分辨率双视角图像(前视与下视)以及连续3D路径点标注,专门用于评估无人机在目标初始可见条件下的精确导航能力。该数据集通过引入在线方向更新与3D方向引导机制,显著推动了无人机视觉-语言导航从宏观路径规划向细粒度空间感知的演进。
当前挑战
无人机视觉-语言导航面临两大核心挑战:其一,领域问题层面,现有方法难以在复杂三维环境中同时实现目标细粒度视觉定位与局部精确导航,尤其是当目标位于视野内(FOV)时,无人机需要融合前视与下视双视角信息以克服单视角深度感知不足与空间歧义性;其二,数据集构建层面,采集高分辨率双视图图像与手动标注连续3D路径点面临极大困难,需在多种城市与乡村场景下保证轨迹覆盖的多样性、视角转换的平滑性以及标注的厘米级精度。此外,如何定义‘目标可见性’并构建统一的未见场景与未见物体测试分割,也对数据集的泛化能力提出了严苛要求。
常用场景
经典使用场景
在无人机自主导航研究领域,UAV-VLN-FOV基准为评估“所见即所达”的精确视觉语言导航任务提供了核心实验平台。研究者在无人机搭载的移动平台上,利用数据集中2,717条轨迹所包含的高分辨率双视角图像与三维连续航点标注,以模拟从人类起始视角锁定目标后、无人机需自主飞行至目标附近的经典场景。该基准划分了可见、未见物体及未见环境三种测试子集,能够系统性地衡量模型在不同视觉陌生度下的泛化能力,从而成为对比不同视觉语言导航算法性能的黄金标准。
衍生相关工作
围绕UAV-VLN-FOV基准,已激发了一系列富有建设性的拓展研究方向。研究者尝试将底层视觉骨干替换为更为轻量化的模型,以实现机载实时推理;另有工作借鉴GroundingDINO等开放词汇检测框架,提升无人机在未见物体上的视觉指代能力。此外,部分研究结合TravelUAV模拟器,将3DG-VLN框架扩展到多机协同作业场景,探索语言驱动的群体编队避障与目标搜索。这些衍生工作不仅验证了该基准作为精确视觉语言导航技术孵化平台的有效性,也进一步丰富了无人机智能体的语言理解与空间推理能力边界。
数据集最近研究
最新研究方向
当前,无人机视觉语言导航领域正从传统的静态目标导航向动态、可交互的“即见即达”导航范式演进。UAV-VLN-FOV基准的构建,精准契合了具身智能与空中机器人交叉领域的前沿需求——即无人机需在有限视野内对可见目标进行精确的自主接近。该数据集通过提供高分辨率双视角观测(前视与俯视)与连续3D航点标注,结合在线方向更新机制,有效缓解了无人机导航中的空间漂移问题。这一研究方向为灾难救援、精准农业巡检等复杂环境下的自主飞行任务提供了关键技术支撑,推动了视觉语言导航从模拟环境向真实场景应用的实质性跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务