FLIGHT
收藏数据链接:
官方服务:
资源简介:
FLIGHT是一个细粒度长时程指令引导的混合无人机导航和推理任务基准,用于评估无人机在复杂环境中的导航和推理能力。
FLIGHT is a fine-grained, long-horizon instruction-guided benchmark for mixed unmanned aerial vehicle (UAV) navigation and reasoning tasks, aimed at evaluating the navigation and reasoning capabilities of UAVs in complex environments.
创建时间:
2026-05-22
原始信息汇总
数据集概述:FLIGHT
- 全称:Fine-grained Long-horizon Instruction-Guided benchmark for Hybrid UAV navigation and reasoning Tasks
- 发布机构:北京航空航天大学(BUAA)CoLaLab实验室
- 开源平台:Hugging Face(数据集链接:https://huggingface.co/datasets/jujujulien/FLIGHT)
- 相关论文:arXiv论文(链接:https://arxiv.org/abs/2606.06836)
- 项目主页:https://buaa-colalab.github.io/FLIGHT/
核心特点
- 细粒度长时域指令引导:专门针对无人机(UAV)在混合导航与推理任务中的长时域、细粒度指令理解设计。
- 混合任务类型:涵盖导航与推理两类任务,强调对复杂、长时间跨度指令的响应能力。
- 配套框架:项目同时提出 FLIGHT VLA(异步快慢视觉-语言-动作框架),为该数据集提供基准模型和推理方案。
数据集状态
- 代码:标注为“COMING SOON”,目前尚未公开。
- 数据:已在 Hugging Face 上开放下载。
搜集汇总
数据集介绍

构建方式
在无人机自主导航领域,现有数据集多聚焦于短时程、低层级避障或简单路径规划,缺乏对长时域、细粒度推理能力的系统评估。为弥合这一鸿沟,FLIGHT数据集应运而生,其构建基于模拟与真实环境深度融合的策略。研究团队精心设计了涵盖城市、郊区及复杂地形在内的多样化三维场景,并依赖高保真物理引擎生成长达数千步的无人机导航轨迹。每条轨迹均被逐一标注了包含转向、高度调节、目标识别等原子动作的细粒度指令,同时配套了反映场景语义与空间关系的结构化知识图谱,从而形成了一个兼具空间复杂性与时间延续性的高质量评测基准。
使用方法
FLIGHT数据集专为训练与评估多模态长时域导航模型而设计,其典型使用方式依托于配套的FLIGHT VLA异步快慢双通道框架。使用者可通过Hugging Face平台获取原始数据,包括高分辨率第一人称视频帧、文本指令流以及结构化知识图谱,并按照项目提供的接口将其加载为标准化的序列化样本。在实验配置中,研究者需定义观测窗口长度与动作预测粒度,利用数据集中同步标注的地面真值动作序列与状态转移函数来监督模型学习。同时,项目官网提供了评估脚本,可自动计算包括导航成功率、指令跟随准确率及推理效率在内的多维指标,便于研究者对自身模型的表现进行全方位的量化对比。
背景与挑战
背景概述
无人机自主导航技术近年来取得了显著进展,但现有数据集多聚焦于短时程、粗粒度的指令跟随任务,难以支撑复杂空中作业所需的精细化与长时程决策能力。FLIGHT数据集由北京航空航天大学CoLaLab团队于2025年创建,旨在解决细粒度长时程无人机导航与推理任务的基准测试问题。核心研究问题包括:如何将自然语言指令映射为连续的无人机动作序列,并在动态环境中保持长期目标的一致性。该数据集通过提供高精度标注的多元数据,为无人机视觉-语言导航研究树立了新的评估标准,在推动智能无人系统从感知到决策的闭环发展方面具有重要影响力。
当前挑战
领域挑战在于无人机需在长时程任务中融合视觉感知、语言理解与运动控制,现有方法易受累积误差和动态障碍物影响,导致任务失败率攀升。构建过程中,团队面临数据采集的高成本与真实场景复杂性矛盾,需设计涵盖多种光照、天气及地形条件的飞行轨迹,同时确保指令与动作之间的精细对齐。此外,标注长序列数据时,如何界定子任务边界并保持时序一致性也是重大考验。这些挑战共同构成了FLIGHT数据集研究的核心瓶颈。
常用场景
经典使用场景
FLIGHT数据集专为细粒度、长时程的无人机导航与推理任务设计,其核心使用场景在于评估和训练视觉-语言-动作(VLA)模型在复杂空中环境中的执行能力。研究者可借助该数据集模拟无人机在长距离飞行中的多阶段决策过程,涵盖从环境感知、指令理解到路径规划的全链路任务。通过提供混合异构的指令与视觉场景,FLIGHT为无人机在动态三维空间中的自主导航设定了高难度基准,尤其适用于需要精细时序控制与空间推理的算法验证。
解决学术问题
该数据集系统性地解决了现有无人机导航研究中存在的两个关键瓶颈:一是缺乏涵盖长期规划与瞬时响应的混合任务基准,二是缺少将自然语言指令与视觉动作序列深度耦合的评估体系。FLIGHT通过引入细粒度时间分层与多模态指令对齐,使学术研究能够同时检验模型在宏观路径规划与微观避障决策上的协同能力。其重要意义在于填补了无人机导航领域从‘感知-控制’向‘认知-推理’范式转变的测试空白,为开发具备类人推理能力的自主系统提供了标准化验证平台。
实际应用
在实际应用中,FLIGHT驱动的模型可直接赋能无人机在复杂城市环境中的应急响应、物流配送与基础设施巡检等场景。例如,无人机需在长时飞行中依据实时指令动态调整航向,同时规避突发障碍并精确完成悬停、抓取或勘察等操作。该数据集所强化的异步快慢视觉-语言-动作框架(FLIGHT VLA)能显著提升无人机在任务中断与环境扰动下的鲁棒性,从而降低对人工遥控的依赖,推动低空经济中全自主无人机服务的规模化落地。
数据集最近研究
最新研究方向
FLIGHT数据集聚焦于无人机长时域精细导航与推理任务,代表了具身智能与视觉语言行动模型交叉领域的前沿探索。其提出的异步快慢视觉语言行动框架,模拟了人类飞行员在复杂空域中的认知分层机制,为开发能够理解高阶指令并执行长时序决策的自主无人机系统提供了关键基准。该研究紧密关联当前低空经济与自主飞行器监管的热点需求,通过引入细粒度指令与多模态推理挑战,推动了无人机从简单避障向情景感知、意图推断的高级任务跃迁,对智能交通与应急救援等实际应用具有深远意义。
以上内容由遇见数据集搜集并总结生成



