遇见数据集

AerialDojo-200K

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

AerialDojo-200K是一个大规模的开源世界空中目标搜索基准套件,旨在评估空中智能体在大型非结构化3D环境中自主探索并找到由语义描述(SemanticOGS)或参考图像(ImageOGS)指定的目标物体的能力。该套件包含42个仿真场景,涵盖4个场景家族和21种场景类型,共提供205,732个任务实例,分为基础、标准和长视域三种设置。其规模是先前最大空中目标搜索基准的3倍场景数和18.7倍任务实例数。数据集由12名标注员耗时两个月精心标注,包含109个地标、2,099个目标物体以及2,099个物体锚点,并提供了总长4,115.313公里的无碰撞参考轨迹和63,177组专用于训练的多视角录制数据。数据格式、动作空间和评估协议统一,支持在21个分布内场景和21个分布外场景上进行评估。对9个多模态大语言模型(5个开源和4个闭源)的基线评估突显了构建通用空中智能体面临的挑战。数据集包含AerialENVS(UE/ProjectAirSim环境包)、SemanticOGS(语义目标搜索任务)、ImageOGS(图像目标搜索任务及参考图像)和TrajectoryDATA(每条地图/任务/分区合并的轨迹文件)。注意:分布外测试集(OOD_TESTS)未公开,需联系作者进行评估。

AerialDojo-200K is a large-scale open-world aerial target search benchmark suite designed to evaluate the ability of aerial agents to autonomously explore and find target objects specified by semantic descriptions (SemanticOGS) or reference images (ImageOGS) in large unstructured 3D environments. The suite contains 42 simulation scenes covering 4 scene families and 21 scene types, providing a total of 205,732 task instances divided into three settings: basic, standard, and long-horizon. Its scale is 3 times the number of scenes and 18.7 times the number of task instances of the previous largest aerial target search benchmark. The dataset was carefully annotated by 12 annotators over two months, containing 109 landmarks, 2,099 target objects, and 2,099 object anchors, and provides a total of 4,115.313 km of collision-free reference trajectories and 63,177 sets of multi-view recording data dedicated to training. The data format, action space, and evaluation protocol are unified, supporting evaluation on 21 in-distribution scenes and 21 out-of-distribution scenes. Baseline evaluations of 9 multimodal large language models (5 open-source and 4 closed-source) highlight the challenges of building general-purpose aerial agents. The dataset includes AerialENVS (UE/ProjectAirSim environment package), SemanticOGS (semantic target search tasks), ImageOGS (image target search tasks and reference images), and TrajectoryDATA (merged trajectory files for each map/task/partition). Note: The out-of-distribution test set (OOD_TESTS) is not publicly available and requires contacting the authors for evaluation.

创建时间:
2026-09-30
搜集汇总
数据集介绍
AerialDojo-200K 数据集图片
构建方式
面向开放世界空中目标搜索任务,AerialDojo-200K依托Unreal Engine与ProjectAirSim构建了42个仿真场景,覆盖四类场景族与21种场景类型。数据采集通过12名标注人员历时两个月完成,标注了109个地标、2099个目标物体及2099个物体锚点,并生成总长4115.313公里的无碰撞参考轨迹与63177组多视角记录。任务实例以SemanticOGS与ImageOGS两种目标表征形式组织,统一划分为Base、Standard与Long-Horizon三种设置,最终形成205732个任务实例,构成目前该领域规模最大的基准套件。
特点
该数据集的核心特征在于其规模与质量的同步提升。相较于此前最大的空中目标搜索基准,其场景数量扩展至三倍,任务实例增长至18.7倍,涵盖21个分布内与21个分布外场景。数据提供共享的数据格式、动作空间与评估协议,支持在统一框架下进行跨场景评估。SemanticOGS与ImageOGS针对同一目标搜索任务提供两种互补的目标表示方式,分别以语义描述和参考图像指定目标。多模态大语言模型的基线评估结果揭示了通用空中智能体构建中尚存的关键挑战。
使用方法
使用该数据集需首先克隆GitHub代码仓库,随后在仓库根目录下通过huggingface_hub提供的hf命令下载AerialENVS、SemanticOGS、ImageOGS与TrajectoryDATA四个目录的数据。同一分区内,任务的episode_id与Trajectories.json中的轨迹索引一一对应,便于任务与轨迹的关联检索。公开的任务与轨迹划分为ID_TRAINS、ID_TESTS与OOD_TRAINS,分布外测试集OOD_TESTS未公开发布,需通过邮件联系作者安排测试。环境地图ID_ENVS与OOD_ENVS均可获取,用户可参照GitHub README完成安装、轨迹录制及自定义策略的运行。
背景与挑战
背景概述
空中智能体的自主导航与目标搜索是具身智能领域的前沿议题,其核心在于让飞行器摆脱预设航线的束缚,依据语义描述或参考图像在非结构化三维空间中定位目标。AerialDojo-200K于2026年由清华大学团队发布,旨在为开放世界空中目标搜索构建大规模基准。该数据集涵盖42个仿真场景与逾二十万条任务实例,规模远超既往同类基准,并首次以统一协议整合语义与图像两种目标表征,为多模态大模型驱动的空中智能体提供了系统性评测平台,推动了该领域从指令跟随向自主探索的范式转变。
当前挑战
该数据集所应对的核心难题在于开放世界目标搜索本身的高度不确定性:空中视角下目标外观随距离与遮挡剧烈变化,语义描述的开放性与参考图像的视角差异对智能体的跨模态理解构成严峻考验,而长时程任务更要求其在广阔空间中维持持续探索与决策能力。构建层面,团队需确保仿真场景的多样性与真实感,平衡分布内与分布外场景的划分以检验泛化性,并通过人工标注与无碰撞轨迹采集保障数据质量。九种多模态大模型的基线评测结果亦揭示,通用空中智能体的实现仍面临显著差距。
常用场景
经典使用场景
在具身智能与空中机器人交叉研究的浪潮中,开放世界空中目标搜索任务日益成为检验智能体自主感知与决策能力的关键试炼场。AerialDojo-200K 的经典使用场景在于构建大规模仿真环境,令空中智能体在非结构化的三维场景中自主探索,依据语义描述或参考图像定位并抵达目标物体,而非依赖预先设定的路线指令。该数据集涵盖四类场景家族、二十一种场景类型,共计二十万余个任务实例,并提供语义目标搜索与图像目标搜索两种目标表征形式,为训练和评估通用空中智能体提供了标准化的演练场。
解决学术问题
长期以来,空中目标搜索研究受限于场景规模狭小、任务实例匮乏以及评估协议不统一等瓶颈,难以系统性地衡量智能体在开放世界中的泛化能力。AerialDojo-200K 以三倍于先前最大基准的场景数量和十八点七倍的任务实例规模,填补了大规模空中目标搜索基准的空白。其统一的数据格式、动作空间与评估协议,支持在分布内与分布外场景中进行跨模型比较,九种多模态大语言模型的基线评估结果揭示了构建通用空中智能体所面临的剩余挑战,为后续研究提供了可靠的参照坐标。
衍生相关工作
AerialDojo-200K 的发布催生了一系列围绕开放世界空中目标搜索的后续研究。基于该基准,研究者相继探索了多模态大语言模型在三维空间推理中的适配方法、语义目标与图像目标之间的跨模态对齐策略,以及长时程任务中的记忆与规划机制。其分布外测试划分的保留策略亦激发了关于泛化评估协议设计的讨论。该数据集所提供的高质量标注与统一接口,已成为空中具身智能领域多个经典工作的实验基石,持续推动着通用空中智能体架构的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务