遇见数据集

AeroManip-VLA

收藏
github2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

AeroManip-VLA是一个用于空中操纵视觉-语言-动作(VLA)数据生成和策略评估的GPU并行基准,包含超过80,000条通过强化学习生成的专家演示轨迹,涵盖5个参数化技能(拾取、放置、导航、打开、关闭),支持在单个RTX 5090上运行3,900多个并行环境,并提供基于X500的两种平台(1自由度夹爪和3自由度机械臂),以及自动事件标注(倾斜、高度、接触、负载损失和稳定性事件)和多种基线方法(ACT、扩散策略、π₀和π₀.₅)。

AeroManip-VLA is a GPU-parallel benchmark for aerial manipulation visual-language-action (VLA) data generation and policy evaluation. It contains over 80,000 expert demonstration trajectories generated via reinforcement learning, covering 5 parameterized skills (pick, place, navigate, open, close). It supports more than 3,900 parallel environments running on a single RTX 5090, and provides two platforms based on X500: a 1-degree-of-freedom gripper and a 3-degree-of-freedom robotic arm. Additionally, it offers automatic event annotation covering tilt, height, contact, load loss, and stability events, as well as multiple baseline methods including ACT, diffusion policies, π₀, and π₀.₅.

创建时间:
2026-09-28
原始信息汇总

AeroManip-VLA 数据集概述

基本信息

  • 名称:AeroManip-VLA
  • 全称:Scalable Vision-Language-Action Learning for Aerial Manipulation with RL-Generated Demonstrations
  • 发布者:Rui Huang、Yanlin Mu、Lidong Li、Yucong Wang、Zichen Yan、Lin Zhao
  • 所属机构:新加坡国立大学(National University of Singapore)、北京理工大学(Beijing Institute of Technology)
  • 数据集状态:即将发布(Coming Soon),计划于论文被接收后发布
  • 详情页地址:https://github.com/RuiHuangNUS/AeroManip-VLA
  • 项目主页:https://ruihuangnus.github.io/AeroManip-VLA-page/
  • 论文地址:https://arxiv.org/abs/2609.36915

数据集定位

AeroManip-VLA 是一个面向空中视觉-语言-动作(Vision-Language-Action, VLA)数据生成与策略评估的 GPU 并行基准。它结合可复用的强化学习策略与专家任务规则,在无需人类遥操作的情况下生成演示数据,覆盖多样化的物体、场景和随机化初始条件。每次 rollout 都会被自动标注任务进度、行为结果和飞行安全事件。

核心亮点

特性 说明
80K+ 演示数据 由强化学习生成的专家轨迹,涵盖基础技能到长时程任务
5 个参数化技能 Pick(抓取)· Place(放置)· Nav(导航)· Open(打开)· Close(关闭),可组合为长时程任务
3,900+ 并行环境 在单张 RTX 5090 上运行,吞吐量约为 AIR-VLA 的 6.7 倍(在相近 GPU 显存条件下)
两种 X500 平台 1 自由度夹爪与 3 自由度机械臂,配备载荷感知底层控制器和 PX4 风格控制分配
事件标注 自动标注倾斜、高度、接触、载荷丢失和稳定性事件,用于结构化故障分析
基线模型 ACT、Diffusion Policy、π₀ 和 π₀.₅ 在该基准上进行了评估

演示内容

  • 专家 Pick → Navigate → Place 演示,包含第三人称视角、机载 RGB 和深度视图。
  • 更多视频(强化学习策略、3 自由度开/关、长时程任务、户外包裹投递、失败案例)可参见项目主页。

发布计划

  • [x] 论文提交
  • [x] 包含演示视频的项目主页
  • [x] YouTube 完整演示视频(https://youtu.be/1uljytfGFI4)
  • [x] Bilibili 完整演示视频(https://www.bilibili.com/video/BV18Qad6oEY7)
  • [x] arXiv 论文(https://arxiv.org/abs/2609.36915)
  • [ ] 数据集发布(论文接收后)
  • [ ] 数据生成代码:仿真、载荷感知控制、混合专家与强化学习策略(论文接收后)
  • [ ] IL / VLA 基线的训练与评估代码(论文接收后)

引用信息

bibtex @article{huang2026aeromanipvla, title = {AeroManip-VLA: Scalable Vision-Language-Action Learning for Aerial Manipulation with RL-Generated Demonstrations}, author = {Huang, Rui and Mu, Yanlin and Li, Lidong and Wang, Yucong and Yan, Zichen and Zhao, Lin}, journal = {arXiv preprint arXiv:2609.36915}, year = {2026} }

联系方式

  • 提交 issue 至该仓库
  • 邮箱:ruihuang@u.nus.edu
搜集汇总
数据集介绍
AeroManip-VLA 数据集图片
构建方式
空中操作任务长期受制于真实飞行数据采集的高昂成本与安全风险,人工遥操作示范难以规模化,制约了视觉-语言-动作模型在该领域的训练与泛化。AeroManip-VLA另辟蹊径,将可复用的强化学习策略与专家任务规则相结合,在GPU并行仿真中自动生成示范轨迹,全程无需人类介入;每个回合均围绕多样化物体、场景及随机化初始条件展开,并对任务进度、行为结果与飞行安全事件进行自动标注,从而形成覆盖基础技能到长时程任务的专家数据体系。
特点
该数据集以八万余条强化学习生成的专家轨迹为骨架,包含抓取、放置、导航、开启、闭合五种参数化技能,并可灵活组合为长时程任务;依托单张RTX 5090显卡即可并行驱动三千九百余个环境,吞吐量约为AIR-VLA的6.7倍;数据同时涵盖两种基于X500的平台构型、载荷感知底层控制器与PX4风格控制分配,且对倾斜、高度、接触、载荷丢失与稳定性等事件进行结构化标注,为失败分析与策略评估提供细粒度依据。
使用方法
研究者可将AeroManip-VLA作为空中视觉-语言-动作学习的基准与训练资源,利用其中RL生成的示范数据开展模仿学习或策略预训练,并在统一评测协议下对比ACT、Diffusion Policy、π₀与π₀.₅等基线;借助事件标注,用户能够按任务进度与飞行安全维度筛选轨迹、诊断策略失效模式,亦可通过参数化技能组合定制长时程操作任务。数据生成代码、仿真环境及训练评估代码将随论文录用陆续开放,便于社区复现与扩展。
背景与挑战
背景概述
空中操作(aerial manipulation)作为机器人学与具身智能交叉的前沿方向,长期受制于真实数据采集成本高昂、人类遥操作难以规模化等瓶颈,导致视觉-语言-动作(VLA)模型在该领域的迁移与泛化能力受限。2026年9月,新加坡国立大学Rui Huang、Lin Zhao等联合北京理工大学Yanlin Mu等研究者发布AeroManip-VLA数据集,旨在以强化学习生成的专家演示替代人工示教,构建可扩展的空中VLA数据生成与策略评估基准。该数据集涵盖8万余条演示轨迹、5类参数化技能及两类X500平台,支持长时程任务与结构化失败分析,为空中操作领域的规模化学习提供了关键基础设施,对推动VLA模型从地面向三维空间拓展具有重要影响。
当前挑战
该数据集所应对的核心领域难题在于:空中操作同时涉及高维连续控制、欠驱动动力学与精细接触操作,传统方法难以在真实环境中低成本获取大规模、高质量且语义标注完备的演示数据,致使VLA模型在该场景下训练困难、泛化脆弱。构建过程中亦面临多重挑战:其一,如何在单张GPU上实现数千个并行环境的稳定仿真,并保持负载感知控制与PX4风格控制分配的一致性;其二,如何设计可复用的强化学习策略与专家任务规则,使生成的演示既覆盖基本技能又支持长时程任务组合;其三,如何对倾斜、高度、接触、负载丢失与稳定性等飞行安全事件进行自动标注,以支撑结构化的失败分析与策略评估。
常用场景
经典使用场景
在空中视觉-语言-动作(VLA)学习领域,具身智能体需在三维动态环境中完成抓取、放置、导航、开合等复合操作,而真实飞行实验成本高昂且难以规模化。AeroManip-VLA凭借GPU并行仿真架构,将可复用的强化学习策略与专家任务规则耦合,无需人工遥操作即可在多样化物体、场景和随机初始条件下自动生成八万余条专家演示轨迹。每条轨迹均配有任务进度、行为结果与飞行安全事件的自动标注,为模仿学习与VLA策略训练提供了高保真、大规模且结构化的空中操作数据底座。
衍生相关工作
围绕AeroManip-VLA,相关研究沿多条路径展开。其GPU并行数据生成范式启发了后续空中VLA基准在吞吐效率与任务复杂度上的迭代,参数化技能组合与混合专家强化学习策略被延伸至更广泛的空中操作技能库构建。事件标注体系为空中操作失败分析与安全评估提供了可复用的标注框架,而基于该数据集训练的模仿学习与VLA基线亦催生了面向负载变化与动态场景的鲁棒策略改进工作,逐步形成以规模化生成驱动空中具身学习的生态。
数据集最近研究
最新研究方向
空中操作领域长期受制于真实飞行数据采集的高成本与高风险,遥操作依赖更使大规模示范数据的获取举步维艰。AeroManip-VLA 以GPU并行仿真为基石,将强化学习策略与专家任务规则相融合,在无需人类介入的条件下自动生成八万余条涵盖基础技能至长程任务的飞行操作轨迹,并同步标注倾角、高度、接触与载荷损失等安全事件,为结构化失效分析提供细粒度支撑。该基准在单张RTX 5090上实现逾三千九百个并行环境,吞吐量较同类工作提升近七倍,显著缓解了VLA模型在空中操作场景下的数据饥渴。其配套的载荷感知底层控制器与PX4风格控制分配,以及ACT、Diffusion Policy、π₀等基线的系统评测,正推动空中具身智能从孤立演示迈向可扩展、可复现的规模化学习范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务