AeroManip-VLA
收藏资源简介:
AeroManip-VLA是一个用于空中操纵视觉-语言-动作(VLA)数据生成和策略评估的GPU并行基准,包含超过80,000条通过强化学习生成的专家演示轨迹,涵盖5个参数化技能(拾取、放置、导航、打开、关闭),支持在单个RTX 5090上运行3,900多个并行环境,并提供基于X500的两种平台(1自由度夹爪和3自由度机械臂),以及自动事件标注(倾斜、高度、接触、负载损失和稳定性事件)和多种基线方法(ACT、扩散策略、π₀和π₀.₅)。
AeroManip-VLA is a GPU-parallel benchmark for aerial manipulation visual-language-action (VLA) data generation and policy evaluation. It contains over 80,000 expert demonstration trajectories generated via reinforcement learning, covering 5 parameterized skills (pick, place, navigate, open, close). It supports more than 3,900 parallel environments running on a single RTX 5090, and provides two platforms based on X500: a 1-degree-of-freedom gripper and a 3-degree-of-freedom robotic arm. Additionally, it offers automatic event annotation covering tilt, height, contact, load loss, and stability events, as well as multiple baseline methods including ACT, diffusion policies, π₀, and π₀.₅.
AeroManip-VLA 数据集概述
基本信息
- 名称:AeroManip-VLA
- 全称:Scalable Vision-Language-Action Learning for Aerial Manipulation with RL-Generated Demonstrations
- 发布者:Rui Huang、Yanlin Mu、Lidong Li、Yucong Wang、Zichen Yan、Lin Zhao
- 所属机构:新加坡国立大学(National University of Singapore)、北京理工大学(Beijing Institute of Technology)
- 数据集状态:即将发布(Coming Soon),计划于论文被接收后发布
- 详情页地址:https://github.com/RuiHuangNUS/AeroManip-VLA
- 项目主页:https://ruihuangnus.github.io/AeroManip-VLA-page/
- 论文地址:https://arxiv.org/abs/2609.36915
数据集定位
AeroManip-VLA 是一个面向空中视觉-语言-动作(Vision-Language-Action, VLA)数据生成与策略评估的 GPU 并行基准。它结合可复用的强化学习策略与专家任务规则,在无需人类遥操作的情况下生成演示数据,覆盖多样化的物体、场景和随机化初始条件。每次 rollout 都会被自动标注任务进度、行为结果和飞行安全事件。
核心亮点
| 特性 | 说明 |
|---|---|
| 80K+ 演示数据 | 由强化学习生成的专家轨迹,涵盖基础技能到长时程任务 |
| 5 个参数化技能 | Pick(抓取)· Place(放置)· Nav(导航)· Open(打开)· Close(关闭),可组合为长时程任务 |
| 3,900+ 并行环境 | 在单张 RTX 5090 上运行,吞吐量约为 AIR-VLA 的 6.7 倍(在相近 GPU 显存条件下) |
| 两种 X500 平台 | 1 自由度夹爪与 3 自由度机械臂,配备载荷感知底层控制器和 PX4 风格控制分配 |
| 事件标注 | 自动标注倾斜、高度、接触、载荷丢失和稳定性事件,用于结构化故障分析 |
| 基线模型 | ACT、Diffusion Policy、π₀ 和 π₀.₅ 在该基准上进行了评估 |
演示内容
- 专家 Pick → Navigate → Place 演示,包含第三人称视角、机载 RGB 和深度视图。
- 更多视频(强化学习策略、3 自由度开/关、长时程任务、户外包裹投递、失败案例)可参见项目主页。
发布计划
- [x] 论文提交
- [x] 包含演示视频的项目主页
- [x] YouTube 完整演示视频(https://youtu.be/1uljytfGFI4)
- [x] Bilibili 完整演示视频(https://www.bilibili.com/video/BV18Qad6oEY7)
- [x] arXiv 论文(https://arxiv.org/abs/2609.36915)
- [ ] 数据集发布(论文接收后)
- [ ] 数据生成代码:仿真、载荷感知控制、混合专家与强化学习策略(论文接收后)
- [ ] IL / VLA 基线的训练与评估代码(论文接收后)
引用信息
bibtex @article{huang2026aeromanipvla, title = {AeroManip-VLA: Scalable Vision-Language-Action Learning for Aerial Manipulation with RL-Generated Demonstrations}, author = {Huang, Rui and Mu, Yanlin and Li, Lidong and Wang, Yucong and Yan, Zichen and Zhao, Lin}, journal = {arXiv preprint arXiv:2609.36915}, year = {2026} }
联系方式
- 提交 issue 至该仓库
- 邮箱:ruihuang@u.nus.edu




