DexVerse
收藏资源简介:
DexVerse是由北卡罗来纳大学教堂山分校、香港大学和加州大学伯克利分校联合创建的大规模灵巧操作基准数据集,涵盖100项多样化任务并支持多机器人本体配置。该数据集包含3,180条通过VR遥操作收集的专家演示,每条数据均同步记录本体感知、RGB图像、深度信息、点云及仿真状态等多模态观测数据,数据来源覆盖8类核心操作范式。数据集通过模块化环境架构构建,采用配置驱动设计实现任务与机器人本体的解耦,支持纹理、光照、背景和相机视角的可控视觉变化。该数据集主要应用于通用灵巧操作策略的评估与开发,旨在系统解决跨任务泛化、跨本体适应以及视觉运动鲁棒性等核心挑战,为接触密集型操作和精细运动控制研究提供标准化测试平台。
DexVerse is a large-scale dexterous manipulation benchmark dataset jointly developed by the University of North Carolina at Chapel Hill, The University of Hong Kong, and the University of California, Berkeley. It covers 100 diverse tasks and supports multiple robot morphology configurations. This dataset contains 3,180 expert demonstrations collected via VR teleoperation. Each record synchronously collects multimodal observation data including proprioception, RGB images, depth information, point clouds, and simulation states, with data sources covering eight core manipulation paradigms. Constructed with a modular environment architecture, the dataset adopts a configuration-driven design to achieve decoupling between tasks and robot morphologies, supporting controllable visual variations in texture, lighting, background, and camera viewpoints. This dataset is primarily used for the evaluation and development of general-purpose dexterous manipulation strategies, aiming to systematically address core challenges such as cross-task generalization, cross-morphology adaptation, and visual-motor robustness, providing a standardized testbed for research on contact-rich manipulation and fine motor control.
DexVerse:多任务、多形态灵巧操作的模块化基准
概述:DexVerse 是一个大规模、模块化的灵巧操作基准测试,旨在评估策略在多样化交互模式、感知条件和机器人形态下的泛化能力。该基准包含 100 个任务,支持 3 种机器人手臂和 6 种灵巧手,并提供可配置的视觉变化和 3,180 条演示数据。
1. 任务与数据
- 任务数量与分类:共包含 100 个灵巧操作任务,分为 8 类:
- 原始 (Primitive)
- 功能 (Functional)
- 关节 (Articulation)
- 非抓取 (Non-prehensile)
- 接触密集 (Contact-rich)
- 双手 (Bimanual)
- 多目标 (Multi-goal)
- 长时域 (Long-horizon)
- 任务示例:包括抓取立方体 (PickCube)、打开水龙头 (OpenFaucet)、用锤子钉钉子 (FunctionalHammerStrike)、插入销钉 (InsertPeg)、双手举起托盘 (BimanualLiftTray) 以及制作咖啡 (MakeCoffee) 等多阶段任务。
- 演示数据量:共提供 3,180 条演示。
- 56 个短时域任务:每个任务提供 50 条轨迹。
- 5 个长时域任务:每个任务提供 20 条轨迹。
- 额外形态数据:每个短时域任务在 5 种备选机器人形态上各提供 1 条轨迹。
- 观察数据模态:演示包含同步的 本体感知、RGB、深度、点云和状态 观测数据。
2. 机器人与视觉变化
- 机器人形态:支持 3 种机器人手臂(Franka Research 3, UR10e, xArm 7)和 6 种灵巧手(Sharpa Wave, WUJI Hand, Shadow Hand, Inspire Hand, Allegro Hand, LEAP Hand)。每种手型还提供浮动手腕变体。系统设计为模块化,支持用户自定义新增机器人和手。
- 视觉变化:提供可配置的视觉变化以评估视觉运动泛化能力,包括:
- 材质:物体和台面材质在重置时重新采样。
- 光照:灯光方向、强度和色温变化。
- 背景:从 HDR 环境库中替换背景天空盒。
- 相机视角:支持同一任务在不同相机视角下观察。
3. 系统设计
DexVerse 基于 Isaac Lab 构建,采用配置驱动的模块化仿真架构,实现任务、形态和视觉条件的解耦。
- 配置驱动:观测、动作、事件和成功条件均为配置类,可通过配置文件而非代码修改。
- 继承与覆盖:架构为 主基础类 → 任务家族 (Task Family) → 任务 (Task),每个任务仅覆盖其专属的对象、目标和成功阈值,与形态解耦。
- 数据采集:使用基于虚拟现实(Apple Vision Pro + dex-retargeting)的遥操作界面进行数据收集。
4. 基准测试结果
在 19 个任务上对四种代表性方法进行了基准测试:π₀.₅, OpenVLA, DP3, DP。每个任务评估 50 个回合,报告成功率。
- 最佳平均成功率仅为 0.34。
- 没有一种方法在所有任务类别中占主导地位。
| 类别 | 任务 | π₀.₅ | OpenVLA | DP3 | DP |
|---|---|---|---|---|---|
| 抓取与抬起 | BimanualLiftCarton | 1.00 | 0.60 | 0.90 | 0.94 |
| BimanualLiftTray | 0.84 | 0.72 | 0.56 | 0.60 | |
| GraspBleach | 0.10 | 0.06 | 0.32 | 0.10 | |
| GraspCup | 0.16 | 0.08 | 0.22 | 0.50 | |
| (注:表中仅展示部分数据) |
结论:结果揭示了在任务泛化和视觉运动鲁棒性方面存在的重大挑战,将 DexVerse 定位为通用灵巧操作的测试平台。




