遇见数据集

DexVerse

收藏
arXiv2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

DexVerse是由北卡罗来纳大学教堂山分校、香港大学和加州大学伯克利分校联合创建的大规模灵巧操作基准数据集,涵盖100项多样化任务并支持多机器人本体配置。该数据集包含3,180条通过VR遥操作收集的专家演示,每条数据均同步记录本体感知、RGB图像、深度信息、点云及仿真状态等多模态观测数据,数据来源覆盖8类核心操作范式。数据集通过模块化环境架构构建,采用配置驱动设计实现任务与机器人本体的解耦,支持纹理、光照、背景和相机视角的可控视觉变化。该数据集主要应用于通用灵巧操作策略的评估与开发,旨在系统解决跨任务泛化、跨本体适应以及视觉运动鲁棒性等核心挑战,为接触密集型操作和精细运动控制研究提供标准化测试平台。

DexVerse is a large-scale dexterous manipulation benchmark dataset jointly developed by the University of North Carolina at Chapel Hill, The University of Hong Kong, and the University of California, Berkeley. It covers 100 diverse tasks and supports multiple robot morphology configurations. This dataset contains 3,180 expert demonstrations collected via VR teleoperation. Each record synchronously collects multimodal observation data including proprioception, RGB images, depth information, point clouds, and simulation states, with data sources covering eight core manipulation paradigms. Constructed with a modular environment architecture, the dataset adopts a configuration-driven design to achieve decoupling between tasks and robot morphologies, supporting controllable visual variations in texture, lighting, background, and camera viewpoints. This dataset is primarily used for the evaluation and development of general-purpose dexterous manipulation strategies, aiming to systematically address core challenges such as cross-task generalization, cross-morphology adaptation, and visual-motor robustness, providing a standardized testbed for research on contact-rich manipulation and fine motor control.

创建时间:
2026-07-10
原始信息汇总

DexVerse:多任务、多形态灵巧操作的模块化基准

概述:DexVerse 是一个大规模、模块化的灵巧操作基准测试,旨在评估策略在多样化交互模式、感知条件和机器人形态下的泛化能力。该基准包含 100 个任务,支持 3 种机器人手臂和 6 种灵巧手,并提供可配置的视觉变化和 3,180 条演示数据。

1. 任务与数据

  • 任务数量与分类:共包含 100 个灵巧操作任务,分为 8 类:
    • 原始 (Primitive)
    • 功能 (Functional)
    • 关节 (Articulation)
    • 非抓取 (Non-prehensile)
    • 接触密集 (Contact-rich)
    • 双手 (Bimanual)
    • 多目标 (Multi-goal)
    • 长时域 (Long-horizon)
  • 任务示例:包括抓取立方体 (PickCube)、打开水龙头 (OpenFaucet)、用锤子钉钉子 (FunctionalHammerStrike)、插入销钉 (InsertPeg)、双手举起托盘 (BimanualLiftTray) 以及制作咖啡 (MakeCoffee) 等多阶段任务。
  • 演示数据量:共提供 3,180 条演示
    • 56 个短时域任务:每个任务提供 50 条轨迹
    • 5 个长时域任务:每个任务提供 20 条轨迹
    • 额外形态数据:每个短时域任务在 5 种备选机器人形态上各提供 1 条轨迹
  • 观察数据模态:演示包含同步的 本体感知、RGB、深度、点云和状态 观测数据。

2. 机器人与视觉变化

  • 机器人形态:支持 3 种机器人手臂(Franka Research 3, UR10e, xArm 7)和 6 种灵巧手(Sharpa Wave, WUJI Hand, Shadow Hand, Inspire Hand, Allegro Hand, LEAP Hand)。每种手型还提供浮动手腕变体。系统设计为模块化,支持用户自定义新增机器人和手。
  • 视觉变化:提供可配置的视觉变化以评估视觉运动泛化能力,包括:
    • 材质:物体和台面材质在重置时重新采样。
    • 光照:灯光方向、强度和色温变化。
    • 背景:从 HDR 环境库中替换背景天空盒。
    • 相机视角:支持同一任务在不同相机视角下观察。

3. 系统设计

DexVerse 基于 Isaac Lab 构建,采用配置驱动的模块化仿真架构,实现任务、形态和视觉条件的解耦。

  • 配置驱动:观测、动作、事件和成功条件均为配置类,可通过配置文件而非代码修改。
  • 继承与覆盖:架构为 主基础类 → 任务家族 (Task Family) → 任务 (Task),每个任务仅覆盖其专属的对象、目标和成功阈值,与形态解耦。
  • 数据采集:使用基于虚拟现实(Apple Vision Pro + dex-retargeting)的遥操作界面进行数据收集。

4. 基准测试结果

在 19 个任务上对四种代表性方法进行了基准测试:π₀.₅, OpenVLA, DP3, DP。每个任务评估 50 个回合,报告成功率。

  • 最佳平均成功率仅为 0.34
  • 没有一种方法在所有任务类别中占主导地位
类别 任务 π₀.₅ OpenVLA DP3 DP
抓取与抬起 BimanualLiftCarton 1.00 0.60 0.90 0.94
BimanualLiftTray 0.84 0.72 0.56 0.60
GraspBleach 0.10 0.06 0.32 0.10
GraspCup 0.16 0.08 0.22 0.50
(注:表中仅展示部分数据)

结论:结果揭示了在任务泛化和视觉运动鲁棒性方面存在的重大挑战,将 DexVerse 定位为通用灵巧操作的测试平台。

搜集汇总
数据集介绍
DexVerse 数据集图片
构建方式
DexVerse的构建基于模块化与配置驱动的设计理念。它依托Isaac Lab的 manager-based 环境接口,将任务环境与机器人本体解耦。每个任务通过结构化组件定义,包括场景布局、对象资产、机器人构型、观测与动作接口、初始化规则及成功条件。同一任务家族共享可复用模板,涵盖资产加载、状态初始化与成功检测等通用逻辑,而任务特定参数则定义操控对象、目标状态与完成阈值。这种层级继承的设计(基础环境→任务家族环境→具体任务环境)极大地减少了重复实现,使得新增任务、资产和本体变得简洁高效。
特点
DexVerse具备显著的多维度特点。首先,它囊括了100项多样化任务,覆盖从基础抓取到长时序多阶段操作的八大类别,全面评估灵巧操控能力。其次,它支持3种机械臂与6种灵巧手的组合,具备多本体覆盖能力,并可通过配置轻松扩展。为评估视觉运动泛化性,DexVerse提供了可配置的视觉变化,包括纹理、光照、背景与相机视角的调控。此外,它还提供了通过VR遥操作采集的3,180条专家演示数据集,同步记录本体感觉、RGB、深度、点云与状态观测,为多模态策略学习提供了统一且丰富的实验平台。
使用方法
使用DexVerse时,研究者可依据研究目标灵活配置环境。通过修改配置文件,用户能够选择任务、机器人本体组合、观测模态(如状态、RGB、点云)以及是否启用视觉随机化。该基准内置了多种观测模式预设,方便直接对接不同策略。同步发布的演示数据集支持通过状态回放机制在本地恢复轨迹,避免了因物理模拟差异导致的漂移问题。研究者可直接利用此数据集训练模仿学习或视觉-语言-动作策略,并在标准化的仿真环境下进行闭环评估,从而系统性地研究跨任务与跨本体的泛化性能。
背景与挑战
背景概述
灵巧操作作为通用机器人能力的核心基石,长期受限于缺乏能够统一评估跨任务、跨形态与跨感知条件泛化能力的基准平台。2026年,来自北卡罗来纳大学教堂山分校、香港大学与加州大学伯克利分校的研究团队共同推出了DexVerse——一个大规模模块化灵巧操作基准套件。该基准包含100项任务,覆盖抓取与重定位、铰接物体交互、功能性工具使用、双臂协调、非抓取控制、接触密集型行为、多目标执行以及长序列多阶段任务等广泛操作技能。DexVerse支持3种机械臂与6种灵巧手的组合,并提供可配置的纹理、光照与视角视觉变化,以及通过VR遥操作采集的3180条多模态专家演示。该基准的发布为系统评估与推动通用灵巧操作策略的发展提供了关键标准化测试场。
当前挑战
DexVerse所应对的核心领域挑战在于现有基准在任务多样性、形态覆盖与可控视觉变化上的显著不足,导致难以系统研究策略在跨任务与跨形态下的泛化能力。具体而言,构建过程面临如下挑战:首先,需设计支持100项任务且架构模块化的仿真环境,每项任务须定义清晰的交互物体、初始状态分布、观测接口、动作空间与成功判定条件,同时实现任务环境与机器人形态的解耦。其次,需为3种机械臂与6种灵巧手建立统一的形态配置规范,确保不同运动学、自由度与关节限制的机械结构能在同一任务框架下无缝切换。此外,为实现视触觉泛化评估,须在保持任务目标不变的前提下,引入对物体纹理、背景、光照与相机视角的可控随机化。最后,基于VR的遥操作数据采集系统面临跨形态重定位的难题,需通过优化将人体手部运动映射至不同灵巧手的关节空间,以生成高质量、可复现的多模态演示轨迹。
常用场景
经典使用场景
DexVerse作为一个大规模模块化灵巧操作基准测试平台,其最经典的使用场景在于系统评估和对比多种灵巧操作策略在统一框架下的表现。该数据集涵盖了100项精细设计的任务,横跨物体抓取与重定位、铰接物体交互、功能性工具使用、双手协调、非抓取控制、接触密集行为、多目标执行以及长时序多阶段任务完成等八大类别。研究者可通过该平台在三种机械臂和六种灵巧手的多形态配置下,结合可控的视觉变化(如纹理、光照、背景、相机视角)与同步的多模态观测数据(本体感觉、RGB、深度、点云、状态),对扩散策略、3D扩散策略、视觉-语言-动作模型等前沿方法进行全方位评估。这使得DexVerse成为当前研究跨任务泛化与跨形态适应能力的理想测试场。
解决学术问题
DexVerse有效解决了现有灵巧操作基准在任务多样性、形态覆盖率和视觉变化可控性方面存在的核心不足。此前,多数基准要么局限于简单夹爪操作,要么专注单一灵巧任务且缺乏专家示教数据,难以系统评估策略在多维度上的泛化能力。DexVerse通过统一的任务模板和配置驱动设计,解决了跨任务与跨形态学习研究中关键瓶颈:它首次在一个平台上同时支持从简单抓取到精密接触、从单手操作到双手协调、从单一目标到长时序流程等广泛操作模式。基准测试结果揭示了当前最优策略在接触密集操控、亚厘米级对齐、功能性工具使用等任务上仍面临重大挑战,平均成功率仅为34%,多项任务成功率为零,这为后续研究指明了明确的改进方向,推动了灵巧操作领域理论与方法的创新。
衍生相关工作
DexVerse的发布催生了一系列重要的后续研究工作。在策略学习层面,基于其在精密接触任务上揭示的挑战,研究人员开发了融合触觉力反馈的灵巧操作策略,通过在策略网络中引入接触力观测来弥补纯视觉行为克隆在亚厘米对齐上的不足。在跨形态泛化方面,DexVerse的多形态支持激发了‘灵巧策略可复用框架’的研究工作,探索如何将单手操作策略通过规范化的表示方法统一迁移至不同构型灵巧手上。在长时序任务领域,DexVerse的复合任务分类启发了混合时序动作切分方法的研究,通过融合不同时间尺度的预测来应对多阶段操作中的子目标歧义。这些衍生工作不仅扩展了灵巧操作的理论边界,也为构建通用、鲁棒且可迁移的灵巧操作策略奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务