遇见数据集

G1_Dex3_Trash_LocoManipulation

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

该数据集包含使用Unitree G1人形机器人配备Dex3-1灵巧手进行遥操作演示的录制数据,任务为从地面拾取塑料垃圾袋并放入垃圾桶。数据集包含118个片段(约183,000帧,61分钟,50Hz采样率),其中前80个为正常演示,第81至117个为失败与恢复演示(操作者故意抓取失败后恢复并完成任务)。数据格式采用LeRobot v2.1标准,视频为H.264编码,分辨率为480x640,50fps。观察空间包括头部摄像头图像(480x640x3)、43维关节位置、14维腕部状态(位置+四元数)、4维基座方向和3维投影重力。动作空间包括64维GEAR-SONIC v1.1运动令牌(驱动全身)、43维关节目标值、7维左手关节指令和7维右手关节指令(全零,因仅使用左手)。数据采集于真实硬件,通过PICO VR设备进行三点追踪遥操作,使用GEAR-SONIC v1.1作为全身控制器。该数据集适用于训练人形机器人全身控制的大规模视觉-语言-动作模型,特别是针对长周期、具有失败恢复能力的操作任务。

This dataset contains recordings of teleoperation demonstrations using a Unitree G1 humanoid robot equipped with a Dex3-1 dexterous hand, performing the task of picking up a plastic garbage bag from the ground and placing it into a trash can. The dataset includes 118 episodes (approximately 183,000 frames, 61 minutes, sampled at 50Hz), with the first 80 episodes being normal demonstrations and episodes 81 to 117 being failure and recovery demonstrations (where the operator intentionally fails to grasp and then recovers to complete the task). The data format follows the LeRobot v2.1 standard, with videos encoded in H.264 at a resolution of 480x640 and 50fps. The observation space includes head camera images (480x640x3), 43-dimensional joint positions, 14-dimensional wrist states (position + quaternion), 4-dimensional base orientation, and 3-dimensional projected gravity. The action space includes 64-dimensional GEAR-SONIC v1.1 motion tokens (driving the whole body), 43-dimensional joint target values, 7-dimensional left-hand joint commands, and 7-dimensional right-hand joint commands (all zeros, as only the left hand is used). Data was collected on real hardware via three-point tracking teleoperation using a PICO VR device and the GEAR-SONIC v1.1 whole-body controller. This dataset is suitable for training large-scale vision-language-action models for whole-body control of humanoid robots, particularly for long-horizon manipulation tasks with failure recovery capabilities.

提供机构:
MindsAndCompany
创建时间:
2026-09-03
原始信息汇总

数据集概述:G1 Dex3 Trash Loco-Manipulation

该数据集包含通过遥操作采集的Unitree G1人形机器人(配备Dex3-1灵巧手)执行“从地面拾取塑料垃圾袋并放入垃圾桶”任务的演示数据。数据采集于真实硬件,涵盖行走、下蹲、抓取、站起、转身、搬运和投放等全身移动操作(Loco-Manipulation)行为。

数据规模:共118个演示片段,约183,000帧,时长约61分钟(以50 Hz频率记录)。

任务序列

  1. 走向垃圾袋
  2. 拾起垃圾袋
  3. 转身约180度
  4. 携带垃圾袋走向垃圾桶
  5. 将垃圾袋放入垃圾桶

仅使用左手完成抓取,右手在整个数据集中保持张开状态。

数据构成与注意事项

  • 第0-80片段为常规演示;第81-117片段为失败与恢复演示(每个片段中操作者故意使抓取失败,随后恢复并完成任务)。
  • 失败尝试的数据为真实记录,约占全部帧的6.7%。若训练策略时不进行掩码或降权处理,模型可能学习到失败行为。

数据格式:LeRobot v2.1格式,视频为H.264编码,分辨率480x640,帧率50 fps。

观测数据:

  • observation.images.ego_view:头部相机图像(480x640x3)
  • observation.state:43维关节位置(顺序:左腿6、右腿6、腰3、左臂7、左手7、右臂7、右手7)
  • observation.eef_state:14维,双腕部位置+四元数姿态
  • observation.root_orientation:4维,基座四元数
  • observation.projected_gravity:3维,基座坐标系下的重力向量

相机为Intel RealSense D435i(仅彩色流),安装于头部,偏航角47.6度向下。

动作数据:

  • action.motion_token:64维GEAR-SONIC v1.1潜在动作表征(驱动全身动作,需配合特定模型检查点使用)
  • action.wbc:43维全身控制器产生的关节目标
  • teleop.left_hand_joints:7维左手控制指令
  • teleop.right_hand_joints:7维右手控制指令(全为零)

采集方式:通过PICO VR装置和三点追踪系统遥操作真实Unitree G1机器人,使用GEAR-SONIC v1.1作为全身控制器。操作者直接控制上半身,控制器负责平衡与运动。

预期用途:用于人形机器人动作-语言-视觉模型(VLA)的后训练,尤其针对全身移动操作任务。数据集为GR00T N1.7模型构建,但关节状态和视频可用于任何接受43维人形状态输入的政策模型。

许可证:Apache License 2.0。视频、关节状态和注释为原始录制内容;motion_token为GEAR-SONIC模型输出(遵循NVIDIA开放模型许可证)。

搜集汇总
数据集介绍
G1_Dex3_Trash_LocoManipulation 数据集图片
构建方式
该数据集通过真实硬件上的遥操作系统采集而成,旨在捕捉人形机器人全身协同操作的全过程。数据采集依托Unitree G1人形机器人,配备Dex3-1灵巧手,操作员借助PICO VR设备与三点追踪技术,通过GEAR-SONIC v1.1全身控制器驱动机器人执行任务。任务流程涵盖行走至垃圾袋、下蹲抓取、站立转身、携带至垃圾桶并投入等多个阶段,全程由操作员控制上半身,而控制器自主处理平衡与移动。数据集共包含118个演示片段,总时长约61分钟,其中前80个为正常演示,后37个为故意失败后恢复的演示,为算法学习容错与恢复策略提供了多模态数据基础。
特点
数据集的一大特色是包含64维的动作运动令牌(motion token),该令牌由GEAR-SONIC v1.1编码器生成,其潜在空间特定于该检查点,需配套相应的解码器才能正确解析,而43维的关节状态则无此依赖,便于通用策略直接使用。数据以LeRobot v2.1格式存储,视频采用H.264编码,50Hz帧率,包含头部视角、关节状态、末端执行器姿态等多种观测。此外,所记录的失败与恢复演示真实反映了操作中的失误环节,为研究鲁棒控制提供了独特的负样本。
使用方法
数据集主要面向人形机器人视觉-语言-动作模型的后期训练,尤其适配于GR00T N1.7等全身控制模型。使用者可通过LeRobot库轻松加载数据,并利用关节状态与视频信息训练任意接受43维人形机器人状态输入的策略。需注意,若策略依赖运动令牌,则必须配置GEAR-SONIC v1.1的解码器文件;而若训练目标不包含失败恢复,则需剔除或对失败片段降权处理。该数据集提供了清晰的数据结构说明,便于研究者按其观测与动作格式进行定制化集成与应用。
背景与挑战
背景概述
该数据集由mncai等人于2026年创建,旨在解决人形机器人全身移动操作(loco-manipulation)领域的数据稀缺问题。研究团队利用Unitree G1人形机器人和Dex3-1灵巧手,通过遥操作采集了118个真实操作序列,共计约18.3万帧,时长达61分钟。核心研究问题在于,当机器人需从地面拾取塑料袋并放入垃圾桶时,如何协调行走、下蹲、抓取、起身、转身等全身动作。该数据集采用GEAR-SONIC v1.1控制器生成64维运动令牌,为后续视觉-语言-动作(VLA)模型(如GR00T N1.7)的微调提供了宝贵资源,填补了长时间跨度、失败恢复场景下人形机器人操作数据集的空白,对具身智能领域的发展具有显著推动作用。
当前挑战
该数据集面临的领域挑战主要在于人形机器人的全身移动操作,需解决行走、下蹲、抓取、起身、转身及投掷等多阶段任务的连续执行,这一过程对平衡控制和全身协调提出极高要求。构建过程中,挑战尤为突出:首先,数据通过遥操作采集,涉及操作员与机器人的实时交互,需要高精度跟踪和稳定通信;其次,数据集包含37个失败-恢复示范(第81至117集),其中失败的抓取动作占全部帧的6.7%,若不加掩码或加权,会导致策略学习到错误行为,增加数据清洗的难度;再者,64维动作令牌高度依赖GEAR-SONIC v1.1的特定潜在空间,无法被其他解码器正确解析,这限制了数据的通用性和可复现性。此外,数据采集仅依赖单目头戴相机,缺乏深度信息,对环境三维感知构成额外挑战。
常用场景
经典使用场景
在具身智能与机器人学习领域,该数据集为基于人类示教的全身运动-操作联合策略学习提供了宝贵的真实世界样本。其典型应用在于训练人形机器人完成复杂的家务操作任务,如从地面拾取垃圾袋并投入垃圾桶的完整流程。数据涵盖了行走、下蹲、抓取、起立、转身及投掷等多种全身协调动作,为多模态感知-运动控制模型的端到端训练奠定了数据基础。研究者可利用该数据集进行模仿学习、行为克隆及强化学习预训练,探索长时程任务下的策略泛化能力,是评估人形机器人全身控制与精细操作融合水平的重要基准。
解决学术问题
该数据集直面人形机器人在非结构化环境中进行全身移动操作的核心挑战,解决了以往数据集或局限于静态操作、或缺乏真实动态交互的弊端。通过提供包含失败与恢复演示的完整任务轨迹,它使得研究者能够深入探究策略在遭遇扰动或抓取失败时的鲁棒性与自适应恢复机制,从而推动容错控制与安全决策算法的学术进展。数据的真实硬件来源确保了物理一致性与动力学真实性,为研究sim-to-real迁移、域随机化及真实世界泛化问题提供了不可替代的实证支撑,对推动人形机器人从实验室走向实际应用具有重要的学术意义。
衍生相关工作
该数据集的开源性质催生了一系列衍生工作,尤其在基于人类演示的全身控制策略学习方向。围绕其提供的GEAR-SONIC运动令牌与关节状态双模态动作空间,研究者开发了多种策略解码架构与动作表征学习方法,推动了人形机器人统一动作表征的标准化进程。相关后续工作包括利用该数据进行视觉-语言-动作模型的后训练,探索语言指令与复杂运动技能的对齐;以及融合失败演示进行对抗训练,提升策略的恢复能力。此外,以该数据集为评估环境,催生了针对长时程任务的分层强化学习、技能发现及异常检测等研究,共同构筑了人形机器人操作学习领域的活跃研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务