遇见数据集

G1_Dex3_PickAndPlaceTrash

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

本数据集包含使用Unitree G1人形机器人搭配Dex3-1灵巧手进行遥操作演示的92个片段,总计198,846帧,约66分钟,采样频率为50Hz。任务为机器人从桌子上捡起一个塑料瓶,走到地上的篮子旁并将其丢入篮中。数据集包含以下字段:观察部分包括头戴摄像头图像(480x640x3,H.264编码,50fps)、43维关节位置(包括双腿、腰部、双臂和双手的关节角度)、14维末端执行器状态(双手位置和四元数)、4维基础方向四元数、3维基础坐标系下的投影重力向量;动作部分包括64维GEAR-SONIC编码器输出的运动令牌(需匹配对应解码器重放)、43维全身控制器产生的关节目标、7维右手关节命令(抓取手)、7维左手关节命令(均为零,左手未使用)。数据集通过VR设备在真实Unitree G1硬件上遥操作采集,使用NVIDIA GEAR-SONIC作为全身控制器,操作者直接控制上半身,控制器处理平衡和行走。适用于人形机器人运动-操作任务的视觉-语言-动作模型后训练,尤其是接受43维人形机器人状态输入的策略。数据集遵循Apache 2.0许可。

This dataset contains 92 episodes of teleoperation demonstrations using the Unitree G1 humanoid robot with Dex3-1 dexterous hands, totaling 198,846 frames, approximately 66 minutes, sampled at 50Hz. The task is for the robot to pick up a plastic bottle from a table, walk to a basket on the ground, and drop it into the basket. The dataset includes the following fields: observation part includes head-mounted camera images (480x640x3, H.264 encoded, 50fps), 43-dimensional joint positions (including joint angles of legs, waist, arms, and hands), 14-dimensional end-effector states (hand positions and quaternions), 4-dimensional base orientation quaternion, 3-dimensional projected gravity vector in base frame; action part includes 64-dimensional motion tokens output by GEAR-SONIC encoder (requires matching decoder for replay), 43-dimensional joint targets from whole-body controller, 7-dimensional right-hand joint commands (grasping hand), 7-dimensional left-hand joint commands (all zeros, left hand not used). The dataset was collected via VR teleoperation on real Unitree G1 hardware, using NVIDIA GEAR-SONIC as the whole-body controller, with the operator directly controlling the upper body and the controller handling balance and walking. It is suitable for post-training of vision-language-action models for humanoid robot locomotion-manipulation tasks, especially policies that accept 43-dimensional humanoid robot state input. The dataset is licensed under Apache 2.0.

提供机构:
MindsAndCompany
创建时间:
2026-09-01
搜集汇总
数据集介绍
G1_Dex3_PickAndPlaceTrash 数据集图片
构建方式
该数据集依托Unitree G1人形机器人平台,在真实物理环境中通过VR遥操作系统采集。操作者借助VR设备直接驱动机器人上半身完成抓取动作,全身平衡与行走则由GEAR-SONIC全身控制器自主维持,从而确保每一帧数据均源自真实硬件而非仿真环境。采集过程覆盖从走向桌面、右手抓取塑料瓶、转身行至地面篮筐上方并释放的完整操作链条,共记录92个回合、198846帧,以50Hz频率同步采集头部RGB视频流与43维关节状态,并以GEAR-SONIC编码器输出64维运动令牌作为全身动作表征,形成多模态时间对齐的示范数据。
特点
数据集聚焦于人形机器人移动操作场景,动作语义明确且物理真实性突出。其核心特征在于多层级动作表征的并存:64维运动令牌提供紧凑的全身控制潜在空间,43维关节目标则保留控制器输出的底层指令,配合双手7维遥操作关节信号,构成从高层意图到底层执行的完整映射链条。观测空间涵盖头部自我中心视觉、43维关节位置、14维双腕位姿、4维基座朝向及3维投影重力,为策略学习提供丰富的本体感知与视觉信息。数据规模适中,但包含少量异常长度回合,为数据清洗与鲁棒性研究保留了真实噪声。
使用方法
该数据集以LeRobot v2.1格式发布,可通过LeRobotDataset接口直接加载,视频采用H.264编码并存储为480x640分辨率、50fps的自我中心视角图像序列。使用者可依据43维关节状态顺序解析腿部、腰部、手臂及手部的具体维度,并利用动作键中的运动令牌或关节目标进行策略训练。需注意64维运动令牌依赖于GEAR-SONIC编码器对应检查点的潜在空间,回放时须配套相应解码器,而43维关节状态为独立关节角度,无此依赖。该数据集主要服务于人形机器人移动操作视觉-语言-动作模型的后训练,亦可适配任何接受43维人形状态的策略框架。
背景与挑战
背景概述
人形机器人的全身移动操作长期受制于真实硬件数据稀缺,灵巧手与双足行走的协同控制更是验证难点。该数据集于2026年发布,依托NVIDIA GEAR-SONIC全身控制器与Isaac GR00T生态构建,采集自Unitree G1人形机器人配Dex3-1灵巧手的真实遥操作演示,涵盖92个片段、198846帧、约66分钟50Hz数据。其核心研究问题在于为视觉-语言-动作模型提供真实硬件上的全身移动操作后训练语料,推动人形机器人在非结构化环境中完成抓取与搬运任务,对具身智能领域的数据规模化与策略泛化具有参考价值。
当前挑战
该数据集所应对的领域问题在于人形机器人全身移动操作中平衡维持、行走定位与灵巧抓取的耦合,要求策略在长时程中协调下肢运动与上肢操作。其构建过程亦面临多重挑战:VR遥操作需在真实硬件上同步全身控制与手部指令,动作令牌依赖特定GEAR-SONIC检查点的隐空间而缺乏跨模型通用性,片段长度分布不均且存在无手部动作的异常片段,头部单目相机缺失深度信息,左臂全程闲置限制了双手协同数据的覆盖,这些因素共同增加了数据清洗与模型训练的复杂度。
常用场景
经典使用场景
在具身智能与机器人学习领域,全身控制与移动操作(loco-manipulation)长期面临高维动作空间与动态平衡难以协同的挑战。该数据集的经典用法在于为视觉-语言-动作模型提供真实人形机器人执行完整任务链的示教数据,即Unitree G1从远处行走至桌旁、以右手抓取塑料瓶、转身搬运并最终投放至地面篮筐。研究者常以行为克隆或后训练方式,将高维关节状态与第一视角视觉流联合建模,从而学习长时序的移动抓取策略。
解决学术问题
该数据集直面人形机器人移动操作中示教数据稀缺、真实硬件轨迹难获取的问题,提供了92条真实遥操作轨迹与198,846帧多模态观测,涵盖关节位置、末端位姿、根部朝向与投影重力等信息。其学术意义在于支撑长时序任务规划、全身协调控制与抓取-行走耦合等研究,并为GEAR-SONIC隐空间动作表示的有效性验证提供实证基础,推动人形机器人从仿真走向真实场景的策略学习。
衍生相关工作
围绕该数据集,相关经典工作主要沿两条脉络展开:其一是NVIDIA GEAR-SONIC全身控制器与GR00T N1.7视觉-语言-动作模型的后训练研究,利用64维motion_token实现全身动作生成;其二是基于LeRobot框架的具身策略复现与基准评测,推动UNITREE_G1_SONIC具身形态下的移动操作算法比较。这些工作共同拓展了人形机器人遥操作数据在策略学习与系统集成中的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务