遇见数据集

ntu-galaxea-xr-mobile-pick-bag

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

OOJU Galaxea R1 Pro Mobile Pick Bag 是一个用于机器人移动操作研究的人类遥操作数据集,专门针对Galaxea R1 Pro移动机械臂的抓取和放置任务(pick-and-place)。数据集通过Meta Quest 3头显以全手跟踪模式录制,包含同步的第一人称透视图像(1280×1280 RGB,约24 FPS)、物理相机姿态、眼睛姿态、手部关节姿态(每只手26个关节)以及验证信号。数据以JSON和JPEG格式存储,每个episode包含时间序列遥操作帧、元数据、相机帧归档(frames.tar)和相机标定信息。当前快照包含70个成功episode,总计853.3秒录制时间,20,447帧,解压后约3.1 GB。数据集适用于模仿学习、轨迹分析、感知研究、遥操作研究等任务,但需注意其仅包含人类演示数据,不包含机器人关节状态或动作,消费者需自行实现重定向或动作转换。该数据集为私有,仅限OOJU组织授权成员和批准的协作者使用。

OOJU Galaxea R1 Pro Mobile Pick Bag is a human teleoperation dataset for robotic mobile manipulation research, specifically for pick-and-place tasks on the Galaxea R1 Pro mobile manipulator. The dataset is recorded using the Meta Quest 3 headset in full-hand tracking mode, containing synchronized first-person perspective images (1280×1280 RGB, ~24 FPS), physical camera poses, eye poses, hand joint poses (26 joints per hand), and verification signals. Data is stored in JSON and JPEG formats, with each episode containing time-series teleoperation frames, metadata, camera frame archive (frames.tar), and camera calibration information. The current snapshot includes 70 successful episodes, totaling 853.3 seconds of recording, 20,447 frames, and approximately 3.1 GB when decompressed. The dataset is suitable for imitation learning, trajectory analysis, perception research, teleoperation research, etc. Note that it only contains human demonstration data, not robot joint states or actions; consumers need to implement retargeting or action conversion themselves. The dataset is private and only accessible to authorized members of the OOJU organization and approved collaborators.

创建时间:
2026-08-18
原始信息汇总

OOJU Galaxea R1 Pro Mobile Pick Bag 数据集详情

数据集概览

该数据集是面向Galaxea R1 Pro移动操作机器人抓取袋子(bag pick-and-place)任务的人类遥操作数据,适用于模仿学习、轨迹分析、感知研究和遥操作研究。数据集目前为私有状态,仅限OOJU组织授权成员及获批合作者访问。

任务信息

属性
任务名称 mobile-pick-bag/(拿起袋子放入接收托盘)
当前片段数 70
成功片段数 70
录制任务时长 853.3秒
XR/相机帧数 20,447
JPEG帧数(archives内) 20,447
帧压缩包数 70
JSON文件数 350
解压后大小 约3.1 GB

录制详情

属性
目标机器人平台 Galaxea R1 Pro移动操作机器人
录制本体 人类
录制模式 双臂遥操作
XR设备 Meta Quest 3
手部关节追踪 每只手26个关节
相机 左侧透视相机(passthrough_left
相机分辨率 1280 × 1280 RGB
请求帧率 24 FPS
实际帧率 23.68–24.10 FPS
采集日期 2026-08-17

数据格式与结构

每个片段以 <task>_<timestamp> 命名(如 mobile-pick-bag_20260817_015042),包含:

  • .json — 时间序列XR遥操作帧(手部关节位姿、眼部位姿、时间戳、验证信号)
  • _metadata.json — 片段与环境元数据(设备、时间、成功状态、质量检查)
  • camera_real/frames.tar — 原始JPEG透视相机帧压缩包
  • camera_real/ — 物理相机位姿、相机标定和视频sidecar元数据

手部关节顺序:每只手26个位姿按手掌/手腕、拇指、食指、中指、无名指、小指的顺序排列,每个位姿包含平移和旋转([x, y, z, qx, qy, qz, qw])。

坐标与单位约定

  • 平移单位为米,时间单位为秒
  • 四元数采用XYZW顺序(标量在最后)
  • XR位姿使用记录器的RUF/Unity左手坐标系、Y轴向上世界坐标系
  • 相机位姿为物理透视相机到世界的变换
  • 相机内参遵循OpenCV针孔模型约定

同步方式

每个JPEG帧与XR帧和物理相机位姿条目一一对应,通过轨迹文件中的 timestamp_seconds 与相机位姿sidecar中的 trajectory_timestamp_seconds 进行对齐。不可使用眼部位姿替代物理相机位姿。

数据质量与局限性

  • 全部70个片段均标记为成功,并通过工作空间、关节限制和遥操作质量检查
  • 视频sidecar标记15帧为 IMG_STATIC
  • 相机畸变未测量,畸变系数存储为零
  • 不含机器人关节观测、机器人动作、音频、深度或力/力矩数据
  • 缺少失败演示,且仅包含单任务、单采集日期、单XR设备、单相机视角、单演示者
  • 透视图像可能包含演示者及采集环境的可识别视觉细节

使用说明

  • 该数据集未转换为LeRobot或其他训练专用格式
  • 数据中不含 *_robot.json 文件,录制本体标识为 human,用户需自行提供重定向或机器人动作转换
  • 数据访问受限制,仅限授权成员与获批合作者,未经许可不得在批准项目外重新分发
搜集汇总
数据集介绍
ntu-galaxea-xr-mobile-pick-bag 数据集图片
构建方式
该数据集源自OOJU组织针对Galaxea R1 Pro移动操作平台开展的一项人机遥操作研究,聚焦于袋装物的抓取与放置任务。数据采集借助Meta Quest 3头显的全手部追踪功能,以双臂遥操作模式记录了70个成功演示片段,涵盖第一视角穿透影像、物理相机位姿、眼动位姿、手部关节位姿及验证信号。每个片段以时间戳命名,包含主轨迹文件、元数据文件以及封装于无压缩TAR归档中的JPEG原始帧,同时附有相机标定与视频辅助信息。原始数据保留JSON与JPEG格式,未转换为特定训练格式,且未记录机器人状态与动作日志,采集本体为人类,需使用者自行进行重定向或动作转换。
特点
该数据集具有高精度与高同步性的显著特点,每帧包含26个手部关节的平移与旋转四元数,采用RUF/Unity左手坐标系及OpenCV针孔相机模型,所有时间戳与相机位姿紧密对齐,确保轨迹与视觉流的一一对应。全部70个片段均通过质量校验,标记为成功,采集时长达853.3秒,包含20,447帧XR与相机图像,数据规模适中。然而,数据集存在一定局限,如单一任务、单一日期、单一设备、单视角、单一人类演示者,且缺乏失败示例、机器人关节观测、深度及力觉信息,相机畸变系数未标定,部分帧被标记为静态,可能影响泛化能力。
使用方法
该数据集适用于模仿学习、轨迹分析、感知研究及遥操作研究。使用者可通过解析JSON轨迹文件获取手部关节位姿及时间戳,从frames.tar中提取JPEG图像,并依据camera_poses.json中的相机位姿进行空间对齐。建议利用`timestamp_seconds`字段同步轨迹与图像流,而非使用眼部姿态。鉴于数据集未包含机器人动作,需部署重定向算法将人类演示转换为机器人可执行指令。数据访问受限于授权组织成员及合作者,使用时须注意隐私保护,不得未经许可再分发。
背景与挑战
背景概述
该数据集由OOJU组织于2026年创建,旨在为Galaxea R1 Pro移动操作机器人研究提供基于人类遥操作的高质量操作数据,聚焦于‘拾取袋子并放置于托盘’这一典型移动操作任务。通过Meta Quest 3头显的全手部追踪技术,数据集同步记录了第一人称透视图像、物理相机位姿、眼部位姿、手部关节位姿及验证信号,为模仿学习、轨迹分析、感知研究和遥操作研究提供了丰富的资源。其独特的XR数据采集方式和针对移动操作任务的专一性,填补了该领域数据集在细粒度手部操作与移动平台结合方面的空白,对于推动具身智能和机器人学习的发展具有重要意义。
当前挑战
该数据集面临多重挑战。在领域层面,移动操作任务本身涉及复杂的感知-运动闭环,要求机器人理解环境并执行精细操作,而数据集中仅包含单一人体演示者、单一视角和有限物理环境,缺乏失败演示与机器人状态日志,限制了模型的泛化能力和从失败中学习的能力。在构建层面,数据同步与校准是核心难题,尽管采用时间戳对齐物理相机与轨迹流,但相机畸变未被测量(畸变系数为零),且存在15帧静态标记,可能影响视觉-运动映射的准确性。此外,数据以原始JSON和JPEG格式存储,未转化为LeRobot等训练特定格式,且不包含机器人动作转换,消费者必须自行提供重定向和动作生成方案,增加了数据使用的技术门槛和工程复杂性。
常用场景
经典使用场景
作为面向移动操作机器人的遥操作与模仿学习数据集,OOJU Galaxea R1 Pro Mobile Pick Bag 的经典使用场景聚焦于双臂拾取与放置任务的轨迹学习。借助Meta Quest 3头显捕获的全手部关节姿态、第一人称透视图像及物理相机位姿,研究者能够构建端到端的模仿学习流水线,训练策略网络从人类演示中提取操作意图与动作序列。该数据集特别适合验证视觉-运动控制领域的算法,例如基于Transformer的动作生成或隐式行为克隆,并可灵活适配不同机器人平台的重定向需求。
解决学术问题
该数据集直面移动操作研究中数据稀缺与多模态对齐两大核心难题。其高精度时间戳同步的XR帧和相机图像,为处理视觉感知与控制信号间的跨模态对应提供了基准,支撑了视觉伺服、眼手协调及位姿估计等学术问题的探索。通过提供纯人类演示数据而不含机器人状态,数据集鼓励研究通用运动重定向方法,推动从人类动作到机器人执行的可迁移策略研究,从而加速具身智能泛化能力的理论突破。
衍生相关工作
由该数据集衍生的经典工作涵盖多个前沿方向。基于其手部关节序列,研究者已发展出融合视觉与运动学的双向Transformer模型,用于学习可泛化的操作策略。该数据还催生了关于无姿态重定向方法的研究,比较不同逆运动学求解器在人类到机器人映射中的表现。同时,它作为多模态时间序列对齐的基准,被引用于开发新的同步质量评估指标,并启发了针对低延迟遥操作系统的端到端延迟补偿框架,这些工作均在此数据的公开特性上构建了深入分析的基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务