遇见数据集

robotwin_3d

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

RoboTwin 2.0 3D 数据集是一个用于双臂机器人操作的大规模仿真数据集,由 RoboTwin 2.0 模拟器生成,并以 LeRobot v2.1 格式存储。数据集包含 50 种不同的操作任务,总计 27,500 个 episode(每个任务 550 个连续 episode),共 6,183,813 帧图像数据。机器人采用 ALOHA 风格的双臂设计,具有 14 个自由度(左臂和右臂各 7 个自由度,其中前 6 个为关节位置,第 7 个为夹爪开合度,归一化到 [0,1])。控制频率为 50 Hz。数据集包含三个相机视角(cam_high、cam_left_wrist、cam_right_wrist),每个相机提供 RGB 图像(分辨率 240×320)和逐像素的毫米级深度图(uint16 格式,真实深度值,除以 1000 转换为米)。深度图有两种存储方式:FFV1 编码的 16-bit 灰度 MKV 文件,以及 x264rgb 无损编码的 MP4 文件(将 16 位深度打包到 R 和 G 通道中)。所有相机共享相同的针孔内参(fx=358.64, fy=358.64, cx=160.0, cy=120.0,基于 320×240 网格)。数据集还包含丰富的语言指令,每 episode 有 100 条指令,总计约 1,039,891 条独特指令。数据总大小约 275 GB,其中深度数据约占 229 GB。该数据集适用于机器人操作任务的模仿学习、多模态感知、语言条件策略等研究。

The RoboTwin 2.0 3D dataset is a large-scale simulated dataset for dual-arm robot manipulation, generated by the RoboTwin 2.0 simulator and stored in the LeRobot v2.1 format. It contains 50 different manipulation tasks, totaling 27,500 episodes (550 consecutive episodes per task), with 6,183,813 frames of image data. The robot adopts an ALOHA-style dual-arm design with 14 degrees of freedom (7 DOF per arm: the first 6 are joint positions, and the 7th is the gripper opening normalized to [0,1]). The control frequency is 50 Hz. The dataset includes three camera views (cam_high, cam_left_wrist, cam_right_wrist), each providing RGB images (resolution 240×320) and per-pixel millimeter-level depth maps (uint16 format, real depth values, divided by 1000 to convert to meters). Depth maps are stored in two ways: FFV1-encoded 16-bit grayscale MKV files, and x264rgb lossless-encoded MP4 files (packing 16-bit depth into R and G channels). All cameras share the same pinhole intrinsics (fx=358.64, fy=358.64, cx=160.0, cy=120.0, based on a 320×240 grid). The dataset also contains rich language instructions, with 100 instructions per episode, totaling approximately 1,039,891 unique instructions. The total data size is about 275 GB, with depth data accounting for approximately 229 GB. This dataset is suitable for research on imitation learning, multimodal perception, and language-conditioned policies for robot manipulation tasks.

创建时间:
2026-08-19
原始信息汇总

RoboTwin 2.0 — 3D 数据集概述

基本信息

属性 详情
数据集名称 RoboTwin 2.0 — 3D (RGB + Depth)
任务类别 机器人操作(Robotics Manipulation)
任务数量 50 个
片段数(Episodes) 27,500 个(每个任务 550 个,连续排列)
总帧数 6,183,813
数据大小 约 275 GB(其中深度数据约 229 GB)
数据规模 1M < N < 10M 条记录

硬件与传感器配置

  • 机器人类型:ALOHA 风格双臂机器人(14 自由度)
  • 控制频率:50 Hz
  • 相机数量:3 个(cam_highcam_left_wristcam_right_wrist
  • 图像分辨率:240 × 320
  • 深度格式:uint16 毫米(除以 1000 转换为米)

数据格式(LeRobot v2.1)

目录结构

  • data/:状态、动作及索引列(Parquet 格式,分块存储)
  • videos/:RGB 视频(AV1 编码)与深度视频(两种无损编码)
  • meta/:元数据文件(info.json、episodes.jsonl、tasks.jsonl、camera_intrinsics.json 等)
  • task_episode_map.json:任务名称到片段范围的映射
  • dataset_stats.json:全数据集状态/动作归一化统计

状态与动作

  • 维度:14 维(左臂 7 维 + 右臂 7 维)
  • 每半臂中:索引 0-5 为关节,索引 6 为夹爪(归一化到 [0, 1])

深度数据说明

  • 单位:uint16 毫米,无需缩放或偏移,除以 1000 转为米
  • 双存储:同一深度数组以两种编码各存一份(已验证逐位相同)
    • observation.depth_ffv1.{cam}:MKV 容器,FFV1 编码(gray16le),可直接读取为 uint16
    • observation.depth_x264rgb.{cam}:MP4 容器,libx264rgb 无损编码,需按 (R << 8) | G 解包(注意 cv2 返回 BGR 需交换通道)
  • 无效像素0 表示无返回值(非 0 毫米),应视为无效;背景深度最高可达约 9,750 mm
  • 解码注意:PyAV 和 ffmpeg 可直接输出 16 位深度;decord 和默认 cv2 会返回 8 位数组,需特殊设置

相机内参

三个相机共享相同的针孔内参(基于 320 × 240 网格定义):

fx = fy = 358.6421813964844 cx = 160.0 cy = 120.0

深度图与内参位于同一网格,反投影无需缩放;分辨率调整时遵循端点约定 (target - 1) / (source - 1)

语言指令

  • 每个片段包含 100 条语言指令(非全部唯一,去重后 42 至 100 条)
  • 语料库共有 1,039,891 条唯一指令字符串
  • 元数据中 episodes.jsonl 按片段列出指令列表

数据下载

支持通过 allow_patterns 进行子集下载:

  • 仅元数据(~450 MB):用于任务和统计检查
  • RGB + 状态/动作(~46 GB):不含深度
  • 单个任务(如 adjust_bottle 对应片段 0-549):按 chunk 分片

片段 N 位于 chunk-{N // 1000:03d} 中。

LeRobot 兼容性

  • 6 个深度流在 info.json 中声明为 dtype: "depth_video",标准 LeRobot 会忽略它们(仅加载 3 个 RGB 相机)
  • 这是刻意设计:单一 video_path 模板无法同时表达 .mp4.mkv 扩展名
  • 深度特征的 info 块中包含 depth_extdepth_packing 字段,供直接解码使用

引用信息

数据由 RoboTwin 2.0 模拟器生成,引用请参考 RoboTwin 论文(arXiv:2506.18088)。

搜集汇总
数据集介绍
robotwin_3d 数据集图片
构建方式
该数据集源自RoboTwin 2.0模拟器,专为双臂机器人操作任务设计,以LeRobot v2.1格式存储。数据包含50个任务,每个任务550个连续片段,共计27,500个片段、618万帧,覆盖14自由度ALOHA式双臂机器人、50Hz控制频率及3个视角(高位、左右腕部)的RGB和深度图像。深度图为毫米级uint16格式,另以FFV1无损编码和x264rgb两种形式存储,以确保解码灵活性与数据保真度。语言指令丰富,每片段含100条描述,全语料库共1,039,891条。数据按分块组织,便于选择性下载。
特点
数据集的显著特色在于其高保真深度信息与双格式存储策略:深度以毫米级uint16表示,且两种编码(FFV1和x264rgb)位级完全一致,适用于不同解码环境。深度图包含无效像素(零值)标记,背景可达9.75米,需正确识别。相机内参统一且与深度图原生分辨率匹配,可直接进行三维反投影。语言指令多样性高,但存在重复条目,需根据任务需求筛选。此外,每任务连续片段块便于任务级提取,总量275GB,但支持按需下载元数据或单任务子集。
使用方法
使用该数据集时,推荐通过HuggingFace的snapshot_download按需获取元数据、RGB数据或深度数据。加载深度图时,FFV1文件需用PyAV或ffmpeg指定16位输出,而x264rgb文件则通过解包RGB通道重建深度值。相机内参可直接用于将深度图转换为三维点云。用户可依据task_episode_map.json定位特定任务对应的片段范围,并利用episodes.jsonl获取每条片段的语言指令列表。LeRobot框架当前忽略深度流,若需使用深度,需自行解码。数据集提供详细的统计文件,便于标准化处理。
背景与挑战
背景概述
RoboTwin 2.0 — 3D (RGB + Depth) 数据集由 RoboTwin 平台团队于 2025 年构建,依托 RoboTwin 2.0 模拟器生成,旨在为双臂机器人操作研究提供大规模、高保真的视觉与状态数据。该数据集涵盖 50 项任务、27,500 个回合及超过 600 万帧数据,并针对 ALOHA 风格 14 自由度双臂机器人,以 50 Hz 控制频率记录同步的 RGB 图像、毫米级深度图、状态与动作序列,同时附有丰富的自然语言指令(逾百万条)。其核心研究问题聚焦于利用仿真数据训练鲁棒的具身智能策略,并实现到真实世界的迁移。该数据集在 LeRobot v2.1 格式下整合多模态感知与语言信息,为双臂操作、视觉语言模型及深度估计等领域提供了高价值基准,对推动机器人学习的研究进展具有显著影响力。
当前挑战
该数据集所面临的挑战涵盖领域与构建两个层面。在领域层面,双臂操作任务本身对空间感知、协同控制及语言-动作对齐提出极高要求;尽管数据集提供了毫米级真实深度,但实际场景中深度传感器的噪声、遮挡及无效像素(如零值)成为策略鲁棒性的潜在障碍,同时多任务指令的多样性与歧义性(每回合 100 条指令中部分重复)亦加剧了模型理解与决策的难度。在构建层面,数据规模庞大(约 275 GB,含 27.5 万文件),深度数据因无损编码(FFV1 与 x264rgb)导致存储占用过高,且解码流程需特定处理(如避免 8 位截断,处理 BGR 通道顺序),压缩效率与通用性之间存在权衡。此外,三维视觉数据的手动标注成本极高,尽管利用仿真自动生成,但确保深度图与 RGB 图像同步、多相机视角一致性及语言指令的语义覆盖,仍构成数据集创建过程中的关键技术挑战。
常用场景
经典使用场景
RoboTwin 2.0 3D 数据集专注于双机械臂灵巧操作任务,为机器人学习领域提供了大规模、高精度的仿真训练数据。其经典使用场景在于训练和评估多模态感知驱动的操作策略,尤其是视觉-语言-动作模型。数据集包含50个精细设计的任务,涵盖抓取、放置、堆叠、开合等日常操作,每个任务拥有550个连续回合,共计27,500个示范,为模仿学习提供充足样本。此外,其内置的LeRobot v2.1格式和深度相机数据,使得研究者能够便捷地利用RGB-D信息,探索视觉感知与动作生成的融合机制,推动机器人操作技能的泛化与迁移。
衍生相关工作
该数据集衍生了一系列前沿研究工作。一方面,基于其大规模演示数据,研究者开发了鲁棒的模仿学习算法,如扩散策略和基于Transformer的操作模型,显著提升了策略的泛化能力。另一方面,利用深度信息,许多工作探索了三维感知驱动的操作框架,如构建点云或体素表示用于动作规划。此外,语言指令的多样性催生了视觉-语言模型在机器人操作中的深度应用,推动了任务级语义理解与动作生成的统一。该数据集还可作为基准,评估不同算法在双机械臂协同任务上的性能,促进领域内的公平比较与持续创新。
数据集最近研究
最新研究方向
该数据集聚焦于双臂机器人操作领域,通过提供大规模、高保真的仿真数据(包含RGB与深度信息),推动具身智能体在复杂操作任务中的泛化能力研究。其核心前沿方向包括:利用多模态感知(视觉与深度)融合提升操作策略的鲁棒性,结合语言指令实现零样本任务迁移,以及探索基于仿真到现实(sim-to-real)迁移的端到端学习范式。数据集的50个任务覆盖了抓取、放置、堆叠、工具使用等典型操作,其高频率控制(50Hz)与14维动作空间设计为学习精细操作技能提供了坚实基础。该数据集的发布意义在于为机器人学习社区提供了标准化、可复现的基准,促进了大模型驱动的操作策略开发,并推动了模仿学习与强化学习在真实机器人上的部署验证,是通往通用操作智能的关键数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务