遇见数据集

RoboFactory-5Task-RGBD-Decentralized

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

RoboFactory Five-Task Decentralized Wrist RGB-D 是一个面向多机器人去中心化模仿学习的公共研究语料库,用于可复现的 Stereo-CoRE 共享策略实验。该数据集包含 500 次成功同步演示,分布在五个任务中:LiftBarrier(2 个机器人)、CameraAlignment(3 个机器人)、ThreeRobotsStackCube(3 个机器人)、LongPipelineDelivery(4 个机器人)和 TakePhoto(4 个机器人),每个任务各 100 次演示。每个策略流仅包含一个 panda_hand 手腕 RGB-D 观测和对应机器人的关节位置(qpos)。RGB 图像分辨率为 640×480,深度图以毫米为单位存储原生度量深度。策略输入不包含任务 ID、智能体 ID、全局/右相机图像、语言或通信信息。数据以 HDF5 格式存储,其中 action 包含 T 条记录,而 RGB/depth/qpos 包含 T+1 条记录,最后一条观测为动作后的状态。所有方法使用相同的语料库、留出集划分、动作块大小为 100、ACT 后验编码器 4 层、策略解码器 7 层。Stereo-CoRE 运行采用分层加权项目采样:任务、演示、本地臂和时间索引等概率采样,且采样标签不提供给策略。

RoboFactory Five-Task Decentralized Wrist RGB-D is a public research corpus for multi-robot decentralized imitation learning, used for reproducible Stereo-CoRE shared policy experiments. The dataset contains 500 successful synchronized demonstrations distributed across five tasks: LiftBarrier (2 robots), CameraAlignment (3 robots), ThreeRobotsStackCube (3 robots), LongPipelineDelivery (4 robots), and TakePhoto (4 robots), with 100 demonstrations per task. Each policy stream includes only a panda_hand wrist RGB-D observation and the corresponding robots joint positions (qpos). RGB images have a resolution of 640×480, and depth maps store native metric depth in millimeters. Policy inputs exclude task IDs, agent IDs, global/right camera images, language, or communication information. Data is stored in HDF5 format, where action contains T records, and RGB/depth/qpos contain T+1 records, with the last observation being the state after the action. All methods use the same corpus, held-out set split, action chunk size of 100, ACT posterior encoder with 4 layers, and policy decoder with 7 layers. Stereo-CoRE runs adopt hierarchical weighted item sampling: equal-probability sampling of tasks, demonstrations, local arms, and time indices, with sampling labels not provided to the policy.

创建时间:
2026-07-28
原始信息汇总

数据集概述

RoboFactory Five-Task Decentralized Wrist RGB-D 是一个用于多机器人模仿学习研究的公开数据集,专注于分散式控制(Decentralized Control) 场景下基于腕部RGB-D观测的共享策略实验。

数据规模与任务构成

  • 共包含 500 条成功同步演示,涉及 5 个任务,每个任务包含 100 条演示:
    • LiftBarrier(2 台机器人)
    • CameraAlignment(3 台机器人)
    • ThreeRobotsStackCube(3 台机器人)
    • LongPipelineDelivery(4 台机器人)
    • TakePhoto(4 台机器人)

观测与输入设计

  • 每条策略流(policy stream)仅包含单个机器人的 panda_hand 腕部 RGB-D 观测及其 关节位置(qpos)
  • RGB 图像分辨率为 640×480;深度图为原生公制深度,单位为毫米(mm)
  • 策略输入不包含:任务ID、智能体ID、全局/右侧相机图像、语言指令或机器人间通信信息。

数据格式约定

  • 采用 HDF5 格式存储。
  • 动作(action) 包含 T 条记录,而 RGB/深度/qpos 包含 T+1 条记录,其中最后一条观测为动作执行后的状态。

训练协议

  • 所有方法使用同一数据集、留出式回合划分、动作块长度 100
  • 策略解码器使用 7 层,ACT 后验编码器使用 4 层
  • 主要实验(Stereo-CoRE)采用分层加权采样:任务、演示、本地机械臂和时间索引的采样概率相等;采样标签不提供给策略。

配套资源

  • 代码与协议:https://github.com/YananZHOU5555/Stereo-CoRE
  • 权重、配置与原始结果:https://huggingface.co/B111ue/Stereo-CoRE

注意:数据集仓库包含 corpus_manifest.json 及各任务审计/清单文件,用户需自行遵守 RoboFactory 和模拟器资产的许可协议。


此总结基于 HuggingFace 数据集页面提供的 README 内容。

二维码
社区交流群
二维码
科研交流群
商业服务