ETRI_VR_Robotics_data_research
收藏资源简介:
该数据集由 ETRI 和全南大学的研究人员使用 Apple Vision Pro 遥操作技术收集,旨在训练和评估视觉-语言-动作(VLA)模型(π0.5、GR00T N1.7、RDT-1B),验证语言指令能否实际改变机器人行为。机器人平台为 ROBOTIS AI Worker FFW-BG2,物体涉及 YCB 标准物体集。数据包含 4 个任务(P0-P3),每个任务 100 个 episode,共 400 个 episode。每个任务对应不同的语言指令和物体组合(如“拿起番茄汤罐放在红色盘子上”)。原始数据格式为每个 episode 一个 tar 包,内含 20Hz 的 pickle 文件(记录关节位置、命令、夹爪状态和元数据)以及四个摄像头录制的 MP4 视频(640×480 分辨率,分别为头部左/右、手腕左/右摄像头)。数据还提供了 LeRobot 格式的加工版本(10fps,状态和动作维度均为 8,包含左臂 7 个关节和左夹爪 1 个自由度)。该数据集适用于机器人模仿学习、语言条件行为克隆、多任务学习以及 VLA 模型的训练与评估。
This dataset was collected by researchers from ETRI and Chonnam National University using Apple Vision Pro teleoperation technology, aimed at training and evaluating Vision-Language-Action (VLA) models (π0.5, GR00T N1.7, RDT-1B), and verifying whether language instructions can actually change robot behavior. The robot platform is ROBOTIS AI Worker FFW-BG2, and objects involve the YCB standard object set. The data consists of 4 tasks (P0-P3), each with 100 episodes, totaling 400 episodes. Each task corresponds to different language instructions and object combinations (e.g., "Pick up the tomato soup can and place it on the red plate"). The raw data format is a tar package per episode, containing 20Hz pickle files (recording joint positions, commands, gripper states, and metadata) and MP4 videos from four cameras (640×480 resolution, respectively head left/right, wrist left/right cameras). The data also provides a processed version in LeRobot format (10fps, state and action dimensions both 8, including 7 left arm joints and 1 left gripper degree of freedom). This dataset is suitable for robot imitation learning, language-conditioned behavior cloning, multi-task learning, and training and evaluation of VLA models.
ETRI VR Robotics Data Research 数据集详情
数据集概述
该数据集由韩国电子通信研究院(ETRI)与全南大学合作构建,旨在通过Apple Vision Pro遥操作方式采集ROBOTIS AI Worker FFW-BG2机器人的真实演示数据,并训练三种VLA(视觉-语言-动作)模型(π0.5、GR00T N1.7、RDT-1B),验证"语言能否真正改变机器人行为"这一研究问题。
任务设计
数据集包含4种任务(P0-P3),每个任务使用统一指令字符串进行采集、训练与评估:
- P0: Pick up the tomato soup can and place it on the red plate.
- P1: Pick up the tomato soup can and place it in the red bowl.
- P2: Pick up the Cheez-It box and place it on the red plate.
- P3: Pick up the Spam can and place it in the red bowl.
物体均选自YCB标准物体集,物理模型公开可用,可在MuJoCo等仿真环境中复现实验。P0/P1物体相同但目标容器不同,形成仅凭语言区分的分支对比组。
数据采集与格式
- 采集方式: Apple Vision Pro (WebXR手部追踪) → FastAPI → 机械臂桥接 → ros2_control,左臂独立操作,右臂和升降台固定
- 相机配置: 头部左右ZED Mini + 手腕左右RealSense D405,共4路视频,640×480分辨率
- 采样频率: 原始20Hz,转换为LeRobot格式10fps(state 8维/action 8维,左臂7维+左夹爪1维)
- 数据处理: 不包含物体坐标和常系数,仅使用自身关节值,便于模型权重移植;动作为下一帧目标关节值(绝对值)
原始数据(main分支)
| 文件夹 | 场景 | 片段数 | 采集日期 |
|---|---|---|---|
| P0 | soup + plate | 100 | 2026-08-03(87)+ 08-04补充(13) |
| P1 | soup + bowl | 100 | 2026-08-11 ~ 12 |
| P2 | box + plate | 100 | 2026-08-12 ~ 18 |
| P3 | Spam + bowl | 100 | 2026-08-18 ~ 21 |
每个片段为一个tar文件,包含20Hz的pkl步进数据(关节位置、指令、夹爪、元数据)和4路mp4视频。每个任务文件夹附带episodes.txt(包含列表)和rejected.txt(排除片段及原因)。
分支结构与内容
| 分支 | 内容 |
|---|---|
| main | 本文档 + 原始演示数据 data/raw/P0~P3(每任务100片段) |
| pi05 | π0.5权重 v8·v9各15种 + 加工LeRobot数据集 + 深度标签 + 训练配方与实机结果文档 |
| groot | GR00T N1.7权重 15种 + GR00T格式数据集 + 文档 |
| rdt | RDT-1B权重 + 数据集 + 归一化统计与语言嵌入等附属文件 |
| result | 实机机器人运行记录(模型实际输入帧 + bridge.log/bringup.log,v6/v7/v8) |
| all_data | 训练服务器/执行PC完整工作目录tar + 服务器规格 + v8前权重 + 前期实机记录 |
研究设计与主要发现
研究层级: L1(单任务干净场景学习)→ L2(多任务合并学习+多物体场景评估)→ L3(复合提示零样本评估)。仅用L1/L2数据训练,L3复合演示不采集不训练,以检验模型的泛化涌现能力。
训练配置: 每任务恰100个片段,所有训练轮次对齐至epoch 2.4。共15种任务组合(4单任务+6双组合+4三组合+1四组合)× 2种模型,π0.5额外做一轮深度辅助损失(v9)实验。
主要结果:
- 合并学习能产生语言分支能力,在多物体新场景中仅改变指令即可选择不同目标,目标混淆率从单任务10%降至合并学习的5%(2026-08-19,第66轮)
- 主要瓶颈在感知层,单个干扰物使单任务模型成功率从80%降至30%
- 4任务合并模型(p0123)评估中68%的失败为物体选择错误,因训练场景中只有单一目标物体,模型未学会按名称选择物体,需要采集含干扰物的数据作为下一步方案
关联资源
- GitHub代码仓库: https://github.com/logan0741/ETRI_VR_Robotics_data_research
- 数据集采用other许可证,任务类别为机器人学,语言为韩语,标签包含LeRobot、模仿学习、视觉-语言-动作、遥操作、Apple Vision Pro等




