遇见数据集

ETRI_VR_Robotics_data_research

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集由 ETRI 和全南大学的研究人员使用 Apple Vision Pro 遥操作技术收集,旨在训练和评估视觉-语言-动作(VLA)模型(π0.5、GR00T N1.7、RDT-1B),验证语言指令能否实际改变机器人行为。机器人平台为 ROBOTIS AI Worker FFW-BG2,物体涉及 YCB 标准物体集。数据包含 4 个任务(P0-P3),每个任务 100 个 episode,共 400 个 episode。每个任务对应不同的语言指令和物体组合(如“拿起番茄汤罐放在红色盘子上”)。原始数据格式为每个 episode 一个 tar 包,内含 20Hz 的 pickle 文件(记录关节位置、命令、夹爪状态和元数据)以及四个摄像头录制的 MP4 视频(640×480 分辨率,分别为头部左/右、手腕左/右摄像头)。数据还提供了 LeRobot 格式的加工版本(10fps,状态和动作维度均为 8,包含左臂 7 个关节和左夹爪 1 个自由度)。该数据集适用于机器人模仿学习、语言条件行为克隆、多任务学习以及 VLA 模型的训练与评估。

This dataset was collected by researchers from ETRI and Chonnam National University using Apple Vision Pro teleoperation technology, aimed at training and evaluating Vision-Language-Action (VLA) models (π0.5, GR00T N1.7, RDT-1B), and verifying whether language instructions can actually change robot behavior. The robot platform is ROBOTIS AI Worker FFW-BG2, and objects involve the YCB standard object set. The data consists of 4 tasks (P0-P3), each with 100 episodes, totaling 400 episodes. Each task corresponds to different language instructions and object combinations (e.g., "Pick up the tomato soup can and place it on the red plate"). The raw data format is a tar package per episode, containing 20Hz pickle files (recording joint positions, commands, gripper states, and metadata) and MP4 videos from four cameras (640×480 resolution, respectively head left/right, wrist left/right cameras). The data also provides a processed version in LeRobot format (10fps, state and action dimensions both 8, including 7 left arm joints and 1 left gripper degree of freedom). This dataset is suitable for robot imitation learning, language-conditioned behavior cloning, multi-task learning, and training and evaluation of VLA models.

创建时间:
2026-08-13
原始信息汇总

ETRI VR Robotics Data Research 数据集详情

数据集概述

该数据集由韩国电子通信研究院(ETRI)与全南大学合作构建,旨在通过Apple Vision Pro遥操作方式采集ROBOTIS AI Worker FFW-BG2机器人的真实演示数据,并训练三种VLA(视觉-语言-动作)模型(π0.5、GR00T N1.7、RDT-1B),验证"语言能否真正改变机器人行为"这一研究问题。

任务设计

数据集包含4种任务(P0-P3),每个任务使用统一指令字符串进行采集、训练与评估:

  • P0: Pick up the tomato soup can and place it on the red plate.
  • P1: Pick up the tomato soup can and place it in the red bowl.
  • P2: Pick up the Cheez-It box and place it on the red plate.
  • P3: Pick up the Spam can and place it in the red bowl.

物体均选自YCB标准物体集,物理模型公开可用,可在MuJoCo等仿真环境中复现实验。P0/P1物体相同但目标容器不同,形成仅凭语言区分的分支对比组。

数据采集与格式

  • 采集方式: Apple Vision Pro (WebXR手部追踪) → FastAPI → 机械臂桥接 → ros2_control,左臂独立操作,右臂和升降台固定
  • 相机配置: 头部左右ZED Mini + 手腕左右RealSense D405,共4路视频,640×480分辨率
  • 采样频率: 原始20Hz,转换为LeRobot格式10fps(state 8维/action 8维,左臂7维+左夹爪1维)
  • 数据处理: 不包含物体坐标和常系数,仅使用自身关节值,便于模型权重移植;动作为下一帧目标关节值(绝对值)

原始数据(main分支)

文件夹 场景 片段数 采集日期
P0 soup + plate 100 2026-08-03(87)+ 08-04补充(13)
P1 soup + bowl 100 2026-08-11 ~ 12
P2 box + plate 100 2026-08-12 ~ 18
P3 Spam + bowl 100 2026-08-18 ~ 21

每个片段为一个tar文件,包含20Hz的pkl步进数据(关节位置、指令、夹爪、元数据)和4路mp4视频。每个任务文件夹附带episodes.txt(包含列表)和rejected.txt(排除片段及原因)。

分支结构与内容

分支 内容
main 本文档 + 原始演示数据 data/raw/P0~P3(每任务100片段)
pi05 π0.5权重 v8·v9各15种 + 加工LeRobot数据集 + 深度标签 + 训练配方与实机结果文档
groot GR00T N1.7权重 15种 + GR00T格式数据集 + 文档
rdt RDT-1B权重 + 数据集 + 归一化统计与语言嵌入等附属文件
result 实机机器人运行记录(模型实际输入帧 + bridge.log/bringup.log,v6/v7/v8)
all_data 训练服务器/执行PC完整工作目录tar + 服务器规格 + v8前权重 + 前期实机记录

研究设计与主要发现

研究层级: L1(单任务干净场景学习)→ L2(多任务合并学习+多物体场景评估)→ L3(复合提示零样本评估)。仅用L1/L2数据训练,L3复合演示不采集不训练,以检验模型的泛化涌现能力。

训练配置: 每任务恰100个片段,所有训练轮次对齐至epoch 2.4。共15种任务组合(4单任务+6双组合+4三组合+1四组合)× 2种模型,π0.5额外做一轮深度辅助损失(v9)实验。

主要结果:

  • 合并学习能产生语言分支能力,在多物体新场景中仅改变指令即可选择不同目标,目标混淆率从单任务10%降至合并学习的5%(2026-08-19,第66轮)
  • 主要瓶颈在感知层,单个干扰物使单任务模型成功率从80%降至30%
  • 4任务合并模型(p0123)评估中68%的失败为物体选择错误,因训练场景中只有单一目标物体,模型未学会按名称选择物体,需要采集含干扰物的数据作为下一步方案

关联资源

  • GitHub代码仓库: https://github.com/logan0741/ETRI_VR_Robotics_data_research
  • 数据集采用other许可证,任务类别为机器人学,语言为韩语,标签包含LeRobot、模仿学习、视觉-语言-动作、遥操作、Apple Vision Pro等
搜集汇总
数据集介绍
ETRI_VR_Robotics_data_research 数据集图片
构建方式
该数据集基于Apple Vision Pro的WebXR手部追踪技术,通过FastAPI接口与机器人桥接,实现了对ROBOTIS AI Worker FFW-BG2的遥操作数据采集。原始数据以20Hz频率记录关节位置、命令及四路摄像头(双目头部与双目腕部)的视频流,覆盖四个任务(P0-P3),每任务含100个成功演示片段。数据经过去重、筛选后,统一转换为LeRobot格式,以10fps采样,状态与动作均为8维向量(左臂7维加夹爪1维),且仅包含本体关节值,便于跨模型迁移训练。
特点
数据集的核心特色在于其精细的实验设计,旨在探究语言指令对机器人行为的影响。通过构造P0/P1、P2/P3两组物体相同但目标不同的任务对,有效隔离了语言作为唯一决策线索的作用。同时,数据集包含多任务组合(最多四任务合并)及相应的训练配置,并提供了π0.5、GR00T N1.7、RDT-1B三种VLA模型的权重与数据处理细节。此外,数据集还附带真实机器人评估结果,记录了末端执行器的视觉输入与运行日志,为复现与二次分析提供了完整资料。
使用方法
数据集以HuggingFace仓库形式发布,通过git-lfs按分支获取。主分支提供原始遥操作数据(pkl与mp4文件),适合自定义预处理;pi05、groot、rdt分支分别提供了对应模型格式的已处理数据、训练权重及配置文件,可直接用于模型微调或推理。评估结果存于result分支,包含实机测试的详细日志。用户可根据研究目标选择相应分支,结合GitHub仓库中的训练与推理代码,灵活开展模仿学习、VLA模型对比或语言条件行为分析等下游任务。
背景与挑战
背景概述
该数据集由韩国电子通信研究院与全南大学的研究人员于2026年创建,旨在探究视觉-语言-动作(VLA)模型在真实机器人操作中理解语言指令的能力。研究团队利用Apple Vision Pro进行遥操作,收集ROBOTIS AI Worker FFW-BG2机器人在四类任务(如抓取番茄汤罐头放置到红色盘子)上的演示数据,每类任务100个片段。核心研究问题在于验证基于单一任务或合并任务学习的VLA模型能否零样本泛化至复合语言指令(L3级),即语言是否真正驱动机器人行为。该研究通过公开数据、模型权重和详细实验记录,为具身智能领域提供了宝贵的多模态数据集,推动了语言条件化机器人操作的研究进展。
当前挑战
该数据集面临的挑战聚焦两大方面:其一,领域难题在于解决VLA模型对语言指令的鲁棒性,尤其是在多物体场景中区分相似目标的能力。实验显示,模型在干扰物存在时成功率急剧下降(如80%降至30%),且4任务合并模型中68%的失败源于物体选择错误,表明仅靠单一物体学习范式不足以使模型习得基于名称的选择能力。其二,构建挑战涉及数据采集与处理的复杂性:需通过Vision Pro手部追踪、多摄像头同步(4通道640×480分辨率)和20Hz高频采样,并确保遥操作与机器人控制的精确对齐;数据标注依赖人工视觉判断,需维护成功与恢复演示的平衡;最终需统一转换至LeRobot 10fps格式,并确保不同VLA模型(π0.5、GR00T、RDT-1B)之间的兼容性与可复现性。
常用场景
经典使用场景
该数据集为具身智能与视觉-语言-动作(VLA)模型研究提供了珍贵的真实机器人操作数据。其核心场景在于评估语言指令对机器人行为的影响,通过Apple Vision Pro遥操作收集的精细操作数据,涵盖拾取-放置任务,为训练和评测多模态大模型提供了标准化的数据基准。数据集结构清晰,包含原始遥操作流和多种已处理格式(LeRobot、GR00T等),支持从端到端模仿学习到分层决策等不同范式的实验,尤其适合研究跨任务泛化与语言条件控制的交叉领域。
解决学术问题
该数据集直击VLA模型领域两大关键难题:语言条件的行为生成与多任务泛化能力。通过精心设计的实验矩阵(如P0/P1语言分叉对照),解决了传统数据集难以分离语言与视觉干扰的问题,使研究者能独立评估语言引导的有效性。其提出的分层研究范式(L1单任务至L3零样本复合指令)为度量模型的任务组合能力提供了新思路,而公开的失败模式分析(如物体选择错误)则揭示了当前模型的感知瓶颈,推动了感知-动作协同研究的深化。
衍生相关工作
该数据集衍生出多项开创性工作,引领了VR遥操作数据采集与VLA训练的新方向。其导出的模型权重和训练配置(如π0.5的深度辅助损失设计)启发了后续研究探索多模态感知(RGB-D融合)对操作性能的提升。数据集的跨平台兼容性(LeRobot、OpenPI等格式)促进了统一基准的建立,催生了对比不同VLA架构(如π0.5、GR00T、RDT-1B)的系列研究。此外,其公开的仿真可复现物品集(YCB)与实验协议,为模拟到现实的迁移研究提供了数据基石,并推动了语言条件策略的泛化性研究,形成了从数据采集、模型训练到实物评估的完整闭环,深刻影响了该领域的研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务