遇见数据集

260528_white_rack_single_tube_transfer

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

该数据集使用LeRobot框架创建,是一个机器人控制数据集。数据集包含100个任务片段(episodes),总计121,888帧数据,对应单一任务。数据以Parquet文件格式存储,总数据文件大小约100MB,视频文件大小约500MB。数据特征包括:16维的动作向量(action),表示机器人左右机械臂各6个关节位置、左右滑台关节位置以及x方向速度和角速度;16维的状态观测(observation.state),与动作向量具有相同的物理含义;三个摄像头的图像观测(observation.images.cam_high, cam_left_wrist, cam_right_wrist),均为480x640分辨率、3通道的RGB视频,帧率为30fps,使用AV1编码。此外,数据集还包含时间戳(timestamp)、帧索引(frame_index)、片段索引(episode_index)、全局索引(index)和任务索引(task_index)等元数据字段。所有数据均划分为训练集(train split)。该数据集适用于机器人模仿学习、强化学习、视觉运动控制等研究任务。

This is a robotic control dataset developed using the LeRobot framework. It comprises 100 task episodes, with a total of 121,888 frames of data corresponding to a single task. The data is stored in Parquet file format, with the total size of tabular data files being approximately 100 MB, and the video files totaling around 500 MB. The data features include: a 16-dimensional action vector that encodes the joint positions of 6 degrees of freedom for both the left and right robotic manipulators, the joint positions of the left and right sliders, as well as the x-direction linear velocity and angular velocity; a 16-dimensional state observation (observation.state), which shares identical physical semantics with the action vector; image observations from three cameras: observation.images.cam_high, cam_left_wrist, and cam_right_wrist. All are 3-channel RGB videos with a resolution of 480 × 640, a frame rate of 30 fps, and encoded using the AV1 codec. Additionally, the dataset contains metadata fields including timestamp, frame_index, episode_index, global index, and task_index. All data is assigned to the training split. This dataset is applicable to research tasks such as robotic imitation learning, reinforcement learning, and visual-motor control.

创建时间:
2026-05-28
原始信息汇总

数据集概述

数据集名称: 260528_white_rack_single_tube_transfer
数据集链接: https://huggingface.co/datasets/kiroaiseoul/260528_white_rack_single_tube_transfer
许可协议: Apache-2.0
任务类别: 机器人学 (robotics)
标签: LeRobot


数据集结构

  • 数据集版本: v3.0
  • 机器人类型: mobileai_robot
  • 总片段数 (Episodes): 100
  • 总帧数 (Frames): 121,888
  • 总任务数 (Tasks): 1
  • 数据分块大小 (Chunks Size): 1000
  • 数据文件大小: 约 100 MB
  • 视频文件大小: 约 500 MB
  • 帧率 (FPS): 30

数据划分:

  • 训练集: 全部100个片段(索引0至99)

特征与数据类型

特征名称 数据类型 形状 描述
action float32 [16] 机器人动作指令,包含左右各6个关节位置、滑动关节位置、以及线速度和角速度
observation.state float32 [16] 机器人观测状态,与动作特征维度一致,反映当前关节和速度信息
observation.images.cam_high video [480, 640, 3] 顶部视角高清彩色视频,AV1编码,30 FPS
observation.images.cam_left_wrist video [480, 640, 3] 左腕视角彩色视频,AV1编码,30 FPS
observation.images.cam_right_wrist video [480, 640, 3] 右腕视角彩色视频,AV1编码,30 FPS
timestamp float32 [1] 时间戳
frame_index int64 [1] 帧索引
episode_index int64 [1] 片段索引
index int64 [1] 全局索引
task_index int64 [1] 任务索引

数据存储格式

  • 数据文件: Parquet 格式,路径为 data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件: MP4 格式,路径为 videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

备注

  • 数据集创建工具: LeRobot
  • 论文与主页信息: 暂无提供。
搜集汇总
数据集介绍
260528_white_rack_single_tube_transfer 数据集图片
构建方式
在机器人学习与操作领域,高质量的数据集是推动模型泛化能力与鲁棒性的基石。该数据集依托于LeRobot框架构建,记录了移动机械臂在白色机架环境下执行单管转移任务的完整操作流程。数据集由100个示教回合构成,总计121,888帧数据,采样频率为30帧/秒。数据以Parquet格式存储结构化信息,包括16维的关节空间动作与状态观测,以及三个视角的高清视频流,分别来自顶部相机和左右腕部相机。视频采用AV1编码,分辨率为480×640,确保了视觉信息的清晰度与压缩效率。所有回合均被划分为训练集,便于端到端的行为克隆与模仿学习实验。
特点
该数据集的一大特点在于其精细化的多模态信息融合机制。观测空间不仅涵盖了左右臂六个关节的位置以及移动底盘线速度与角速度的完整状态量,还同步提供了高帧率的视觉流,使得模型能够同时理解机械臂的自我状态与环境变化。16维的动作空间与状态空间维度一致,支持从状态到动作的直接映射学习。更重要的是,数据集包含了100个完整回合的轨迹数据,每个回合均配有时间戳、帧索引和回合索引,为时序建模与策略学习提供了精确的时序对齐基础。此外,所有数据均按照统一的元信息结构组织,便于进行大规模数据集扩充与复现研究。
使用方法
使用者可借助LeRobot库便捷地加载与解析该数据集。通过配置默认的config_name,系统将自动定位data目录下的所有Parquet文件与视频文件。典型的使用流程包括:首先,利用LeRobot的dataset加载模块读取meta/info.json中定义的元信息,获取特征结构与索引映射;随后,通过迭代器或采样器获取每一帧的动作、状态与图像数据,用于训练模仿学习或强化学习策略。视频字段以动态解码方式读取,减少内存占用。该数据集可直接用于训练基于视觉的运动策略,例如扩散策略或Transformer架构的决策网络,实现从高维观测到低维动作的鲁棒映射。
背景与挑战
背景概述
在机器人操作领域,模仿学习依赖于高质量的示教数据以完成复杂任务。260528_white_rack_single_tube_transfer数据集由Hugging Face LeRobot团队构建,旨在通过多视角视觉与关节运动数据记录,解决移动双臂机器人在机架间单管转移任务中的模仿学习问题。该数据集创建于2024年前后,包含100个演示回合、超过12万帧视频与运动状态,采用30帧/秒的高采样率,并提供了来自顶部和双手腕的三路高清图像,分别为480×640像素。基于apache-2.0许可协议公开发布,该数据集为移动机器人领域的策略学习与泛化研究提供了标准化基准,促进了基于LeRobot框架的模仿学习算法开发。
当前挑战
该数据集所解决的领域问题在于,移动双臂机器人执行精确操作任务时面临高维状态-动作空间与动态环境感知的双重挑战。构建过程中,挑战主要来自三个方面:首先,需要对齐来自三个摄像头与16维关节速度状态的时空数据,确保动作与观测在30帧/秒下严格同步。其次,机架与管件在真实物理场景中的光照变化与遮挡,对视觉特征提取的鲁棒性提出较高要求。此外,由于机器人基座可移动,增加了左右臂协调操作与运动规划的非线性复杂度,使得数据集的泛化能力成为训练鲁棒策略的核心瓶颈。
常用场景
经典使用场景
在机器人学习领域,260528_white_rack_single_tube_transfer数据集聚焦于单根试管在白色支架间的精确转移操作,为模仿学习和行为克隆提供了标准化基准。该数据集包含100个演示回合,通过双机械臂的16维关节空间动作及三视角高清视频流,完整记录了操作过程中末端执行器的运动轨迹与环境交互动态。研究者可基于此训练策略网络,使机器人从示范中习得抓取、移动和放置的连续控制策略,尤其适用于评估基于视觉运动映射的算法在处理精细物体转移任务时的泛化能力与鲁棒性。
解决学术问题
该数据集系统性地解决了机器人操作研究中专家演示数据稀缺与复现性不足的困境。通过提供统一格式的关节状态、视觉观测与时间戳对齐的多模态数据,它使得学术领域能够深入探索小样本学习下技能迁移的瓶颈,并量化分析观测噪声对策略执行成功率的干扰。其构建的标准化评估框架,有力推动了数据驱动控制方法在非结构化环境中可靠性的提升,为对比不同架构(如扩散策略、Transformer-based模型)在精细操作任务上的效能奠定了坚实基础。
衍生相关工作
基于该数据集,学界已衍生出多项代表性成果,包括利用注意力机制增强环境上下文理解的模仿学习框架,以及通过对比学习解耦动作基元的跨场景策略泛化方法。相关研究还探索了在低数据量条件下,利用扩散模型对动作轨迹进行去噪与平滑生成,显著提升成功率。此外,结合逆强化学习从演示中推断奖励函数,实现了对试管转移任务中隐含的安全约束与效率偏好的自动化建模,进一步催生了人机协作策略优化等新兴研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务