遇见数据集

1cube-to-1basket

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,使用LeRobot框架创建,专门用于机器人模仿学习与控制任务。数据采集自名为blueberry_ros的双臂移动机器人,执行单一任务(推测为物体操作任务)。数据集规模为80个完整任务回合,共计34,857帧数据,帧率为15 FPS。数据集采用多模态形式,包含机器人的动作指令、本体状态观测以及多视角视觉观测。具体而言,动作数据是一个26维的浮点向量,编码了左右机械臂的末端执行器线速度、角速度,左右手各手指的关节位置,以及移动底盘的操纵杆指令。状态观测是一个55维的浮点向量,包含了左右机械臂(各7个关节)和左右手(各5个手指关节)的位置与力矩反馈,以及操作员的视线坐标和有效性标志。视觉观测部分提供了四个同步的视频流:左眼相机、右眼相机、用户视角相机和用户视线相机,每个视频的分辨率均为640x480(宽x高),RGB三通道,以AV1编码的MP4格式存储。此外,数据还包含时间戳、帧索引、回合索引等元数据。所有非视频数据以Parquet文件格式存储,并按每1000帧一个块进行组织。数据集仅提供训练集划分。该数据集适用于训练端到端的视觉-动作策略、行为克隆模型或进行机器人技能学习研究。

This dataset is a robotics dataset created using the LeRobot framework, specifically designed for robot imitation learning and control tasks. Data is collected from a dual-arm mobile robot named blueberry_ros, performing a single task (presumably an object manipulation task). The dataset consists of 80 complete task episodes, totaling 34,857 frames at a frame rate of 15 FPS. It is multimodal, containing robot action commands, proprioceptive state observations, and multi-view visual observations. Specifically, the action data is a 26-dimensional floating-point vector encoding linear and angular velocities of the end-effectors for both arms, joint positions for each finger of both hands, and joystick commands for the mobile base. The state observation is a 55-dimensional floating-point vector including position and torque feedback for both arms (7 joints each) and both hands (5 finger joints each), as well as the operators gaze coordinates and validity flags. The visual observation part provides four synchronized video streams: left eye camera, right eye camera, user perspective camera, and user gaze camera, each with a resolution of 640x480 (width x height), RGB three channels, stored in MP4 format with AV1 encoding. Additionally, the data includes metadata such as timestamps, frame indices, and episode indices. All non-video data is stored in Parquet file format, organized into chunks of 1000 frames each. The dataset only provides a training set split. It is suitable for training end-to-end vision-action policies, behavior cloning models, or conducting research on robot skill learning.

创建时间:
2026-06-22
原始信息汇总

数据集概述:1cube-to-1basket

该数据集是一个面向机器人操作任务的仿真数据集,基于 LeRobot 框架创建,旨在支持机器人操控学习研究。

  • 许可证:Apache-2.0
  • 任务类别:机器人学
  • 机器人类型:blueberry_ros

数据集规模与结构

  • 总序列数:80
  • 总帧数:34,857
  • 总任务数:1
  • 帧率:15 FPS
  • 数据分块大小:1,000 帧/块
  • 数据文件大小:约 100 MB
  • 视频文件大小:约 200 MB
  • 数据划分:所有 80 个序列均用于训练(train: 0:80

数据格式与路径

  • 数据文件路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

特征维度

每个时间步包含以下特征:

特征名称 数据类型 维度 说明
action float32 (26,) 包含左右手臂线性/角速度、手部关节位置、基座移动控制量
observation.state float32 (55,) 包含左右手臂关节位置与力矩、手部关节位置与力矩、注视点坐标
observation.images.left 视频 (480, 640, 3) 左侧摄像头图像(AV1 编码,15 FPS)
observation.images.right 视频 (480, 640, 3) 右侧摄像头图像(AV1 编码,15 FPS)
observation.images.user 视频 (480, 640, 3) 用户视角图像(AV1 编码,15 FPS)
observation.images.user_gaze 视频 (480, 640, 3) 用户注视点图像(AV1 编码,15 FPS)
timestamp float32 (1,) 时间戳
frame_index int64 (1,) 帧序号
episode_index int64 (1,) 所属序列序号
index int64 (1,) 全局索引
task_index int64 (1,) 任务索引

动作空间

动作向量共 26 维,具体如下:

  • 左臂线性速度 (x, y, z) + 角速度 (x, y, z)
  • 左手五指关节位置 (pinky, ring, middle, index, thumb1, thumb2)
  • 右臂线性速度 (x, y, z) + 角速度 (x, y, z)
  • 右手五指关节位置 (pinky, ring, middle, index, thumb1, thumb2)
  • 基座移动控制 (x, y)

观测状态空间

观测状态向量共 55 维,包括:

  • 左臂 7 个关节位置 + 左手 6 个关节位置
  • 右臂 7 个关节位置 + 右手 6 个关节位置
  • 左臂 7 个关节力矩 + 左手 6 个关节力矩
  • 右臂 7 个关节力矩 + 右手 6 个关节力矩
  • 注视点坐标 (x, y, valid)

可视化工具

可通过 Hugging Face Space 在线浏览该数据集。

搜集汇总
数据集介绍
1cube-to-1basket 数据集图片
构建方式
本数据集旨在为机器人操作任务提供高质量的示教数据,聚焦于将单个立方体放入单个篮筐这一精细操作。数据集利用LeRobot框架进行采集,依托于blueberry_ros机器平台,通过遥操作方式记录人类操作员的演示过程。总计包含80个操作片段(episodes),共计34,857帧数据,存储为100MB的Parquet格式文件与200MB的视频文件。数据以15帧/秒的采样频率捕获,涵盖了机械臂关节位置、力矩、末端执行器动作以及移动底盘控制指令等55维状态空间与26维动作空间。
特点
该数据集的显著特征在于其多模态感知与高维度控制能力的融合。它不仅收录了来自左右手及用户视角的四路高分辨率视觉影像(640×480像素),还创新性地引入了用户视线追踪数据(user_gaze),为理解操作意图提供了独特视角。状态空间详尽记录了双臂各关节的位置与力矩,以及手部精细动作,反映了对类人灵巧操作的追求。数据集结构遵循LeRobot规范,采用分块存储策略,便于高效加载与索引。所有80个片段均作为训练集使用,聚焦单一任务,保证了数据的内在一致性。
使用方法
研究人员可借助LeRobot库便利地使用此数据集。通过标准的datasets库接口加载,能够直接访问统一格式的观测与动作序列,适用于训练模仿学习或强化学习模型。使用时需注意数据包含的深厚特征信息,可依据需求提取特定关节状态或视觉流。视频采用AV1编码,适合长时间序列存储。数据集已预设为全部用于训练,用户可根据实验设计自行划分验证或测试子集,进行机器人操作技能的迁移学习或行为克隆研究。
背景与挑战
背景概述
在机器人学习领域,模仿学习与遥操作数据集的构建对于推动具身智能的发展至关重要。由fecasado团队基于LeRobot框架创建的1cube-to-1basket数据集,专为双机械臂协作搬运任务设计,通过蓝莓机器人平台(blueberry_ros)采集了80个演示片段,涵盖34,857帧的多模态数据,包括左右臂关节角度、力矩、手部精细运动指令、基座控制信号以及多视角视频与眼动追踪信息。该数据集聚焦于“将单个立方体放入篮子”这一基础但关键的操控任务,为研究双臂协调、视觉引导抓取与灵巧操作提供了标准化的训练与评估基准,其高维动作空间(26维)与丰富的状态观测(55维)有效促进了从感知到动作的端到端策略学习,对服务机器人、工业自动化等领域的实际操作能力提升具有重要推动作用。
当前挑战
该数据集所解决的领域核心挑战在于双臂机器人在非结构化环境下的精细操作泛化问题,即如何将有限的演示数据转化为鲁棒、可迁移的策略模型,以应对物体位置、光照、摩擦力等变量变化。构建过程中面临多重技术困难:双机械臂与多指手部的高度自由度(26维动作空间)导致状态-动作映射复杂,仅80个演示片段难以覆盖全部场景;多传感器同步与校准(视觉、关节、力矩、眼动)要求高精度时间对齐,而实际录制时噪声与延迟不可避免;此外,遥操作的数据采集本身依赖熟练操作员的持续稳定示范,人力成本高昂且一致性难保证。数据集虽采用了LeRobot的标准格式与AV1视频压缩,但在扩展至新任务或技能迁移时,仍需克服数据规模不足与领域漂移的瓶颈。
常用场景
经典使用场景
在机器人操作与学习领域,针对精细抓取与放置任务的模仿学习一直是研究热点。1cube-to-1basket数据集精心采集了将单个立方体从指定位置移动至收纳篮中的完整操作轨迹,涵盖80个示范回合与近3.5万帧高保真数据。经典使用场景包括训练基于行为克隆或隐式策略的机器人,使其能够从多视角视觉输入(如左右手相机、用户视角及眼动追踪画面)中自主学习动作序列,并在机械臂与灵巧手的协同控制下复现精准的抓取-转移-释放过程。该数据集特别适用于验证策略模型在受限空间内对刚性物体操作的泛化能力与鲁棒性。
衍生相关工作
自该数据集发布以来,它已催生了一系列旨在提升机器人操作性能的衍生工作。在模型架构层面,研究者基于其多视角视觉输入设计出融合空间注意力机制的策略网络,以实现对抓取区域更鲁棒的视觉特征提取。在算法层面,该数据集被用于比较行为克隆与扩散策略在密集接触任务中的表现差异,推动了集成了力反馈信号的模仿学习框架的出现。此外,围绕该数据集的眼动追踪信息(user_gaze视角),衍生了探索人类注视先验如何引导机器人动作决策的工作,开创了将人类视线作为隐式监督信号用于策略优化的新范式。这些工作共同深化了对机器人精细操作中感知-动作闭环的理解。
数据集最近研究
最新研究方向
在机器人操作领域,精细操作技能的学习一直是研究热点。1cube-to-1basket数据集聚焦于“抓取-放置”这类基本任务,通过双机械臂系统采集了80个高质量的演示轨迹,包含超过3.4万帧的关节状态、力矩、多视角视觉与眼动追踪信息。这一资源的涌现为基于模仿学习的机器人灵巧操控提供了宝贵的数据支撑,特别是在结合人类意图与视觉反馈的端到端策略训练方面,推动了从仿真到真实世界的迁移研究。随着大规模数据集与LeRobot等开源框架的融合,机器人基础模型在日常生活场景中的泛化能力预计将迎来新的突破,为自动化和辅助应用奠定更坚实的基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务