遇见数据集

remove_cap_from_bottles_001

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

该数据集是一个基于LeRobot框架创建的机器人操作数据集,核心任务为执行单一操作任务(标识符remove_cap_from_bottles_001,具体任务名称未明确)。数据集记录了双机械臂机器人(bi_so_follower类型)执行任务的过程,包含多模态数据。数据规模包括11个完整任务执行序列(episodes),共计38,501帧,以30 FPS帧率记录。主要字段包括:1) 动作(action):12维浮点向量,表示左右机械臂各6个关节(肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转、夹爪)的目标位置;2) 观测(observation):状态观测为12维浮点向量(表示关节当前位置),图像观测来自三个摄像头视角(左腕摄像头、左上方摄像头、右腕摄像头),每个视角提供640x480分辨率的RGB三通道图像;3) 元数据:包括时间戳、帧索引、episode索引、全局索引和任务索引。所有数据划分为训练集,适用于机器人学习领域的研究,如模仿学习、强化学习或行为克隆,用于训练机器人从多视角视觉观察中学习双臂协调操作技能。

This dataset is a robot manipulation dataset created using the LeRobot framework, with the core task of performing a single manipulation task (identifier remove_cap_from_bottles_001, specific task name not explicitly stated). It records the process of a dual-arm robot (bi_so_follower type) executing the task and includes multimodal data. The dataset consists of 11 complete task execution episodes, totaling 38,501 frames recorded at 30 FPS. Key fields include: 1) Action: a 12-dimensional floating-point vector representing target positions for six joints per arm (shoulder translation, shoulder lift, elbow bend, wrist bend, wrist rotation, gripper); 2) Observation: state observation as a 12-dimensional floating-point vector (current joint positions) and image observation from three camera views (left_wrist, left_top, right_wrist), each providing RGB three-channel images at 640x480 resolution; 3) Metadata: including timestamp, frame_index, episode_index, index, and task_index. All data is divided into the training set and is suitable for research in robot learning, such as imitation learning, reinforcement learning, or behavior cloning, for training robots to learn bimanual coordination skills from multi-view visual observations.

创建时间:
2026-07-03
原始信息汇总

数据集概述:remove_cap_from_bottles_001

该数据集是一个用于机器人操控任务的演示数据集,专门针对从瓶子上移除瓶盖这一具体操作。数据集采用 LeRobot 格式构建,并遵循 Apache-2.0 开源许可协议。

数据集基本信息

  • 数据集名称: remove_cap_from_bottles_001
  • 创建工具: LeRobot
  • 许可证: Apache-2.0
  • 任务类型: 机器人操控 (robotics)
  • 机器人类型: bi_so_follower

数据规模与结构

  • 总演示片段 (Episodes): 14
  • 总帧数: 49,040
  • 总任务数: 1
  • 帧率 (FPS): 30
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB
  • 数据分块大小: 1000
  • 数据划分: 训练集 (train) 包含全部14个片段(索引 0:14)

数据特征 (Features)

数据集包含动作、状态观测和图像观测等多种特征,具体如下:

1. 动作 (action)

  • 数据类型: float32
  • 形状: [12] - 包含12个维度,对应双臂6个自由度的位置指令:
    • 左臂:肩部旋转/升降、肘部屈伸、腕部屈伸/旋转、夹爪位置
    • 右臂:同上
  • 字段名称: left_shoulder_pan.pos, left_shoulder_lift.pos, left_elbow_flex.pos, left_wrist_flex.pos, left_wrist_roll.pos, left_gripper.pos, right_shoulder_pan.pos, right_shoulder_lift.pos, right_elbow_flex.pos, right_wrist_flex.pos, right_wrist_roll.pos, right_gripper.pos

2. 观测状态 (observation.state)

  • 数据类型: float32
  • 形状: [12] - 与动作特征结构完全相同,反映机械臂各关节的实际状态

3. 观测图像 (observation.images)

  • 包含三个摄像头视角,均为视频流格式:
    • left_wrist: 左腕部摄像头,480x640分辨率,3通道(RGB),帧率30fps,编码为AV1
    • left_top: 左侧上方摄像头,规格同上
    • right_wrist: 右腕部摄像头,规格同上

4. 其他元数据

  • timestamp: float32,时间戳,形状 [1]
  • frame_index: int64,帧索引,形状 [1]
  • episode_index: int64,片段索引,形状 [1]
  • index: int64,全局索引,形状 [1]
  • task_index: int64,任务索引,形状 [1](当前仅1个任务)

数据文件格式

  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet (Parquet格式)
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4 (MP4格式)

可视化与引用

  • 数据集可视化: 可通过 Hugging Face Space 在线查看。
  • 论文: 暂无提供。
  • 引用格式: 暂无提供BibTeX引用信息。
搜集汇总
数据集介绍
remove_cap_from_bottles_001 数据集图片
构建方式
该数据集聚焦于机器人操作领域中的瓶盖移除任务,基于LeRobot框架构建,采用双机械臂(bi_so_follower)执行精细操作。数据通过14个完整演示回合采集,共计49040帧,涵盖12维动作空间,包括左右机械臂的肩关节、肘关节、腕关节及夹爪位置。每个回合以30帧每秒的速率记录,并存储为高效的parquet格式与AV1编码视频文件,确保数据在时间序列上的连贯性与视觉信息的完整性。
使用方法
研究者可借助LeRobot生态工具直接加载该数据集,支持自定义批处理与采样策略。数据集适用于模仿学习与强化学习任务,通过整合action与observation.state字段构建状态-动作对,并结合多视角图像序列训练视觉运动策略。推荐将数据按chunks_size=1000分割,以适配大规模分布式训练,同时利用视频路径字段灵活访问高帧率视觉流,提升模型对动态环境的适应能力。
背景与挑战
背景概述
在机器人操作领域,精细操控任务始终是衡量算法与系统鲁棒性的重要标尺。由研究者chabir78于近期创建的remove_cap_from_bottles_001数据集,依托LeRobot框架构建,聚焦于“从瓶子上取下瓶盖”这一典型日常操作任务。该数据集涵盖14个示范片段、总计49040帧高频(30FPS)多模态数据,包含来自左腕、左上及右腕摄像头的640×480视觉图像以及12维关节动作状态序列。其核心研究价值在于为模仿学习与具身智能研究提供标准化、高精度的训练基准,推动机器人从结构化环境向非结构化日常场景迁移的能力评估。作为开源社区中聚焦精细物品操纵的稀缺资源,该数据集为多视角融合、时序对齐及小样本泛化等前沿课题提供了关键数据支撑。
当前挑战
该数据集所解决的领域核心挑战在于机器人在高精度、高动态的拧旋动作中对柔性物体(瓶盖与瓶身)的稳健操作,该类任务要求同时协调双臂动作与视觉反馈,对传统运动规划与抓取策略构成显著困难。构建过程中面临的技术挑战包括:1)多相机(三视角)视频与机器人关节状态的高频同步采集与时空校准,需确保动作与图像帧的毫秒级对齐;2)仅含14条示范轨迹的小样本规模对模仿学习的泛化能力提出严苛要求,极易引发过拟合;3)任务唯一性(仅取下瓶盖)使得数据集在任务多样性方面存在局限,需结合后续的域增强或任务扩展才能服务于更复杂的泛化研究场景。
常用场景
经典使用场景
在机器人操作领域,'remove_cap_from_bottles_001'数据集专为模仿学习与精细操作任务而设计。其核心场景聚焦于双机械臂协作完成瓶盖旋拧移除这一典型工业与家庭自动化动作。数据集包含14个演示片段,总计近5万帧高频时序数据(30 FPS),详细记录了双七自由度机械臂的关节角度、末端执行器状态及多视角视觉观测(左侧腕部、顶部及右侧腕部摄像头)。研究人员可利用此数据集训练智能体从人类演示中学习精准的力控与轨迹规划策略,尤其适用于需要协调双手异步与同步动作的复杂拧旋类任务,为机器人灵巧操作研究提供了标准化的基准测试平台。
解决学术问题
该数据集着力应对机器人学习领域中长期存在的棘手挑战:如何从有限的人类演示中高效泛化出鲁棒的精细操作技能。传统方法在瓶盖旋拧这类非刚体接触、需连续力位混合控制的任务上常因数据稀缺与感知不完整而失效。通过提供多模态融合的高保真数据(包含关节空间状态、立体视觉流与动作序列),该数据集使研究者得以探索基于视觉的模仿学习、时序差分模型以及端到端策略的鲁棒性。其价值在于弥合仿真与真实世界间隙,推动研究从简单抓取迈向具有工业级复杂度的装配与解锁操作,为迁移学习与少样本技能习得提供了关键的实证基础。
实际应用
此数据集的工业应用场景极为直观,核心指向自动化生产线上需要人类灵巧性的环节,例如饮品包装的质检与重新封装、药品容器的无菌旋盖操作。在家庭服务机器人领域,它使机器人能自主完成开启调料瓶或饮料瓶等日常辅助任务,提升老年人与残障人士的生活品质。此外,该数据集可赋能协作机器人进行精细的维护作业,如更换实验室试管盖或精密仪器护帽。通过LeRobot框架的标准化接口,开发者能便捷地将预训练策略部署至真实成本级机器人平台,显著降低精细化操作任务的部署门槛,加速从实验室研究到商业落地的转化进程。
数据集最近研究
最新研究方向
在机器人操作领域,精准的物体操控是仿人机器人迈向实用化的关键。remove_cap_from_bottles_001数据集聚焦于“旋开瓶盖”这一精细操作任务,利用双机械臂(bi_so_follower)采集了14个示范片段,涵盖近5万帧高保真时序数据,包含来自左右腕部和顶部摄像头的多视角视觉流与12维关节动作序列。该数据集为模仿学习和行为克隆研究提供了高质量训练素材,尤其助力于解决非刚性接触与力控策略的泛化难题。随着家庭服务机器人需求激增及LeRobot等开放工具链的成熟,此类细粒度操作数据集正成为推动机器人从实验室走向现实生活的重要基石,其对复杂日常任务的自动化解析与复现具有显著的示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务