遇见数据集

pick_bomb

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

该数据集是一个用于机器人学研究的开源数据集,使用LeRobot代码库(v3.0版本)创建,专门针对双机械臂跟随机器人(bi_so_follower)平台。数据集旨在支持机器人模仿学习、强化学习或行为克隆等任务,特别是涉及双臂协调操作的研究。数据集规模为168个完整任务执行序列(episodes),共计136,483个时间步(帧)。数据以分块形式组织(每块约1000帧),原始数据文件总大小约为100MB,对应的视频文件总大小约为200MB。数据内容包含机器人的动作指令、观测状态以及多视角视觉信息。具体特征包括:动作是一个12维浮点数向量,控制左、右机械臂的6个关节位置;观测包含状态(12维浮点数向量)和图像(来自左主摄像头和右腕部摄像头的RGB视频流,分辨率240x320,帧率30 FPS,使用H.264编码);元数据包括时间戳、帧索引、episode索引、全局数据索引和任务索引。数据集文件以Parquet格式存储,视频文件为MP4格式,已划分为训练集(包含所有168个episodes),采用Apache 2.0许可证发布。

This dataset is an open-source dataset for robotics research, created using the LeRobot codebase (version 3.0), specifically designed for the bi_so_follower (dual-arm following robot) platform. It aims to support tasks such as robot imitation learning, reinforcement learning, or behavior cloning, particularly research involving dual-arm coordinated operations. The dataset consists of 168 complete task execution episodes, totaling 136,483 timesteps (frames). Data is organized in chunks (approximately 1000 frames per chunk), with the raw data files totaling about 100MB and corresponding video files totaling about 200MB. The content includes robot action commands, observation states, and multi-view visual information. Specific features are: action is a 12-dimensional floating-point vector controlling the 6 joint positions of the left and right robotic arms; observation includes state (a 12-dimensional floating-point vector) and images (RGB video streams from two fixed perspectives: left_main camera and right_right_wrist camera, with a resolution of 240x320, frame rate of 30 FPS, encoded using H.264); metadata includes timestamp, frame_index, episode_index, index, and task_index for data alignment and sequence analysis. The dataset files are stored in Parquet format, with video files in MP4 format, and it is divided into a training set (containing all 168 episodes). The dataset is released under the Apache 2.0 license.

创建时间:
2026-05-24
原始信息汇总

数据集概述

  • 数据集名称: pick_bomb
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 标签: LeRobot, TeLeRobot
  • 创建工具: 使用 LeRobot 创建

数据集结构

基本信息

  • 代码库版本: v3.0
  • 机器人类型: bi_so_follower
  • 总片段数 (Episodes): 168
  • 总帧数: 136,483
  • 总任务数: 1
  • 数据块大小 (Chunks Size): 1000
  • 数据文件大小: 约100 MB
  • 视频文件大小: 约200 MB
  • 帧率 (FPS): 30

数据划分

  • 训练集 (Train): 片段 0 至 167 (共168个片段)

文件路径

  • 数据文件路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

特征 (Features)

特征名称 数据类型 形状 说明
action float32 [12] 12维动作值,包含左右臂各6个关节位置(肩部、肘部、腕部、夹爪)
observation.state float32 [12] 12维观测状态值,与action维度对应
observation.images.left_main video [240, 320, 3] 左侧主摄像头视频,分辨率240x320,H.264编码,30 FPS
observation.images.right_right_wrist video [240, 320, 3] 右侧腕部摄像头视频,分辨率240x320,H.264编码,30 FPS
timestamp float32 [1] 时间戳
frame_index int64 [1] 帧索引
episode_index int64 [1] 片段索引
index int64 [1] 索引
task_index int64 [1] 任务索引

可视化

引用

  • BibTeX: 待补充
搜集汇总
数据集介绍
pick_bomb 数据集图片
构建方式
pick_bomb数据集由研究者基于LeRobot框架精心构建,旨在服务于机器人操作领域的研究。该数据集通过遥操作(TeLeRobot)方式采集,记录了双臂机器人在完成“拾取炸弹”这一特定任务时的运动轨迹与视觉信息。数据采集过程中,机器人主体为Bi-so-follower型号,其左右各六自由度机械臂的关节位置(包括肩部、肘部、腕部及夹爪)被实时记录为状态与动作序列。所有数据被划分为168个独立回合,总帧数达136,483帧,以30帧每秒的帧率统一存储。原始的关节位置与视觉观测被组织为Parquet格式的结构化数据,而左右主相机及腕部相机的视频流则以H.264编码压缩为MP4文件,确保了高保真度与存储效率。
使用方法
该数据集可通过HuggingFace Datasets库便捷加载,与LeRobot生态无缝集成。用户可直接调用LeRobot的视觉化工具,在预设的HuggingFace Space中预览数据集中的轨迹与影像。在模型训练方面,数据集按100兆字节的Parquet数据与200兆字节的视频文件结构存储,支持基于索引的流式读取,适合用于训练模仿学习或强化学习策略。研究者可利用其中定义的12维动作空间作为策略网络的输出,结合三路图像作为视觉输入,构建端到端的操作模型。推荐将数据按回合索引分割,利用随机采样的方式从“train”分割中提取状态-动作对进行监督学习,并利用帧序号设计时间滑窗,以支持基于时序预测的机器人控制范式。
背景与挑战
背景概述
在机器人学习领域,模仿学习作为一种高效的知识传递范式,正逐步突破传统编程的桎梏,使机器人能够从人类示范中习得复杂操作技能。由研究人员kmg0620基于LeRobot框架创建的pick_bomb数据集,诞生于2024年之后,专注于机器人抓取与放置任务。该数据集通过双机械臂平台(bi_so_follower)采集了168个示范片段,包含超过13万帧的高频动作序列与多视角视觉信息,为研究双臂协调操作中的物体抓取策略提供了标准化基准。其影响力体现在为模仿学习算法提供了真实、可复现的训练与评估资源,尤其推动了从原始传感器数据到低层控制指令的端到端学习范式发展。
当前挑战
该数据集所解决的领域核心挑战在于双臂机器人在非结构化环境中的精准抓取问题,传统规划方法难以应对物体形状多样性与动态场景干扰,而pick_bomb通过提供高分辨率双目视觉(240×320像素)与12维动作空间(含肩、肘、腕及夹爪关节)的同步记录,为学习鲁棒抓取策略创造了条件。构建过程中面临的挑战包括:如何确保跨100个数据分片(每个1000帧)的时序一致性,以及处理h264编码视频与Parquet结构化数据间的异构存储格式,同时维持30帧/秒的实时同步采集。此外,单一任务(pick)的数据分布可能限制模型泛化能力,需后续研究通过数据增强或多任务扩展来弥合。
常用场景
经典使用场景
在机器人学习与操控领域中,pick_bomb数据集是模仿学习算法训练与评估的经典资源。该数据集聚焦于单一任务——物体拾取(pick),通过双机械臂协作的仿真或真实场景,记录了168个完整episode的机器人动作序列与多视角视觉观测。研究人员常利用其高保真的12维关节空间动作指令、左右相机视频流以及时间戳信息,训练诸如行为克隆或扩散策略等算法,使机器人能够从演示中习得精准的抓取与搬运技能。
解决学术问题
该数据集有效解决了机器人领域长期存在的样本效率低下与泛化能力不足等学术难题。通过提供结构化的多模态数据(包括状态信息与视觉观测),它支持研究者探索视觉运动策略的鲁棒性,尤其是面对不同光照、遮挡或物体位姿变化时的适应能力。其影响力在于,它为双机械臂协调控制这一复杂问题提供了可复现的基准,推动了模仿学习从简单单臂操作向更真实的双臂协作任务演进,加速了通用化机器人操作策略的研发进程。
实际应用
在实际工业生产与服务场景中,pick_bomb数据集所代表的拾取任务模型具有广泛的应用价值。例如,在自动化仓储物流中,机器人通过此类学习模型可自主识别并抓取货架上的包裹,大幅提升分拣效率;在医疗辅助领域,双臂机器人能模拟人类动作,完成手术器械的传递与放置。此外,该数据集训练的策略可直接迁移至家庭服务机器人,帮助其完成拾取散落物品等日常家务,推动非结构化环境下人机协作的实用性进程。
数据集最近研究
最新研究方向
在具身智能与机器人操作领域,pick_bomb数据集聚焦于双臂协同的精细抓取任务,代表了从单一机械臂操作向类人灵巧操作演进的前沿趋势。该数据集包含168个完整演示片段,通过双机械臂(左右各6自由度)的同步控制以及多视角视觉输入(包括主相机与腕部相机),为模仿学习与强化学习算法提供了高保真的训练素材。近期研究热点围绕如何利用此类跨模态数据集训练具备泛化能力的操作策略,尤其是在小样本学习与零样本迁移场景中,借助预训练视觉-语言模型提取语义特征以引导机器人完成未见的抓取目标。该数据集的发布呼应了业界对标准化机器人操作基准的迫切需求,如LeRobot框架的生态整合,为复现与对比最新算法(如ACT、DP)提供了统一评估平台,加速了从仿真到真实世界的技能迁移研究。其Apache-2.0许可进一步推动了开放科学精神,使得学术界与产业界能够共建更鲁棒、可解释的机器人智能系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务