遇见数据集

newbalance_shoe_insole_retrieval_and_packing_0611

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

该机器人数据集使用LeRobot框架创建,旨在为机器人学习研究提供多模态演示数据。数据采集自名为bi_flexiv_rizon4_rt的双臂机器人系统,核心数据包括动作指令、状态观测和多路视觉观测。动作和状态观测由20维浮点数向量表示,涵盖左右机械臂末端执行器在三维空间中的位置(x, y, z)和姿态(r1至r6),以及左右夹爪的开合位置。视觉观测包括:头部摄像头(480x640 RGB)、左右腕部摄像头(各480x640 RGB)、左右机械臂上的触觉传感器图像(各两个,分辨率为400x700 RGB)。所有视频流以30 FPS录制。数据集包含94条完整工作序列,总计超过140万帧数据,全部划分为训练集。数据以分块形式存储,结构化数据保存在Parquet文件中,视频数据保存在MP4文件中。适用于机器人模仿学习、强化学习、视觉伺服控制、多模态感知与策略学习等研究任务。

This robot dataset is created using the LeRobot framework and aims to provide multimodal demonstration data for robot learning research. The data is collected from a dual-arm robot system named bi_flexiv_rizon4_rt. Core data includes action commands, state observations, and multi-channel visual observations. Actions and state observations are represented by 20-dimensional floating-point vectors, covering the position (x, y, z) and orientation (r1 to r6) of the left and right robot arm end-effectors (TCP) in three-dimensional space, as well as the opening and closing positions of the left and right grippers. Visual observations include: a head camera (480x640 RGB), left and right wrist cameras (each 480x640 RGB), and tactile sensor images on the left and right robot arms (two each, with a resolution of 400x700 RGB). All video streams are recorded at 30 FPS. The dataset contains 94 complete work episodes, totaling over 1.4 million frames, all divided into a training set. Data is stored in chunks, with structured data (actions, states, indices, etc.) saved in Parquet files and video data saved in MP4 files. It is suitable for research tasks such as robot imitation learning, reinforcement learning, visual servoing control, multimodal perception, and policy learning.

创建时间:
2026-06-11
原始信息汇总

数据集概述

  • 数据集名称:newbalance_shoe_insole_retrieval_and_packing_0611
  • 来源平台:Hugging Face Datasets
  • 许可证:Apache-2.0
  • 任务类别:机器人(Robotics)
  • 标签:LeRobot

数据集规模与结构

  • 机器人类型:双Flexiv Rizon4 RT(bi_flexiv_rizon4_rt)
  • 总剧集数:94
  • 总帧数:1,404,418
  • 总任务数:1
  • 块大小:1,000
  • 数据文件大小:约100 MB
  • 视频文件大小:约500 MB
  • 帧率:30 FPS
  • 数据集划分:全部94个剧集用于训练(train: 0:94)

数据特征

  • 动作(action):20维浮点数(float32),包含左右TCP位置(x, y, z, r1-r6)和左右夹爪位置(left/right_gripper.pos)。
  • 观测状态(observation.state):20维浮点数(float32),与动作特征完全相同。
  • 观测图像(observation.images):视频数据,包括:
    • head:480×640像素,3通道
    • left_wrist:480×640像素,3通道
    • right_wrist:480×640像素,3通道
    • left_tactile_0:400×700像素,3通道
    • left_tactile_1:400×700像素,3通道
    • right_tactile_0:400×700像素,3通道
    • right_tactile_1:400×700像素,3通道
    • 所有视频采用H.264编码,30 FPS,无音频。
  • 其他特征
    • 时间戳(timestamp):float32,形状[1]
    • 帧索引(frame_index):int64,形状[1]
    • 剧集索引(episode_index):int64,形状[1]
    • 索引(index):int64,形状[1]
    • 任务索引(task_index):int64,形状[1]

数据存储路径

  • 数据文件data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

引用信息

  • 当前暂无可用的BibTeX引用信息。
搜集汇总
数据集介绍
newbalance_shoe_insole_retrieval_and_packing_0611 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在服务于机器人操作任务的模仿学习研究。数据采集依托双臂机器人平台bi_flexiv_rizon4_rt,通过遥操作或预设程序记录鞋垫检索与包装任务的完整执行过程。数据集共包含94个演示片段,总计超过140万帧时序数据,以每秒30帧的帧率进行采样。所有数据被组织为chunk结构,其中时序动作与状态信息存储于Parquet格式文件中,而多视角视频流(包括头部摄像头、左右腕部摄像头及左右触觉传感器画面)则压缩为H.264编码的MP4视频文件,确保数据读取效率与存储平衡。
特点
该数据集的一个显著特征在于其多模态感知信息的深度融合。除了通常的关节空间状态与二维视觉影像外,数据集创新性地引入了四路触觉传感器图像(左右机械臂各搭载两个触觉传感模块),能够捕捉抓取过程中接触力的空间分布细节,为精细操作策略的学习提供关键线索。动作空间涵盖双臂末端执行器的六维位姿与夹爪开合度,共计20维连续控制信号。所有观测数据均具备统一的30Hz时间戳对齐,且未进行训练/验证集划分,94个片段全部用于模型训练,充分保障了数据利用的完整性。
使用方法
数据集可通过HuggingFace的datasets库直接加载,结合LeRobot的API进行高效访问。使用时,用户可将Parquet文件解析为包含动作与状态张量的DataFrame,并同步加载对应时间戳的视频帧。鉴于数据格式遵循LeRobot规范,研究者可直接调用其数据加载器(DataLoader)进行批量化处理,适用于行为克隆(Behavior Cloning)、扩散策略(Diffusion Policy)等模仿学习方法的训练。建议将多模态观测输入(如状态向量与触觉图像)融合为统一特征表示,以充分利用本数据集的高密度多传感信息优势。
背景与挑战
背景概述
随着机器人在智能制造与物流分拣领域的广泛应用,精细化、柔性的物体操作任务成为研究前沿。该数据集创建于2024年,由Hugging Face与相关机器人研究机构联合发布,基于LeRobot框架构建,核心研究问题是实现双机械臂对鞋垫的精准检索与包装。数据集采用双柔性机器人(bi_flexiv_rizon4_rt)采集,包含94个完整演示片段、超过140万帧数据,融合高分辨率视觉与触觉传感器信息,为模仿学习与机器人操作提供了多模态、高保真的训练资源。其在机器人学习社区中推动了从简单抓取到复杂装配任务的范式迁移,尤其对探索触觉反馈在精细操作中的价值具有里程碑意义。
当前挑战
所解决的领域问题在于双机械臂协同下对柔软易变形物体(如鞋垫)的定位、抓取与包装,传统视觉系统难以应对遮挡、形变与光照变化,而纯力控方法又缺乏全局语义理解。构建过程中面临技术挑战:首先,需同步校准多台摄像头与触觉传感器的高频数据流(30fps),确保时空对齐精度;其次,鞋垫的不规则形态导致运动规划极易失败,需设计自适应抓取策略;最后,从触觉、视觉到力控的异构数据融合方案缺乏通用基准,增加了数据集泛化到新场景的难度。
常用场景
经典使用场景
在机器人操作与灵巧抓取领域,New Balance鞋垫检索与打包数据集为模仿学习与强化学习提供了高保真的双机器人协同操作基准。该数据集记录了双臂Flexiv Rizon 4机械臂在执行鞋垫拾取、姿态调整及包装入盒等精细任务时的完整轨迹,包含头部、左右腕部及四个触觉传感器的多视角视觉流,以及20维的动作与状态空间(涵盖TCP位姿与夹爪开合度)。研究者可借此训练机器人从像素到动作的端到端映射策略,尤其适用于需要精密力控与柔性物件操作的长时序任务。94个演示片段、超140万帧的高频采样(30 FPS)确保了数据多样性,为双臂协调、触觉视觉融合及精密操作策略的研究提供了理想实验场。
衍生相关工作
以该数据集为起点,学术界已在若干关键方向上展开衍生探索。在算法层面,研究者基于其多视角触觉图像开发了跨模态特征对齐网络,使机器人能在缺乏视觉反馈时通过触觉序列推断物体位姿;另有工作借助该数据集的长时序动作链,验证了基于扩散模型的策略规划在精密操作任务中优于传统的行为克隆方法。在系统层面,该数据集催生了面向双臂机器人柔性物体操作的统一评价框架(如操作成功率、装配误差及循环周期),并推动了开源工具链(如LeRobot、MimicGen)在工业级任务上的适配与优化。这些工作不仅加深了我们对柔性物料物理交互的理解,更为智能机器人从实验室走向工厂搭建了桥梁。
数据集最近研究
最新研究方向
在智能制造与仓储自动化加速演进的当下,该数据集聚焦于鞋垫取放与包装这一精细操作场景,为双臂协作机器人提供了高保真度的示范数据。借助LeRobot框架,数据采集复现了工业环境中柔性夹具控制与触觉反馈融合的前沿范式,其94条轨迹、逾140万帧的多模态观测(涵盖多视角视觉与双通道触觉图像),为研究复杂柔顺操控、触觉-视觉联合表征学习以及基于示范的机器人模仿学习(Imitation Learning)提供了关键基准,有力推动了将机器人应用于消费品精密装配与分拣的最新学术探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务