newbalance_shoe_insole_retrieval_and_packing_0604
收藏数据链接:
官方服务:
资源简介:
该数据集使用LeRobot工具创建,是一个机器人领域的示范数据集。数据集采集自一个名为bi_flexiv_rizon4_rt的双臂机器人系统。数据规模包含36个完整的任务序列(episodes),总计590,769个数据帧,涵盖1个任务。数据以30帧/秒的速率采集,并仅划分为训练集。数据集包含多模态信息:1) 动作数据:一个20维的浮点数向量,具体描述了左、右机械臂末端执行器(TCP)在三维空间中的位置(x, y, z)和旋转姿态(r1至r6),以及左右夹爪的开合位置。2) 状态观测数据:与动作数据具有相同的20维结构,记录了机器人在每个时刻的自身状态。3) 视觉观测数据:提供了来自五个不同视角的视频流,包括头部摄像头、左腕摄像头、右腕摄像头,以及左右机械臂上的各两个触觉传感器摄像头。视频分辨率分别为640x480(头、腕部)和700x400(触觉传感器),均为彩色(3通道)视频,编码格式为H.264。4) 元数据:包括时间戳、帧索引、序列索引、全局索引和任务索引。该数据集适用于机器人模仿学习、强化学习、行为克隆以及多传感器融合策略的训练与评估。数据以Parquet文件格式存储,视频单独以MP4格式存储。
创建时间:
2026-06-04
原始信息汇总
数据集概述
- 数据集名称: newbalance_shoe_insole_retrieval_and_packing_0604
- 许可证: Apache-2.0
- 任务类型: 机器人(Robotics)
- 数据集标签: LeRobot
- 创建工具: 使用 LeRobot 创建
数据集规模
- 总片段数: 36
- 总帧数: 590,769
- 总任务数: 1
- 数据文件大小: 100 MB
- 视频文件大小: 500 MB
- 帧率: 30 FPS
数据集划分
- 训练集: 全部 36 个片段(索引 0 至 35)
数据结构
- 数据文件路径:
data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet - 视频文件路径:
videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4 - 分块大小: 1000
特征与观测
动作(Action)
| 维度 | 数据类型 | 说明 |
|---|---|---|
| 20 | float32 | 包含左右机械臂的 TCP 位置(x, y, z)和姿态(r1-r6),以及左右夹爪的位置(pos) |
观测状态(Observation State)
| 维度 | 数据类型 | 说明 |
|---|---|---|
| 20 | float32 | 与动作特征相同,包含左右机械臂 TCP 和夹爪信息 |
观测图像(Observation Images)
| 图像类型 | 分辨率 | 编码格式 | 帧率 |
|---|---|---|---|
| 头部相机(head) | 480×640×3 | H.264, yuv420p | 30 FPS |
| 左腕相机(left_wrist) | 480×640×3 | H.264, yuv420p | 30 FPS |
| 右腕相机(right_wrist) | 480×640×3 | H.264, yuv420p | 30 FPS |
| 左触觉传感器0(left_tactile_0) | 400×700×3 | H.264, yuv420p | 30 FPS |
| 左触觉传感器1(left_tactile_1) | 400×700×3 | H.264, yuv420p | 30 FPS |
| 右触觉传感器0(right_tactile_0) | 400×700×3 | H.264, yuv420p | 30 FPS |
| 右触觉传感器1(right_tactile_1) | 400×700×3 | H.264, yuv420p | 30 FPS |
其他特征
| 特征名 | 数据类型 | 维度 |
|---|---|---|
| timestamp | float32 | 1 |
| frame_index | int64 | 1 |
| episode_index | int64 | 1 |
| index | int64 | 1 |
| task_index | int64 | 1 |
机器人信息
- 机器人类型: bi_flexiv_rizon4_rt
搜集汇总
数据集介绍

构建方式
该数据集基于LeRobot框架构建,旨在服务于机器人操作任务的模仿学习与行为克隆研究。数据采集过程采用双机械臂系统(bi_flexiv_rizon4_rt),涵盖鞋垫的检索与包装这一特定工业操作场景。数据集共包含36个演示片段,总帧数达590,769帧,以30帧/秒的稳定频率记录。数据存储采用分块索引方式,将原始传感数据保存为Parquet格式的数值文件,同时将高维视觉与触觉序列压缩为H.264编码的MP4视频文件,实现了结构化数据与多媒体信息的高效整合。
特点
数据集的核心特色在于其多模态感知信息的丰富性。除基本关节状态和末端执行器位姿外,数据同步记录了头部、左右腕部三个视角的RGB视觉流,以及左右触觉传感器各两个通道的触觉影像流,形成了空间维度为400×700至480×640像素的立体感知体系。每个演示片段携带20维连续动作指令,涵盖双机械臂的笛卡尔坐标、姿态四元数及夹爪开合度。所有动作与观测均在时间戳与帧索引上精确对齐,为跨模态学习提供了高质量的时空关联基础。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,利用LeRobot提供的标准接口快速访问数值与视频数据。数据已预先划分为训练集(36个片段),可直接用于训练端到端的模仿学习模型。使用过程中,建议通过特征字典中的键名(如`action`、`observation.state`、`observation.images.head`)索引对应模态。对于视频帧,数据集已自动完成编解码,可即时获取张量形式的图像序列。用户亦可依据`episode_index`字段选取特定演示,结合`frame_index`进行时序采样,灵活适配不同算法的输入需求。
背景与挑战
背景概述
该数据集由HuggingFace LeRobot社区于2024年创建,依托双臂Flexiv Rizon 4机器人平台,聚焦鞋垫分拣与包装这一精细化工业任务。核心研究问题在于如何赋予机器人通过视觉与触觉多模态感知执行高精度操作的能力。数据集包含36个演示轨迹,近60万帧时序数据,集成头部与腕部RGB摄像头以及双侧各两个触觉传感器,为模仿学习与机器人操作研究提供了丰富的多模态基准。其影响力体现在推动机器人从简单抓取向复杂装配场景的迁移学习,并为双臂协同与触觉反馈结合的策略研究奠定了数据基础。
当前挑战
所解决的领域挑战在于将视觉与触觉信息深度融合以应对柔性物体(如鞋垫)的形变与非刚性特性,传统视觉方法难以捕捉其姿态与纹理变化,而触觉数据的引入则增加了模态对齐与时空同步的困难。构建过程中面临的挑战包括双臂机器人20维动作空间的精确标定、多视角视频与触觉传感器在30帧/秒高频下的同步采集,以及确保演示轨迹的质量与一致性,避免因硬件抖动或环境光照变化引入噪声。此外,数据规模虽大但多样性有限,如何从有限演示中泛化至未知场景仍属开放问题。
常用场景
经典使用场景
在智能制造与机器人操作领域,newbalance_shoe_insole_retrieval_and_packing_0604数据集为研究双机械臂协同精细操作提供了宝贵的资源。该数据集聚焦于鞋垫的抓取与包装这一典型工业场景,记录了36个完整操作回合中,双Flexiv Rizon4机器人从视觉感知、触觉反馈到运动执行的全流程数据。其核心价值在于提供了多模态观测信息,包括头部及腕部相机的高清视觉流、四组触觉传感器数据,以及左右机械臂末端执行器的三维位姿与夹爪状态,为模仿学习与机器人技能迁移研究奠定了数据基础。
衍生相关工作
基于此数据集,衍生出了一系列聚焦于机器人精细操作与多模态学习的前沿研究工作。在模型架构层面,研究者借鉴了LeRobot框架的处理范式,提出了面向双机械臂场景的层次化模仿学习模型,以及融合触觉与视觉信息的可变形物体操控策略。在算法验证方面,该数据集常被用于评估基于扩散策略的动作序列生成模型,或对比无模型强化学习与行为克隆方法在真实机器人任务上的泛化能力。这些衍生工作不仅推动了机器人学习社区对柔性对象操作科学问题的认知,也为后续构建更通用的机器人基础模型提供了关键的基准测试数据。
数据集最近研究
最新研究方向
该数据集聚焦于机器人灵巧操作领域的前沿课题,具体针对鞋垫的高精度检索与包装任务。借助LeRobot框架,数据以36个示范片段、近60万帧的高频记录形式呈现,集成了双机械臂协同控制、多视角视觉及触觉传感信息。随着智能制造对柔性生产需求的激增,此类数据集为模仿学习与技能迁移研究提供了宝贵素材,尤其推动了双手协调操作和触觉-视觉融合策略的发展。其公开的标准化格式进一步降低了机器人学习研究的门槛,有望加速工业场景中自动化包装线的智能化升级。
以上内容由遇见数据集搜集并总结生成



