遇见数据集

Xense/newbalance_shoe_insole_retrieval_and_packing_0528

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人学数据集,专门用于机器人控制和学习任务。数据集包含3个总剧集、16669个总帧和1个总任务,数据以.parquet文件格式存储,视频文件以.mp4格式存储,帧率为30fps。机器人类型为bi_flexiv_rizon4_rt,支持双臂操作。特征包括动作(action)和观察(observation):动作特征为20维浮点数组,表示左右机械臂的工具中心点(TCP)位置(x, y, z)、姿态(r1至r6)以及夹爪位置;观察特征包括状态(与动作相同的20维数组)和多个图像源,如头部摄像头、左右手腕摄像头和左右触觉传感器(各两个),图像分辨率为480x640或400x700像素,彩色三通道。数据集还包含时间戳、帧索引、剧集索引等元数据。所有数据分为训练集,适用于机器人强化学习或模仿学习研究。

许可证:Apache-2.0 任务类别: - 机器人学 标签: - LeRobot 配置: - 配置名称:default 数据文件:data/*/*.parquet --- 本数据集基于[LeRobot](https://github.com/huggingface/lerobot)构建。 ## 数据集说明 - **主页**:[需补充更多信息] - **论文**:[需补充更多信息] - **许可证**:Apache-2.0 ## 数据集结构 `meta/info.json`文件内容如下: json { "代码库版本": "v3.0", "机器人型号": "bi_flexiv_rizon4_rt", "总回合数": 3, "总帧数": 16669, "总任务数": 1, "分块大小": 1000, "数据文件总大小(MB)": 100, "视频文件总大小(MB)": 500, "帧率": 30, "数据集划分": { "训练集": "0:3" }, "数据路径格式": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "视频路径格式": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "数据特征": { "动作": { "数据类型": "float32", "字段名称": [ "左工具中心点(Tool Center Point,TCP)x轴坐标", "左TCP y轴坐标", "左TCP z轴坐标", "左TCP 旋转角1", "左TCP 旋转角2", "左TCP 旋转角3", "左TCP 旋转角4", "左TCP 旋转角5", "左TCP 旋转角6", "右TCP x轴坐标", "右TCP y轴坐标", "右TCP z轴坐标", "右TCP 旋转角1", "右TCP 旋转角2", "右TCP 旋转角3", "右TCP 旋转角4", "右TCP 旋转角5", "右TCP 旋转角6", "左夹爪位置", "右夹爪位置" ], "维度": [ 20 ] }, "观测.状态": { "数据类型": "float32", "字段名称": [ "左TCP x轴坐标", "左TCP y轴坐标", "左TCP z轴坐标", "左TCP 旋转角1", "左TCP 旋转角2", "左TCP 旋转角3", "左TCP 旋转角4", "左TCP 旋转角5", "左TCP 旋转角6", "右TCP x轴坐标", "右TCP y轴坐标", "右TCP z轴坐标", "右TCP 旋转角1", "右TCP 旋转角2", "右TCP 旋转角3", "右TCP 旋转角4", "右TCP 旋转角5", "右TCP 旋转角6", "左夹爪位置", "右夹爪位置" ], "维度": [ 20 ] }, "观测.图像.头部相机": { "数据类型": "视频", "维度": [ 480, 640, 3 ], "字段名称": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "H.264", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "无音频轨道": false } }, "观测.图像.左腕部相机": { "数据类型": "视频", "维度": [ 480, 640, 3 ], "字段名称": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "H.264", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "无音频轨道": false } }, "观测.图像.右腕部相机": { "数据类型": "视频", "维度": [ 480, 640, 3 ], "字段名称": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "H.264", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "无音频轨道": false } }, "观测.图像.左触觉传感器0": { "数据类型": "视频", "维度": [ 400, 700, 3 ], "字段名称": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 400, "视频宽度": 700, "视频编码格式": "H.264", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "无音频轨道": false } }, "观测.图像.左触觉传感器1": { "数据类型": "视频", "维度": [ 400, 700, 3 ], "字段名称": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 400, "视频宽度": 700, "视频编码格式": "H.264", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "无音频轨道": false } }, "观测.图像.右触觉传感器0": { "数据类型": "视频", "维度": [ 400, 700, 3 ], "字段名称": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 400, "视频宽度": 700, "视频编码格式": "H.264", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "无音频轨道": false } }, "观测.图像.右触觉传感器1": { "数据类型": "视频", "维度": [ 400, 700, 3 ], "字段名称": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 400, "视频宽度": 700, "视频编码格式": "H.264", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "无音频轨道": false } }, "时间戳": { "数据类型": "float32", "维度": [ 1 ], "字段名称": null }, "帧索引": { "数据类型": "int64", "维度": [ 1 ], "字段名称": null }, "回合索引": { "数据类型": "int64", "维度": [ 1 ], "字段名称": null }, "样本索引": { "数据类型": "int64", "维度": [ 1 ], "字段名称": null }, "任务索引": { "数据类型": "int64", "维度": [ 1 ], "字段名称": null } } } ## 引用 **BibTeX格式:** bibtex [需补充更多信息]

提供机构:
Xense
搜集汇总
数据集介绍
Xense/newbalance_shoe_insole_retrieval_and_packing_0528 数据集图片
构建方式
该数据集依托LeRobot框架构建,专注于双机械臂在鞋垫拣选与包装任务中的精细操作。数据采集平台采用两台Flexiv Rizon 4机器人,协同完成作业。数据集包含3个完整演示回合,共计16,669帧,以30帧/秒的频率记录。数据存储采用分块化Parquet格式,每块包含1,000帧,视频文件则独立存储为H.264编码的MP4文件。动作与观测状态均定义为20维浮点向量,涵盖左右机械臂的TCP位姿与夹爪开合度,观测空间还集成了头部、左右腕部摄像头及四组触觉传感器的同步视频流。
特点
本数据集的核心特色在于其多模态融合与高保真度。它不仅记录了机械臂的关节空间状态和夹爪动作,还同步采集了多视角视觉图像(头部、腕部)与高分辨率触觉图像(左右各两组触觉传感器,分辨率为400×700),为模仿学习提供了丰富的感知信息。完整的传感器套件和明确的时序索引(timestamp、frame_index、episode_index)使研究者能够精准对齐不同模态的数据流,从而深入分析机器人在执行精细操作任务时的感知-行动耦合机制。
使用方法
该数据集专为机器人模仿学习和从观测中学习等研究任务设计。用户可通过LeRobot库便捷地加载parquet文件和关联视频,利用其API高效地将原始数据转换为适用于策略网络训练的标准化格式。数据集内含唯一的任务类型及对应的训练/验证划分(全部3个回合用于训练),便于进行行为克隆或基于扩散模型的策略学习。多模态观测结构(状态+多摄像头图像+触觉图像)可直接用于训练能够融合视觉与触觉信息的先进策略模型,评估其在复杂装配任务上的泛化与迁移能力。
背景与挑战
背景概述
该数据集由基于LeRobot框架构建,采用双柔性机器人(bi_flexiv_rizon4_rt)平台,专注于鞋垫(newbalance)的检索与包装这一精细操作任务。数据集创建于2025年5月28日,包含3个演示片段、总计16669帧,并融合了头部、左右腕部及左右触觉传感器等多模态观测数据。其核心研究问题在于如何利用多视角视觉与触觉信息,驱动双臂机器人完成高精度、协同性的抓取与操作。作为Robotics领域一个针对特定工业场景的示范性数据集,它为模仿学习、强化学习等算法的训练与评估提供了真实、多模态的基准,对推动双臂协同操作在柔性制造和精密装配中的应用具有重要意义。
当前挑战
该数据集所解决的领域问题核心在于实现高精度双臂协同操作,尤其是在鞋垫这种柔性、易变形的物体抓取与包装任务中,机器人需要精确协调左右臂的位姿与夹爪力,并融合视觉与触觉反馈以适应物体形态变化。构建过程中面临的主要挑战包括:1) 在真实物理环境中,需同步采集多个高分辨率视觉流(640x480@30fps)与触觉数据(700x400@30fps),并确保各模态数据的时间戳严格对齐;2) 双臂机器人的20维动作空间(含左右TCP位姿和夹爪位置)带来巨大的轨迹规划复杂度,且仅3个演示片段的数据量有限,需保证动作标签的一致性以避免噪声;3) 触觉图像与视觉图像的异构性增加了多模态特征融合的难度,为后续算法的泛化性和鲁棒性提出了更高要求。
常用场景
经典使用场景
在智能制造与机器人操作领域,该数据集为双机械臂协同作业提供了高保真的视觉与触觉对齐数据。其经典使用场景聚焦于鞋垫的自动化分拣与包装任务,利用多视角摄像头(头部、左右手腕)与四路触觉传感器捕捉精细操作过程中的环境状态。研究者可借助动作序列与观测状态(20维TCP位姿与夹爪开度)训练模仿学习或强化学习模型,实现从示教轨迹到自主控制的迁移,尤其适用于对柔顺性要求极高的薄片物体抓取与放置操作。
解决学术问题
该数据集系统性地解决了机器人操作中多模态感知融合与精细动作控制的学术难题。通过同步记录视觉流、触觉反馈与20维关节空间动作,它提供了研究触觉-视觉交叉模态表征学习的基准资源,弥补了现有数据集在薄片柔性物体操作上的数据匮乏。研究团队可借此探索触觉信号如何辅助克服视觉遮挡导致的位姿估计偏差,推动不确定性条件下抓取位姿优化算法的进展。
衍生相关工作
该数据集催生了一系列具有影响力的衍生工作,例如基于LeRobot框架开发的触觉引导双机械臂模仿学习基线模型,以及将缩放式动作分块策略应用于柔性物体包装的迁移学习方案。还有研究利用其触觉视频序列训练预测模型,实现操作失败前的触觉模式预警。在机器人技能泛化方面,该数据集的标准化格式(Parquet+MP4)已被用于构建多任务操作数据库的通用接口协议。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务