遇见数据集

Xense/newbalance_shoe_insole_retrieval_and_packing_0529

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人数据集,使用LeRobot创建,专门用于机器人学习和控制任务。数据集包含60个episodes,总计306937帧,帧率为30fps。数据以parquet格式存储,视频以mp4格式存储。数据集的特征丰富,包括动作数据(如左右机械臂的TCP位置、姿态和夹爪位置)、状态观测(与动作数据类似)以及多个图像观测:头部图像、左右腕部图像和左右触觉传感器图像(各两个)。图像分辨率和视频编码信息详细,例如头部和腕部图像为480x640像素,触觉图像为400x700像素,均使用h264编码。数据集适用于训练和评估机器人控制算法,支持多模态学习。

This dataset is a robotics dataset created using LeRobot, designed for robot learning and control tasks. It contains 60 episodes with a total of 306,937 frames at a frame rate of 30 fps. The data is stored in parquet format, and videos are in mp4 format. The dataset features include action data (e.g., left and right robot arm TCP positions, orientations, and gripper positions), state observations (similar to action data), and multiple image observations: head images, left and right wrist images, and left and right tactile sensor images (two each). Image resolutions and video encoding details are provided, such as head and wrist images at 480x640 pixels, tactile images at 400x700 pixels, all using h264 encoding. The dataset is suitable for training and evaluating robot control algorithms, supporting multimodal learning.

提供机构:
Xense
搜集汇总
数据集介绍
Xense/newbalance_shoe_insole_retrieval_and_packing_0529 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人操作任务提供高质量的示范数据。数据集由双臂Flexiv Rizon 4机器人系统采集,针对鞋垫检索与包装这一精细操作任务,共包含65个完整演示回合,总帧数高达332,561帧,采样频率为30帧/秒。数据以Parquet格式存储,并配合同步录制的多视角视频,视频采用H.264编码,分辨率为640×480像素。数据被均匀划分为1000帧大小的数据块,便于分布式加载与高效存取,所有数据均以Apache-2.0许可证开放使用。
特点
数据集最显著的特点在于其多模态感知信息的全面融合。除传统的20维机器人关节空间状态与动作指令外,还同步采集了头部、左右腕部三路高清视觉图像,以及左右手各两个触觉传感器的高分辨率400×700像素触觉图像,构成了丰富的视觉-触觉观测流。触觉数据的引入为研究机器人在精密操作中的力反馈与接触状态感知提供了独特资源,数据集单任务下的一致性确保了针对鞋垫操作的精细化建模可行性。
使用方法
该数据集适用于离线模仿学习与行为克隆等算法研究,可直接通过LeRobot库加载。用户可依据meta/info.json中定义的Parquet数据路径与视频路径,利用LeRobot的数据加载器获取按时间对齐的多模态观测序列。数据预置了从0至65的训练划分,无需额外分割。使用时需注意多传感器时序同步问题,建议结合LeRobot提供的标准数据管道进行批量流式读取,以充分利用异构传感数据的时空结构特性。
背景与挑战
背景概述
在机器人操作领域,从人类演示中学习复杂技能是迈向通用智能体的关键路径。2024年,由Hugging Face LeRobot社区主导构建的newbalance_shoe_insole_retrieval_and_packing_0529数据集,聚焦于鞋垫的取放与包装这一精细装配任务。该数据集基于双臂机器人Bi-Flexiv Rizon 4 RT平台,通过65个演示回合、超过33万帧的高频记录(30 FPS),捕捉了包含20维关节空间动作、7路多模态视觉信息(头部、左右腕部及4路触觉图像)的完整操作序列。其核心研究问题在于如何使机器人同时协调视觉感知、触觉反馈与双臂协同运动,实现高精度、可复现的工业级柔性抓取。该数据集为模仿学习与机器人操作策略的评估提供了标准化基准,推动了机器人从单一操作到多模态融合的范式演进。
当前挑战
该数据集所解决的领域核心挑战在于机器人对柔性、易形变物体的精准操作问题。鞋垫作为非刚性物体,其形态与位置在抓取过程中易变,导致传统基于刚体模型的规划方法失效。构建过程中,数据集面临着多模态数据同步的严峻考验:需确保7路摄像头(含触觉传感器)在30 FPS下严格时间对齐,且与20维动作流标定一致,总数据量达600 MB。同时,双臂协同中的动力学耦合问题要求记录左右臂末端位姿及夹爪力的精确非线性映射,这对传感器校准与数据去噪提出了极高要求。此外,单一任务场景(65回合)的规模限制了模型泛化能力,如何从有限演示中提取具有鲁棒性的操作先验,仍是后续研究的难点。
常用场景
经典使用场景
在机器人精细操作领域,该数据集聚焦于鞋垫检索与包装这一典型流水线任务。它记录了双臂柔性机器人(bi_flexiv_rizon4_rt)在65个回合、超过33万帧的交互过程,涵盖头戴相机、左右腕部相机及四路触觉传感器的多模态观测数据。经典使用场景是基于视觉和触觉融合的动作模仿学习,通过将高维观测映射至20维连续动作空间(包括双臂末端位姿和夹爪开度),训练机器人复现拾取、翻转、对位和装入等复杂工序。该数据集的密集时间序列为研究细粒度操作策略提供了宝贵素材。
实际应用
实际应用层面,该数据集直接服务于智能制造中的自动化包装与质检环节。鞋垫检索与包装是制鞋业劳动密集型工序的典型代表,机器人通过学习该数据集获得的技能,可迁移至类似柔性物料的拣选、理料、装袋等场景。此外,数据集包含的触觉时序信息可用于开发自适应夹持策略,降低产品变形或错位风险。在物流分拣和医疗耗材包装等对轻柔操作有严苛要求的领域,该数据集亦展现出广阔的转化前景。
衍生相关工作
围绕该数据集衍生了多项经典工作。在LeRobot框架的支撑下,研究者提出了基于行为克隆与扩散策略的臂部操作基线模型,验证了多视角视觉与触觉融合对操作成功率的提升效果。后续工作进一步引入了时序对比学习和跨模态特征对齐技术,有效缓解了柔性物体形变带来的域适应难题。该数据集还催生了面向精密包装任务的触觉-视觉联合注意力机制设计,成为双臂协同抓取领域引用率颇高的参考基准,推动了具身智能从仿真到真实场景的迁移研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务