遇见数据集

huili_shoe_insole_retrieval_and_packing_0602

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

本数据集使用LeRobot工具创建,是一个机器人操作数据集,采用Apache-2.0许可证。数据采集自bi_flexiv_rizon4_4型双臂机器人,包含68个episodes,总计949,788帧数据,对应1个任务,所有数据均划分为训练集。数据以Parquet文件格式存储,总数据量约100 MB,并包含总大小约500 MB的配套视频文件,采集帧率为30 FPS。数据集提供了丰富的多模态观测和动作数据:动作空间是一个20维浮点向量,包括左右机械臂末端执行器的6维位姿(各3维位置和6维旋转表示)以及左右夹爪的位置;状态观测与动作空间具有相同的20维结构。图像观测包括来自7个摄像头的视频流:一个头部摄像头(分辨率640x480)、左右手腕摄像头(分辨率各640x480)、以及左右机械臂上的各两个触觉摄像头(共四个,分辨率均为700x400),所有视频均为彩色(3通道),使用h264编码。此外,数据还包含时间戳、帧索引、episode索引等元数据。该数据集适用于机器人模仿学习、强化学习、多模态感知与控制策略研究等任务。

This dataset was constructed using the LeRobot toolkit, and it is a robotic manipulation dataset licensed under the Apache-2.0 license. Data was collected from a bi_flexiv_rizon4_4 dual-arm robot, comprising 68 episodes and a total of 949,788 frames, corresponding to one single task. All data is partitioned into the training set. The core data is stored in Parquet file format, with a total size of approximately 100 MB, alongside supporting video files with a combined size of around 500 MB. The data acquisition frame rate is 30 FPS. The dataset offers rich multimodal observation and action data: The action space is a 20-dimensional floating-point vector, which includes the 6-dimensional poses of the left and right robotic arm end-effectors (each consisting of 3-dimensional position and 6-dimensional rotation representation) as well as the positions of the left and right grippers. The state observation shares the identical 20-dimensional structure as the action space. The image observations consist of video streams from 7 cameras: one head camera with a resolution of 640×480, left and right wrist cameras each with a resolution of 640×480, and a total of four tactile cameras (two mounted on each of the left and right robotic arms) all with a resolution of 700×400. All videos are 3-channel color footage encoded using the h264 standard. Additionally, the dataset contains metadata including timestamps, frame indices, and episode indices. This dataset is applicable to research tasks such as robotic imitation learning, reinforcement learning, multimodal perception, and control strategy development.

创建时间:
2026-06-02
原始信息汇总

数据集概述

  • 任务类别:机器人学(robotics)
  • 许可协议:Apache-2.0
  • 创建工具:使用 LeRobot 创建

数据集结构

  • 机器人类型:bi_flexiv_rizon4_rt(双臂 Flexiv Rizon 4 机器人)
  • 总轮次(episodes):68
  • 总帧数:949,788
  • 总任务数:1
  • 块大小(chunks_size):1000
  • 数据文件大小:约 100 MB(parquet 格式)
  • 视频文件大小:约 500 MB(mp4 格式)
  • 帧率(fps):30
  • 数据分割:全部 68 轮用于训练(train: 0:68)
  • 数据路径格式data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径格式videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

特征(Features)

动作(action)与观测状态(observation.state)

  • 数据类型:float32
  • 形状[20]
  • 包含维度:左右 TCP 位姿(x, y, z, r1-r6)、左右夹爪位置(pos)

观测图像(observation.images)

  • 头部相机(head):分辨率 480x640,3 通道,H.264 编码,30 fps
  • 左腕相机(left_wrist):分辨率 480x640,3 通道,H.264 编码,30 fps
  • 右腕相机(right_wrist):分辨率 480x640,3 通道,H.264 编码,30 fps
  • 左触觉传感器 0(left_tactile_0):分辨率 400x700,3 通道,H.264 编码,30 fps
  • 左触觉传感器 1(left_tactile_1):分辨率 400x700,3 通道,H.264 编码,30 fps
  • 右触觉传感器 0(right_tactile_0):分辨率 400x700,3 通道,H.264 编码,30 fps
  • 右触觉传感器 1(right_tactile_1):分辨率 400x700,3 通道,H.264 编码,30 fps

其他特征

  • 时间戳(timestamp):float32,形状 [1]
  • 帧索引(frame_index):int64,形状 [1]
  • 轮次索引(episode_index):int64,形状 [1]
  • 索引(index):int64,形状 [1]
  • 任务索引(task_index):int64,形状 [1]
搜集汇总
数据集介绍
huili_shoe_insole_retrieval_and_packing_0602 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人操作任务提供高质量的示范数据。数据采集自一台双机械臂平台(型号为bi_flexiv_rizon4_rt),通过遥操作方式执行鞋垫检索与包装任务。共计收录68个完整操作回合(episodes),包含949,788帧时序数据,以30帧/秒的采样频率记录。数据存储格式采用Apache Parquet与MP4视频混合结构,其中动作与状态数据以20维浮点向量描述双臂TCP位姿与夹爪开合度,视觉信息则涵盖头部、左右腕部及四组触觉传感器的多视角视频流,形成多模态感知体系。
使用方法
数据集可直接通过HuggingFace的datasets库加载,适用于基于LeRobot框架的机器人学习流水线。用户可调用Parquet文件读取动作与状态序列,结合MP4视频进行端到端的视觉运动策略训练。建议将全部68个回合按默认配置作为训练集,利用其20维动作空间进行双臂协调策略的优化。对于需要高分辨率触觉信息的场景,可直接索引left_tactile_0等键值获取触觉视频流。此外,数据集的标准化特征命名(如observation.state、action)与LeRobot的API高度兼容,支持快速搭建仿真或真实环境的评估闭环。
背景与挑战
背景概述
在机器人操作领域,从观察中学习复杂技能是实现通用机器人智能的关键路径。鞋垫检索与包装是一项典型的工业精细操作任务,它要求机器人同时具备物体识别、精准抓取与柔性装配能力。huili_shoe_insole_retrieval_and_packing_0602数据集由研究团队于2024年创建,依托LeRobot框架构建,旨在为双臂机器人学习提供一个高度真实、多模态的基准数据集。该数据集通过双Flexiv Rizon4机器人平台,采集了68个示范回合、近百万帧的高频数据,涵盖头部与左右腕部视觉、左右触觉传感器影像以及20维动作与状态信息。其发布为模仿学习与示教学习领域注入了工业级场景下的实物数据资源,推动了从仿真环境向真实制造任务迁移的研究进程。
当前挑战
该数据集试图解决的领域问题聚焦于精密装配中双臂协调操作的鲁棒学习:鞋垫材质柔性、形状易变且表面纹理复杂,使得基于视觉的检测与抓取面临遮挡与形变难题;同时,包装过程对抓取点精度与力控稳定性要求极高,传统编程难以覆盖所有工况。在构建过程中,挑战尤为显著:多路视频与触觉数据的高频同步采集需克服传感器与机械臂控制环之间的延迟差异;68个示范回合下近百万帧数据的标注与存储对系统吞吐量构成压力;此外,如何从片段化的操作回合中提取具有泛化能力的运动基元,也是后续算法设计面临的核心瓶颈。
常用场景
经典使用场景
在精密工业装配领域,双机械臂协同操作一直是机器人学研究的核心挑战。该数据集聚焦于鞋垫的检索与包装任务,为双臂协作场景提供了高保真的示范数据。经典使用场景涵盖机器人从随机堆叠的物料中精准拾取柔性鞋垫,并完成对齐、折叠与封装的全流程操作。依托于双机器人的末端执行器位姿记录、多视角视觉流与触觉传感器数据,研究者可系统训练模仿学习或强化学习模型,使智能体掌握柔性物体的灵巧操作策略。数据集中包含的68条完整轨迹,为双臂协调控制算法提供了可靠的基准,尤其适用于研究物体抓取稳定性、插入动作顺滑度以及包装流程的自动化优化。
解决学术问题
该数据集直面柔性物体操作与多机协同两大学术难题。传统机器人研究多聚焦于刚性物体的抓取,而柔性鞋垫在抓取过程中易发生形变与滑动,使得动力学建模异常复杂。精准的位姿数据与多模态感知信息为研究接触力控制、阻抗调节策略提供了关键素材,有效推动了变形体操控领域的发展。同时,双臂避碰与任务分配是协同控制的核心议题,数据集中的19维动作空间完整刻画了左右臂的协同轨迹,使研究者得以深入探究主从式控制和对称式协调机制。该数据集的公开极大促进了重复性实验与可复现研究,为学术社区提供了经标准化的数据接口,进而提升了柔性操作论文的实证可信度。
实际应用
在智能制造业场景中,该数据集承载着将传统人工装配转化为自动化产线的革命性愿景。鞋类生产企业长期面临鞋垫分拣与包装环节用工量大、效率波动显著的问题,而数据驱动的机器人系统可直接复现该数据集所建模的包装流程。实际部署时,机器人可依据视觉反馈实时调整夹爪开合度与插入角度,结合触觉信号完成毫米级精度的对位操作。数据集中含有的高分辨率触觉图像(400×700)使柔性体形变状态得以量化表征,为质检环节提供了在线监测依据。此外,勒机器人平台(LeRobot)开源的标准化格式降低了部署门槛,中小企业可基于此快速定制适用于聚氨酯、EVA等不同材质鞋垫的自动包装系统。
数据集最近研究
最新研究方向
在机器人灵巧操作与精细化装配领域,该数据集聚焦于柔性双臂机器人在鞋垫检索与包装任务中的端到端模仿学习。通过搭载高分辨率触觉传感器与多视角视觉系统,数据集记录了68个完整演示片段,包含近95万帧高维时空序列数据,融合了20维动作空间与状态空间。这一前沿方向紧密关联了工业4.0背景下柔性制造与仓储自动化的变革需求,为研究触觉-视觉融合感知、双臂协调控制及动态任务规划提供了宝贵的基准。特别是其包含的多模态触觉图像,为探索机器人对柔软易变形物体的精细抓取与灵巧包装开辟了新路径,推动机器人物体操作研究从刚性物体向复杂柔性物料迈进,具有显著的实践意义与学术价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务