遇见数据集

Xense/assemble_box_with_phone_stand0430_merged

收藏
Hugging Face2026-05-27 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人数据集,包含来自双flexiv rizon4 rt机器人的数据。数据集包括动作、观察(状态和来自多个摄像头的图像)以及时间戳。共有116个片段,总计1,122,623帧,帧率为30 fps。数据以parquet文件格式存储,并包含视频文件。

This dataset is a robotics dataset created using LeRobot, containing data from a bi-flexiv rizon4 rt robot. The dataset includes actions, observations (state and images from various cameras), and timestamps. There are 116 episodes in total, with 1,122,623 frames at a frame rate of 30 fps. The data is stored in parquet files and includes video files.

提供机构:
Xense
搜集汇总
数据集介绍
Xense/assemble_box_with_phone_stand0430_merged 数据集图片
构建方式
该数据集依托于LeRobot框架构建,旨在为双臂协作机器人(bi_flexiv_rizon4_rt)提供精细操作任务的训练与评估数据。数据采集过程包含152个完整演示片段(episodes),总帧数达1,458,803帧,采样频率为30帧/秒。每个片段记录了机器人从初始状态到完成“组装盒子与手机支架”任务的完整轨迹。数据存储采用分块(chunk)方式,将运动状态与视觉观测分离保存:动作指令与关节状态以Parquet格式结构化存储于`data/`目录下,而多视角视频流则压缩为H.264编码的MP4文件存放于`videos/`路径中,兼顾了数据读取效率与存储空间的优化。
使用方法
该数据集可通过LeRobot库高效加载。用户需先安装LeRobot,随后使用`lerobot.Dataset`接口指定`repo_id`为`assemble_box_with_phone_stand0430_merged`,即可自动下载并解析数据。加载后,数据集返回标准的Dict结构,包含`action`、`observation.state`及各视频流键。对于视频数据,LeRobot支持按需解码,避免一次性将全部帧读入内存。典型使用流程包括:提取`episode_index`进行情节分割,将`observation.images.*`与`observation.state`拼接为观测空间,配对对应时间步的`action`作为监督信号,从而直接用于训练行为克隆(BC)、扩散策略(DP)或隐式Q学习(IQL)等算法。
背景与挑战
背景概述
该数据集创建于2024年,由Hugging Face社区基于LeRobot框架构建,专注于机器人操作领域的精细技能学习。核心研究问题聚焦于双机械臂协作场景下,如何通过多模态感知数据(包括视觉、触觉及关节状态)实现高精度零件装配任务。数据集以152个完整片段、超过145万帧的庞大规模著称,采用仿人操作的‘收集与展示’范式,记录了双臂末端执行器的20维动作空间与6路高清视频流(含头部、腕部及触觉传感器视角)。其发布填补了多指机操作中多传感器融合与灵巧操作数据稀缺的空白,为模仿学习、强化学习及具身智能算法提供了标准化评测基准,有力推动了机器人从感知到动作的端到端泛化能力研究。
当前挑战
该数据集致力于解决双重挑战:领域层面,机器人精细装配任务要求系统兼顾空间精度(亚毫米级TCP控制)与柔顺性,传统规划方法难以应对强约束的非线性接触动力学,而当前多模态数据(如触觉信号)与高维动作空间的高效融合仍是技术瓶颈;构建层面,数据采集需在真实环境下同步控制异质传感器(7路视频+20维关节状态),确保152个片段中时域一致性不因位姿漂移或光照变化而退化,同时触觉图像的纹理-力映射标定误差可能引入噪声,需通过严格的重采样与异常帧过滤保证信噪比。
常用场景
经典使用场景
在机器人学研究领域,双臂灵巧操作一直是极具挑战性的课题,尤其是在需要精密装配与柔性操作的场景中。assemble_box_with_phone_stand0430_merged数据集专为双臂机器人(bi_flexiv_rizon4_rt)设计,记录了152个完整演示片段,总计超过145万帧的高频数据(30fps),涵盖双手末端执行器的六维位姿、夹爪开合状态,以及来自头部、左右手腕和四个触觉传感器的多视角视频流。其经典用途在于为模仿学习与行为克隆提供高质量的训练典范,使机器人能够从人类演示中习得将手机支架精准装入包装盒的细腻技能。研究者可通过该数据集训练端到端策略网络,学习协调双臂在三维空间中的同步运动与控制力度的微妙平衡,从而复现乃至超越演示中的柔顺装配动作。
解决学术问题
该数据集针对长期困扰学术界的双臂灵巧操作中精密装配任务的模仿学习难题提供了关键支撑。经典研究问题包括:如何在高维状态-动作空间中有效捕获复杂接触约束下的时序依赖关系?如何在仅有稀疏奖励信号的情况下引导策略收敛至亚毫米级装配精度?其意义在于首次公开了包含触觉模态与多目视觉的双臂装配演示数据,为解耦刚性物体接触动力学与几何可行性约束提供了基准。影响深远的是,它促进了逆强化学习从演示中重构奖励函数方法的突破,并推动了基于残差策略的迁移学习在双臂系统上的应用,使机器人能适应微小零件间隙与材料形变带来的变异性。
实际应用
实际应用场景聚焦于消费电子产品的自动化柔性装配产线。以智能手机支架的包装工序为例,该数据集赋能机器人系统自主完成从抓取、对位到压入卡槽的全流程,避免了传统工业机器人在同类任务中因位置偏差导致零件损坏的高发问题。得益于数据集中触觉传感器记录的力/接触信息,机器人在装配过程中可实时检测接触状态,动态微调操作策略以应对包装盒公差波动。这一能力可延伸至汽车线束插接、医疗耗材包装等需要力控柔顺性的领域,将精密装配的人工干预率显著降低。
数据集最近研究
最新研究方向
该数据集聚焦于双臂机器人精细操作领域,针对手机支架装配这一典型工业与家庭场景,构建了包含152个示范回合、超过140万帧的高质量多模态演示数据。依托LeRobot框架,数据集整合了双目视觉、腕部摄像头与四路触觉传感器信息,并记录了20维动作与状态序列,为模仿学习与技能迁移研究提供了丰富基准。当前,机器人灵巧操作正迈向多模态感知融合与跨任务泛化,该数据集以其精细装配任务和详细的开源配置,顺应了从单一抓取向复杂装配演进的趋势,有望在零样本模仿、触觉-视觉联合表征及双臂协同策略学习等前沿方向发挥关键作用,推动具身智能在制造与服务业中的实际落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务