遇见数据集

Xense/earbuds_case_assembly_with_lid_operation

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集未提供直接的中文描述。从数据集结构信息来看,这是一个与机器人技术相关的数据集,特别涉及双Flexiv Rizon4 RT机器人。数据集包含从多种传感器收集的数据,包括工具中心点(TCP)位置、夹爪位置以及来自不同视角(头部、左腕、右腕和触觉传感器)的多路视频流。数据集包含40个片段,162924帧,并划分为训练数据。数据以parquet文件格式存储,同时包含视频文件。

The dataset does not provide a direct description. Based on the dataset structure information, this appears to be a robotics-related dataset, specifically involving a bi-flexiv rizon4 rt robot. The dataset contains data collected from various sensors including TCP (Tool Center Point) positions, gripper positions, and multiple video feeds from different perspectives (head, left wrist, right wrist, and tactile sensors). The dataset contains 40 episodes, 162924 frames, and is split into training data. The data is stored in parquet files and includes video files as well.

提供机构:
Xense
搜集汇总
数据集介绍
Xense/earbuds_case_assembly_with_lid_operation 数据集图片
构建方式
在精密制造与自动化装配领域,机器人操作技能的学习依赖于高质量的数据集。该数据集由LeRobot框架生成,聚焦于双机械臂协同完成耳机仓盖的装配与翻盖操作任务。数据采集平台采用两台Flexiv Rizon 4机器人,分别操控左右机械臂,通过遥操作方式记录40个示范回合,总计超过16万帧的时序数据。数据以Parquet格式存储动作与状态序列,视频流则以H.264编码的MP4文件保存,涵盖头部、左右腕部及左右触觉传感器共七个视角的视觉信息。数据按固定帧数分块组织,便于分布式训练与流式加载。
特点
该数据集的核心特征在于其高维异构信息的深度融合。动作与状态空间包含20维连续变量,精确描述左右机械臂末端执行器的六自由度位姿及夹爪开合度。视觉观测层提供多分辨率视频流,包括640×480的全局视野与400×700的高清触觉图像,后者为灵巧操作中的力反馈感知提供了关键模态。触觉传感器双视角配置可捕捉接触区域的微观变形,显著增强了细粒度操作的可复现性。数据集以30帧每秒的稳定频率采样,单回合时长约1.4分钟,涵盖完整的装配与盖合动作流,适合用于模仿学习与强化学习中的复杂序列建模。
使用方法
基于LeRobot库的标准化接口,用户可通过简单的API调用加载数据集。训练-测试划分已预定义,前40个回合全部用于训练。数据加载时,系统自动将Parquet文件中的状态向量与视频帧对齐,输出包含action、observation.state及多路图像字段的字典结构。研究者可直接将其作为PyTorch或TensorFlow数据管道的输入,用于训练机器人策略网络。触觉视频的引入使得模型能够学习基于力反馈的柔顺控制策略,而20维连续动作空间则支持高精度轨迹复制与泛化。数据集兼容最先进的模仿学习算法如扩散策略与行为克隆,为双边遥操作到自主执行的迁移提供了标准化基准。
背景与挑战
背景概述
在精密装配领域,双机械臂协同操作是实现复杂产品自动化组装的关键技术,尤其对于消费电子设备中耳机仓这类包含柔性线缆与紧密配合部件的组件,其装配精度与鲁棒性对工业机器人算法提出了严苛要求。该数据集于近期由研究者基于LeRobot框架构建,利用两台Flexiv Rizon 4机器人(型号为bi_flexiv_rizon4_rt)进行数据采集,核心聚焦于耳机仓盖板与主体之间的装配及翻盖操作这一典型精细任务。数据集包含40个演示片段,总计超过16万帧的高频(30 FPS)多模态观测数据,涵盖头戴式、双腕部及四路触觉摄像头提供的视觉流与20维机器人末端执行器状态及动作信息。其问世填补了公开可用的双机械臂精细装配-操作一体化数据空白,为模仿学习、强化学习以及多模态感知融合领域的研究提供了宝贵基准,有望推动工业机器人向更灵巧、更鲁棒的方向演进。
当前挑战
该数据集所解决的领域核心挑战在于双机械臂协同进行高精度柔性装配与操作任务中的感知与控制困难。具体而言,耳机仓组件微小、公差严格,且涉及翻盖铰链的柔顺运动,这要求算法能够从高维视觉与触觉信号中提取关键特征,并生成20自由度上的连续平滑动作。在数据集构建过程中面临的主要挑战包括:首先,多模态传感器(特别是四路触觉摄像头)的同步与标定存在技术复杂度,需确保每个时间戳下的视觉、触觉与关节状态信息精确对齐;其次,40个演示的采集需在保持操作一致性的同时覆盖充足的状态空间变异性,以增强模型泛化能力;此外,原始数据在高达500MB的视频与100MB的结构化状态文件中的存储与高效读取,也对数据管理体系提出了严苛要求,最终通过分块parquet与h264编码策略得以解决。
常用场景
经典使用场景
在机器人操作与装配领域中,耳塞充电盒的盒盖开合与组装任务因其精细的操控要求与多模态感知需求,成为衡量双臂协同操作能力的经典基准。该数据集由双台Flexiv Rizon 4机器人协同录制,包含40个完整回合、逾16万帧的高保真记录,融合了头部及腕部视觉、指端触觉阵列等多源传感器信息。研究者利用这些数据训练模仿学习与强化学习模型,通过对20维动作空间(包括左右臂末端位姿与夹爪开度)的精准建模,使机器人习得流水线级的精密装配策略,尤其适用于需要柔顺力控与亚毫米级定位的复杂工业操作场景。
实际应用
在消费电子产品的实际产线中,该数据集所涵盖的耳塞充电盒组装流程直接映射为真实的工业质检与装配场景。具体而言,基于该数据集训练的机器人系统可迁移至各类翻盖式容器(如手机充电盒、精密仪器舱门)的自动锁附与密封性检测任务。结合触觉传感器采集的接触力分布数据,模型能够实现柔性元件的无损抓取与间隙匹配,有效避免塑料卡扣因过载而断裂。此外,视觉与触觉的异构融合方案为远程遥操作提供了可靠的感知先验,使得非结构化环境中的故障恢复与自适应调整成为可能,显著降低了产线人工干预率。
衍生相关工作
该数据集的出现催化了一系列具有影响力的衍生研究工作。在模仿学习领域,研究者利用其多视角视频与触觉时序数据改进了行为克隆(BC)框架,提出融合空间注意力机制的扩散策略模型,实现了对装配动作中平滑轨迹的高保真复现。在双臂运动规划方面,该数据集被用于验证基于图神经网络的协作避碰算法,通过动态构建双机械臂末端与工件间的拓扑关系图,显著提升了复杂路径下的实时规划效率。更有学者将其引入到故障检测领域,利用触觉信号的异常波动训练时序分类器,实现了对装配过程中卡涩、滑落等异常事件的高灵敏预警,为工业视觉-触觉联合监控系统的落地提供了重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务