遇见数据集

lyl472324464/2025-11-14-twist-two-bottles-without-rinse

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,用于机器人学任务,特别是ALOHA机器人的双臂操作。它包含35个训练集,总计94946帧数据,以每秒50帧的速率记录。数据集包括机器人的状态观测(如14维关节位置)、动作控制命令(14维)、速度、力矩,以及来自四个摄像头的视频数据:高位摄像头、低位摄像头、左手腕摄像头和右手腕摄像头,所有视频分辨率为480x640。数据以Parquet格式组织,视频以MP4格式存储,适用于机器人学习和模仿学习研究。

This dataset was created using LeRobot for robotics tasks, specifically for dual-arm manipulation with the ALOHA robot. It consists of 35 training episodes, totaling 94,946 frames recorded at 50 fps. The dataset includes robot state observations (14-dimensional joint positions), action control commands (14-dimensional), velocity, effort, and video data from four cameras: cam_high, cam_low, cam_left_wrist, and cam_right_wrist, all with a resolution of 480x640. Data is organized in Parquet format, with videos stored in MP4 format, suitable for robot learning and imitation learning research.

提供机构:
lyl472324464
搜集汇总
数据集介绍
lyl472324464/2025-11-14-twist-two-bottles-without-rinse 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人灵巧操作任务——无冲洗拧转两个瓶子。数据采集采用ALOHA机器人平台,以50帧/秒的频率记录35个演示片段,共计94946帧。每个片段包含14维关节状态、动作指令、速度与力矩信息,以及来自四个视角(顶部、低处、左腕、右腕)的高清视觉记录,图像尺寸为480×640像素。数据以Parquet格式存储于200MB的文件块中,视频以AV1编码压缩为MP4格式,按片段索引分块组织,便于高效加载。
特点
数据集涵盖灵巧操作所需的完整传感模态,包括7自由度双臂关节的位置、速度与力矩,以及多视角视觉观测。动作空间与状态空间维度一致,均为14维,映射至左右臂的腰、肩、肘、前臂滚转、腕部角度与旋转、夹爪开合。视觉观测以高帧率视频序列呈现,支持基于图像的端到端策略学习。35个片段均标记为训练集,未划分验证或测试集,适用于模仿学习与行为克隆等范式。
使用方法
数据集兼容LeRobot库,可通过其数据加载器直接读取。用户需安装LeRobot后,使用`load_dataset('2025-11-14-twist-two-bottles-without-rinse')`命令获取。数据按片段索引与帧索引组织,支持随机访问与批处理。建议以训练集全部35个片段用于策略训练,利用状态或图像观测作为输入,预测14维动作指令。视觉数据解码依赖FFmpeg,需确保环境中配置AV1解码器。
背景与挑战
背景概述
该数据集创建于2025年,由Hugging Face团队基于LeRobot框架构建,聚焦于机器人双机械臂协同操作任务——无需冲洗地拧转两个瓶子。作为机器人学习领域的重要资源,它旨在解决精细操作技能中的模仿学习与行为克隆问题,尤其针对双腕协同、力矩控制等复杂情境。数据集包含35个示范片段、近9.5万帧数据,以50帧/秒的高频采集,覆盖14维关节状态、动作及四路视觉输入,为研究双臂机器人从示教中泛化操作策略提供了标准化基准,对推动家庭服务与工业装配等场景中的机器人自主操作具有显著影响力。
当前挑战
该数据集所解决的领域挑战在于双臂操作任务中精细动作的模仿学习,尤其是拧转动作需兼顾同步协调与力控精度,而传统单臂数据集无法涵盖此类交互式动态过程。构建过程中遭遇多重困难:需确保A型机器人(aloha)双机械臂的14个自由度状态与动作数据在50帧/秒高频下的精准同步;四路480p视频流(cam_high、cam_low及左右腕相机)的编码与存储需平衡200MB容量与AV1压缩效率;此外,有限35个示范片段需覆盖足够多样的拧转角度与力度,防止模型在少样本条件下陷入过拟合困境。
常用场景
经典使用场景
在机器人操作学习领域,精细操作任务一直是衡量算法性能的试金石。该数据集聚焦于双机械臂协作完成‘拧开两个免冲洗瓶盖’这一典型日常场景,记录了A L O H A机器人平台在35个回合中近10万帧的高频数据。每个回合以50帧/秒的采样率,同步采集14维关节状态、14维动作指令、14维速度与力矩信息,以及来自四路摄像头的高清视觉流。这一配置使得数据集成为模仿学习与强化学习研究的理想基准,尤其适用于多模态感知与运动控制耦合的复杂任务。研究者可利用这些时序对齐的状态-动作对,训练机器人从演示中习得精确的旋转与抓取策略,进而在丝滑转动的瓶盖型物体上复现人类般的灵巧操作。
衍生相关工作
该数据集催生了一系列具有影响力的研究分支。基于其高频时序特性,学者们开发了多种高效的行为克隆算法,如基于注意力机制的因果 Transformer 模型,以捕捉瓶颈操作中的短暂接触动力学。另一方向则是在此数据上验证了条件变分自编码器在生成多样化机器人轨迹方面的有效性,从而提升了策略在瓶盖初始位置不同时的泛化能力。此外,数据集中并行的左右臂数据还启发了双臂协同学习的范式研究,例如通过共享表征学习来解耦主从臂的依赖关系。这些工作不仅在公共基准上证明了数据集的挑战性与有效性,也反过来促进了 LeRobot 生态的成熟,使其成为机器人学习领域中不可或缺的数据孵化器。
数据集最近研究
最新研究方向
该数据集聚焦于基于模仿学习的双臂协同操作任务,以ALOHA机器人平台为核心,收集了35个拧开两个瓶盖而不冲洗的精细操作回合,共约95000帧的高频(50Hz)多视角视觉与关节状态数据。在具身智能前沿,这一方向正与“少样本灵巧操作”和“基于视频的机器人策略泛化”等热点紧密关联——研究者试图通过此类包含14维关节动作和四路摄像头(高视角、低视角、左右手腕)的密集观测数据,训练机器人理解复杂装配与家务场景中的力控与顺序逻辑。其意义在于为双臂协调、多模态感知融合以及长时间序列的决策模型提供了标准化的训练基准,推动了家庭服务机器人从简单抓取向精细操作能力的跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务