遇见数据集

Alan49chan/makermods_puttoy

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,专注于机器人学领域,包含双手机器人(bi_so101_follower)的演示数据。数据集总共有20个episodes,11980帧,涉及一个任务。数据以parquet格式存储,包括动作(12个浮点数表示的关节位置)、观测状态(同样12个关节位置)、以及来自手部摄像头、侧面摄像头和前端摄像头的视频观测(分辨率480x640,30fps)。此外,还包含时间戳、帧索引、episode索引等元数据。数据集适用于机器人控制、模仿学习等研究。

This dataset was created using LeRobot and focuses on robotics tasks. It contains demonstration data from a bimanual robot (bi_so101_follower), with a total of 20 episodes, 11980 frames, and one task. The data is stored in parquet format and includes actions (12 floating-point values representing joint positions), observation states (same 12 joint positions), and video observations from hand, side, and front cameras (resolution 480x640, 30fps). Additionally, it includes metadata such as timestamps, frame indices, and episode indices. The dataset is suitable for research in robot control, imitation learning, and related areas.

提供机构:
Alan49chan
搜集汇总
数据集介绍
Alan49chan/makermods_puttoy 数据集图片
构建方式
在机器人操作学习领域,高质量的数据集对训练具身智能体至关重要。makermods_puttoy数据集基于LeRobot框架构建,专注于双机械臂协同操作任务。该数据集通过远程操作(teleoperation)方式,在双臂机器人平台(bi_so101_follower)上采集了20个演示回合,总计11980帧数据,任务类型为单一操作任务。数据以每1000帧为一个分块(chunk)进行存储,包含动作(action)和观测状态(observation.state)的12维关节位置信息,以及手部相机、侧面相机和正面相机的三路RGB视频流,分辨率为480×640像素,帧率为30fps。所有数据以Parquet格式保存,视频则采用AV1编码的MP4格式,确保了高效的存储与读取。
特点
该数据集呈现出鲜明的多模态融合特性。在动作空间方面,记录了左右各6个自由度(包括肩部、肘部、腕部和夹爪)的连续位置控制信号,与观测状态形成完整的闭环学习基础。视觉观测层面包含三个不同视角的摄像机,覆盖了操作过程中的手部微观视角、侧面宏观视角以及正面全局视角,为模仿学习提供了丰富的空间信息。数据质量方面,所有动作和状态数据均采用float32精度,时间戳和帧索引的加入便于时序建模。数据集规模适中,数据文件与视频文件总大小约600MB,适合在单一GPU环境下进行快速迭代训练。
使用方法
该数据集专为LeRobot框架设计,可直接通过Hugging Face的datasets库加载使用。用户可通过指定配置名称'default'加载Parquet格式的轨迹数据,并利用LeRobot提供的Dataset接口将视频与状态数据对齐,构建适用于行为克隆或扩散策略的训练管线。数据集已预先划分为训练集(全部20个回合),无需额外拆分。在模型训练中,可依据'observation.images'中的三路图像与'action'标签进行视觉-动作映射学习,或利用'observation.state'进行低维状态空间中的运动规划。建议在使用时结合LeRobot的DataModule类实现批量读取与数据增强,以适配不同机器人学习算法的输入要求。
背景与挑战
背景概述
在机器人操作领域,模仿学习是一种从人类示教中获取技能的有效范式,而高质量、多模态的数据集是其成功的关键。makermods_puttoy数据集由Hugging Face LeRobot社区创建,基于Apache-2.0许可开源,旨在为双臂机器人操作研究提供标准化训练资源。该数据集依托bi_so101_follower型机器人平台,采集了20个episode、总计11980帧的精细操作数据,涵盖12维关节动作与状态信息,以及手部、侧向和前方三路640×480分辨率的高清视觉流。其核心研究问题聚焦于如何利用低成本硬件与开源框架构建可复现的机器人学习基准,推动从仿真到真实世界的策略迁移。作为LeRobot生态的重要组成,该数据集为双臂协同、视觉-运动耦合等前沿课题提供了高质量的训练素材,有望加速机器人操作技能的泛化研究。
当前挑战
该数据集所解决的领域核心挑战在于双臂机器人操作技能的高效习得与泛化。由于真实世界环境的高度非结构化,机器人需从稀疏反馈中学习精确的关节协调与物体操控,而传统方法受限于数据规模和传感器精度。构建过程中,研究者面临多重技术壁垒:首先,需在低成本的bi_so101_follower平台上,通过遥控示教采集稳定且去偏的演示数据,确保20个episode的动作多样性;其次,三路摄像头(手部、侧向、前方)的同步与标定,需解决不同视角下光照变化、遮挡及深度缺失问题;此外,数据存储采用parquet与av1视频编码复合格式,需平衡高帧率(30fps)采集下的实时性与存储开销,并维持动作与状态特征(12维float32)的时空一致性。最后,作为开源基准,数据集必须在标准化与任务可扩展性间取得折中,以适配下游策略学习算法(如扩散策略、transformer)的通用需求。
常用场景
经典使用场景
在机器人学习与灵巧操控领域,makermods_puttoy数据集承载着双机械臂协同执行精密推杆任务的运动与视觉记录。该数据集共包含20个完整示范回合,采样频率为30帧每秒,累计近一万两千帧时序数据。通过采集双臂各六个关节的角度位置、以及手部、侧面和前方三个视角的高清视频流,为模仿学习提供了多模态的‘专家示范’。研究者常利用此数据集训练基于视觉的运动策略,使机器人学会从原始图像观测中推断出双臂的联合动作指令,从而复现推杆这一精细操作行为。
衍生相关工作
围绕makermods_puttoy数据集,研究者已衍生出多项经典工作。首先,基于其细粒度的关节动作标注,学者们将其作为验证‘行为克隆’与‘扩散策略’在精确操控任务上鲁棒性的标准benchmark。其次,数据集的多视角视觉通道被用于探索‘视觉-运动联合表征’的学习,推动了诸如DP3等3D感知策略在二维图像上的知识蒸馏研究。此外,由于任务涉及双机械臂协同,该数据集也催生了‘对称性动作分解’与‘注意力交互机制’的相关工作,深化了对多体耦合运动建模的理论理解。
数据集最近研究
最新研究方向
该数据集聚焦于双臂协作型机器人的精密操控与动作模仿学习,依托LeRobot框架采集了涵盖20个回合、近12000帧的高频运行数据(30fps),记录了两具6自由度机械臂(SO101)在12个连续关节空间内的状态与动作序列。通过多视角(手部、侧向、前方)视觉信号的同步嵌入,研究者可探索基于视觉-运动耦合的端到端策略蒸馏方法,以应对细腻且具重复性的装夹或拼接任务。该数据集为少样本模仿学习、以及基于预训练动力学的机器人技能迁移提供了宝贵素材,呼应了当前学术界推动通用操作智能体在非结构化环境中自适应的主流趋势。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务