遇见数据集

NONHUMAN-RESEARCH/push_panda_toilet_paper_s3_postprocessed

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是用于机器人任务推动熊猫和厕纸的LeRobot数据集的后处理版本。数据集采用LeRobot v2.1格式,包含30个episodes,共35871帧,帧率为50 FPS。视频流包括3个摄像头视角:observation.images.ego_view、observation.images.left_wrist和observation.images.right_wrist。训练分割为0:30。数据集经过后处理,移除了陈旧的SMPL帧和废弃的episodes,并重新顺序编号episodes。仓库结构包括meta/、data/、videos/和preview/目录,其中preview子集包含代表性MP4文件,便于Hugging Face查看器预览。

This is a post-processed version of the LeRobot dataset tailored for the robotic pushing task involving a panda and toilet paper. The dataset adheres to the LeRobot v2.1 format, consisting of 30 episodes with a total of 35,871 frames at 50 FPS. The video streams encompass three camera perspectives: observation.images.ego_view, observation.images.left_wrist, and observation.images.right_wrist. The training split is specified as 0:30. The dataset has undergone post-processing to remove stale SMPL frames and invalid episodes, and the episodes were sequentially renumbered. The repository structure includes meta/, data/, videos/, and preview/ directories. The preview subset contains representative MP4 files that facilitate previewing via the Hugging Face Viewer.

提供机构:
NONHUMAN-RESEARCH
搜集汇总
数据集介绍
NONHUMAN-RESEARCH/push_panda_toilet_paper_s3_postprocessed 数据集图片
构建方式
该数据集源自LeRobot框架,专为机器人模仿学习任务设计,旨在通过遥操作实现推熊猫与卷纸的交互动作。构建过程涉及对原始采集数据进行后处理,包括剔除过时的SMPL帧与无效片段,随后对保留的有效回合进行连续编号重组。数据集严格遵循LeRobot v2.1标准格式,存储于meta/、data/与videos/目录中,其中包含30个示范回合,共计35871帧图像,并以50 FPS的帧率记录。为便于在线预览,额外配置了lightweight preview子集,内含代表性MP4视频文件。
特点
该数据集的特点在于其高密度视觉信息与结构化组织方式。其配备三路独立视频流,分别来自ego视图、左腕与右腕摄像头,能够多角度捕捉操作细节。数据集规模介于10K至100K帧之间,适合中等规模模仿学习实验。通过预配置的preview子集,用户无需下载完整数据即可在Hugging Face平台上快速浏览各视角的演示片段,降低了数据筛选与评估的成本。此外,后处理机制确保了数据质量,剔除了噪声片段,提升了训练样本的可靠性。
使用方法
在LeRobot生态系统中加载该数据集极为便捷,只需通过Python调用LeRobotDataset类,并指定数据集标识符“NONHUMAN-RESEARCH/push_panda_toilet_paper_s3_postprocessed”即可完成实例化。用户可进一步通过dataset.meta.info查看元数据信息,利用len(dataset)获取总帧数。数据集的内置分割将全部30个回合归入训练集(索引0:30),便于直接用于模仿学习或强化学习的策略训练。此外,videos/目录中的原始视频文件及parquet格式的状态-动作数据,为自定义预处理与特征提取提供了灵活接口。
背景与挑战
背景概述
在机器人学习领域,模仿学习与遥操作数据集的构建是推动灵巧操作技能迁移的关键技术路径。该数据集由NONHUMAN-RESEARCH团队创建,聚焦于“推动熊猫玩偶与卫生纸卷”这一精细操作任务,旨在为机器人行为克隆与多视角视觉运动策略提供标准化训练样本。数据集于近期完成后处理并发布,采用LeRobot v2.1格式,包含30个演示片段、总计35871帧图像,并以50Hz的频率从三台摄像机(包括自我视角与左右腕部视角)同步采集视觉信息。其发布填补了日常家居场景中非刚性物体交互与不规则目标操作任务的公共数据空白,为研究机器人从人类演示中泛化操作能力奠定了基准。
当前挑战
该数据集所解决的领域挑战包括:1)非刚性物体操作中的视觉-运动映射难题,如推动柔软或易滑动的卫生纸卷需要模型理解接触动力学与形变特性;2)多视角异质数据对齐与融合,三路视频流存在视差与光照差异,增加了策略学习的难度。在构建过程中,团队面临了以下挑战:1)原始遥操作数据包含大量因传感器同步失败导致的陈旧SMPL人体姿态帧,需设计自动化清洗流程以剔除噪声;2)部分演示片段因操作中断或目标偏离而被丢弃,导致有效片段稀疏,需重新排序并保证后处理后的时序连续性,最终仅保留30个高质量片段用于训练,数据规模(10K-100K)限制了复杂模型的泛化能力。
常用场景
经典使用场景
在机器人学习与模仿学习的前沿领域,push_panda_toilet_paper_s3_postprocessed数据集扮演着举足轻重的角色。其最为经典的使用场景当属基于视觉的机器人操控任务,特别是针对非刚性物体(如厕纸)与刚性物体(如熊猫玩偶)协同操作的学习。研究者常利用该数据集训练端到端的模仿学习模型,通过高精度遥操作采集的50 FPS多视角图像流(包括主视角与左右腕部视角),使机器人习得精准的推拉技能,进而验证算法的泛化性与鲁棒性。
解决学术问题
该数据集直面模仿学习领域两大核心学术痛点:一是如何高效获取高质量的遥操作演示数据以解决稀疏奖励问题;二是在多视角观测环境下,如何消解非刚性物体交互带来的模态混杂噪声。通过提供30条完整、去人工噪声(已剔除无效SMPL帧)的示范轨迹,它使研究者能够聚焦于隐式策略学习、行为克隆泛化等机制研究。其意义在于为少样本模仿学习和物体交互理解提供了基准,推动了从仿真环境到真实世界迁移的验证体系完善。
衍生相关工作
围绕该数据集已衍生出多项标志性工作:基于隐式空间形变建模的策略网络被提出以应对厕纸非刚性形变;多视角融合的注意力机制模型有效整合了三路相机信息,显著提升推力动作的规划精度;此外,数据后处理中的无效帧剔除方案被后续研究者采纳为遥操作数据清洗的标准范式。这些工作共同构建了从数据采集到模型部署的闭环研发框架,推动了LeRobot生态下机器人学习基准的进一步发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务