遇见数据集

jellyho/droid_merged_skills_wiping

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个合并的DROID技能数据集,专注于擦拭技能。它通过合并一个经过语言过滤的DROID技能子集(来自jellyho/droid_subsets_wiping)和针对同一技能新收集的环境数据(来自jellyho/droid_wipe_table)而构建。数据集用于机器人学任务,特别是擦拭操作,如使用毛巾擦拭桌子等。数据经过处理,标准化为LeRobot训练字段,使用8D向量表示观测状态(包括关节位置和夹爪位置)和动作(包括关节速度和夹爪位置)。数据集包含319个episodes、80582帧、300个独特任务,状态和动作形状均为[8],并提供了视频数据(如手腕左侧和侧视图像)。数据集文件包括parquet文件、元数据JSON文件、CSV文件和视频文件。

This is a merged DROID skill dataset focused on the wiping skill. It is constructed by merging a language-filtered DROID skill subset (from jellyho/droid_subsets_wiping) with newly collected environment data for the same skill (from jellyho/droid_wipe_table). The dataset is designed for robotics tasks, specifically wiping operations such as using a towel to wipe a table. The data is processed and standardized into LeRobot training fields, using 8D vectors for observation state (including joint positions and gripper position) and action (including joint velocities and gripper position). The dataset includes 319 episodes, 80582 frames, 300 unique tasks, with state and action shapes of [8], and provides video data (e.g., wrist left and side view images). Dataset files consist of parquet files, metadata JSON files, CSV files, and video files.

提供机构:
jellyho
搜集汇总
数据集介绍
jellyho/droid_merged_skills_wiping 数据集图片
构建方式
该数据集通过合并两个来源的擦拭技能数据构建而成:其一是基于语言筛选的DROID子集,包含300个示范片段;其二是针对同一技能新采集的环境数据,包含19个示范片段。两个来源的数据在保留原始详细列(如关节位置、关节速度、夹爪位置等)的基础上,统一标准化为紧凑的LeRobot训练格式,即8维观测状态向量和8维动作向量,从而实现了数据的无缝融合与高效兼容。
特点
数据集汇集了总计319个示范片段、80582帧图像,覆盖300个独特的擦拭类任务,任务描述具体多样,如'用毛巾擦拭桌子'、'拿起刷子清扫纸片'等。每个片段均包含两个视角的视觉输入(左腕相机和左侧视图),形成638段视频,为机器人模仿学习提供了丰富的多模态感知数据。其动作空间采用关节速度与夹爪位置联合控制,兼具通用性与精细操作能力。
使用方法
该数据集适用于基于LeRobot框架的机器人技能学习,可直接加载标准化后的8维状态与动作向量进行策略训练。用户既可使用Hugging Face仓库中的parquet文件和视频进行离线训练,也可通过本地路径访问已合并的完整数据集。配合元数据文件(如episodes.jsonl、tasks.jsonl),研究者还能按任务类型灵活筛选数据,聚焦特定擦拭场景的泛化学习。
背景与挑战
背景概述
在机器人学习领域,从人类演示中获取多样化、可复用的技能数据是推动泛化能力发展的关键。近年来,大规模开源数据集如DROID的出现,为多任务机器人操作提供了丰富的训练样本,但原始数据中混杂的无关技能与稀疏的有效标注限制了模型在特定任务上的性能提升。为应对这一挑战,研究人员Jelly Ho及其团队于2024年发布了droid_merged_skills_wiping数据集,该数据集隶属于LeRobot v2.1框架,专注于“擦拭(wiping)”这一基础操作技能。通过从DROID数据集中提取语言过滤后的300条擦拭子集,并补充19条新采集的环境数据,合计形成319个片段、超过8万帧的高质量演示数据。该数据集以8维状态-动作空间(关节位置与夹爪位置/速度)统一表征,并配备左腕与侧视双视角视频,为学习精细的擦拭运动策略提供了标准化基准,对推动机器人操作技能迁移与少样本泛化研究具有重要参考价值。
当前挑战
该数据集旨在解决的核心领域挑战在于,如何在非结构化的日常环境中实现机器人对“擦拭”这一交互式技能的高效学习与泛化。擦拭任务涉及与不同材质表面、工具(如毛巾、海绵、刷子)及污渍类型的动态接触,要求机器人具备灵巧的力控与轨迹规划能力,而原始DROID数据中相同技能的执行方式参差不齐,语言描述与动作标签的噪声增加了学习难度。在构建过程中,面临的主要挑战包括:跨数据源的异构动作表示对齐问题——新采集数据需将关节速度与夹爪位置从不同传感器格式统一映射为标准化动作向量;数据稀缺性问题——单次语言过滤后仅有300条相关样本,需额外收集19条环境数据以补足长尾分布;以及多视角视频的同步与压缩存储,以避免大规模高维视觉数据带来的计算瓶颈。这些因素共同制约了数据集规模与技能覆盖的平衡,也突显了精细技能数据集构建的复杂性。
常用场景
经典使用场景
在机器人学习领域,droid_merged_skills_wiping数据集专为技能复用与泛化研究而设计,其经典使用场景聚焦于“擦拭”操作的学习与迁移。该数据集整合了从DROID滤出的语言子集与新采集的同一技能环境数据,提供了319个回合、超过8万帧的示范,涵盖300种独特任务指令。研究者常利用此数据集训练模仿学习模型,使机器人学会通过多视角视觉与8维关节-夹爪动作空间,将语言指令映射为具体的擦拭行为,如清洁桌面、擦拭盘子或扫除碎屑,从而验证模型在可变场景下对同一技能的适应能力。
衍生相关工作
该数据集衍生了多项开创性研究工作,主要集中在基于语言指令的机器人多技能学习框架。例如,研究者借鉴其合并策略,提出了跨技能数据集融合方法,以扩展LeRobot生态中的行为库。此外,该数据集的8维动作空间格式被用于改进联合速度控制策略的监督学习,促进了基于能量模型的动作生成方法在擦拭任务中的应用。相关论文还探索了利用其多视角视频数据训练语义感知的视觉表征,以增强机器人对目标物与工具状态的识别,从而推动自主决策系统在非结构化环境中的发展。
数据集最近研究
最新研究方向
在机器人学习领域,针对复杂操作技能的数据集构建正从大规模、多样化收集转向精细化、技能特定化的整合策略。droid_merged_skills_wiping数据集聚焦于“擦拭”这一日常操作,通过融合语言过滤后的DROID子集与专门收集的环境数据,旨在提升技能学习的样本效率与任务泛化性。其标准化了8维联合-夹爪状态与动作空间,为模仿学习与行为克隆提供了紧凑且一致的输入表示,尤其适用于研究联合速度控制与夹爪位置协调的细粒度动作生成。该数据集的出现呼应了机器人从实验室任务向真实家庭场景迁移的前沿需求,为探索稀疏奖励下的技能习得、跨任务知识迁移以及视觉-运动控制的端到端学习提供了关键的数据支撑,推动了操作技能数据集从“量”的积累向“质”的精炼转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务