遇见数据集

jellyho/droid_merged_skills_stacking

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集合并了一个经过语言筛选的DROID技能子集与新收集的相同技能的环境数据,专注于机器人堆叠任务。它整合了来自多个来源的演示数据,用于训练和评估机器人学习堆叠技能,支持基于关节速度和夹爪位置的动作表示。数据集包含多个任务实例和视频数据,适用于机器人学习研究。

This dataset merges a language-filtered DROID skill subset with newly collected environment data for the same skill.

提供机构:
jellyho
搜集汇总
数据集介绍
jellyho/droid_merged_skills_stacking 数据集图片
构建方式
在机器人操作技能学习领域,高质量的多模态数据集对于模仿学习与强化学习的模型训练至关重要。DROID Merged Skills Stacking 数据集通过融合语言过滤后的DROID技能子集与针对同一技能新采集的环境数据构建而成,整合自两个来源:Jellyho/droid_subsets_stacking(299个episodes)与Jellyho/droid_stack_bar(20个episodes),总计形成319个episodes、61511帧的高质量数据。数据集以标准化LeRobot格式存储,采用8维联合状态与动作空间表示,其中状态由7个关节位置与1个夹爪位置构成,动作则由7个关节速度与1个夹爪位置组成,并保留了详尽的原始列信息以供研究者灵活使用。
特点
该数据集聚焦于堆叠(stacking)这一精细操作技能,涵盖301个独特任务,任务描述丰富多样,如将黄色条块堆叠在红色立方体上、将杯子从顶部移到底部等。数据包含左右两个视角的视觉观测(wrist_left与side_view_left摄像机),总计638个视频片段,为多模态学习提供了丰富的视觉与运动模态信息。数据集采用Apache-2.0许可开放使用,所有数据以parquet文件和mp4视频格式整理,并附带完整的元数据文件(包括info.json、tasks.jsonl、episodes.csv等),便于研究者快速检索与组织训练流程。
使用方法
研究者可通过Hugging Face仓库Jellyho/droid_merged_skills_stacking直接加载数据集,使用LeRobot框架(v2.1版本)进行标准化处理。数据以8维向量表征状态与动作,适用于模仿学习、行为克隆、离线强化学习等范式。使用时需注意动作来源于两个不同采集渠道:DROID子集的动作由关节速度与夹爪位置推导,而新采集数据则从观测的关节速度前7维与原始动作向量的夹爪位置合成。数据目录包含episodes.csv、merge_summary.json等摘要文件,可辅助构建训练与验证集划分。视频键包含wrist_left与side_view_left两个视角,便于进行视觉-运动联合建模或基于图像的策略学习。
背景与挑战
背景概述
在机器人学习领域,技能泛化与数据多样性始终是制约智能体从仿真走向真实世界的核心瓶颈。为突破这一困局,研究者们致力于构建大规模、多模态的机器人操作数据集。DROID(Diverse Robot Interactive Operations Dataset)项目由来自多所顶尖机构的研究人员于近年发起,旨在通过众包方式收集涵盖丰富场景与任务的机器人交互数据。基于此,本数据集创建了名为“droid_merged_skills_stacking”的合并技能子集,由Jellyho等研究者主导,通过语言过滤与新增环境数据相结合的手段,聚焦于“堆叠”(stacking)这一典型操作技能。该数据集共包含319个回合、61511帧画面以及301个独特任务,其标准化后的状态与动作空间遵循紧凑的8维向量表示,为研究机器人堆叠操作提供了高质量基准。该数据集的推出不仅填补了DROID在特定技能上的精细化标注空白,更推动了机器人学习在数据融合与技能迁移研究领域的进展。
当前挑战
本数据集所面对的挑战体现在两个层面。在领域问题层面,机器人堆叠操作涉及精细的力控制、位姿估测及抗干扰能力,而现有模型常因训练数据中任务描述与动作执行的对应关系模糊,导致泛化性能不足。数据集中“将黄色条块叠放在红色立方体上”等高度具体的语言指令,虽提升了任务可理解性,却对模型的语言-动作联合表征能力提出了严苛要求。在构建过程中,挑战源于多源数据的高效融合:原始DROID子集与新采集环境数据在动作空间定义上存在差异(前者使用joint_velocity与gripper_position,后者需从观测速度向量中提取),需设计统一映射规则以避免信息失真。此外,多视角视频(手腕与侧视)的同步对齐、任务标签的一致性校验,以及数据量不平衡(如主流任务“堆叠黄色条块”占20个回合,其余任务仅1个回合)的应对策略,均对数据集的构建质量构成了考验。
常用场景
经典使用场景
在机器人学习领域,该数据集常被用于训练机械臂执行精细的堆叠操作技能。它整合了DROID子集与新采集的环境数据,提供了319个高质量演示片段,涵盖301种不同任务指令,如“将黄色条块堆叠在红色立方体上”或“按顺序叠放杯子”。研究人员可借助其标准化的8维状态-动作空间(包含关节位置和夹爪状态),直接训练模仿学习或强化学习模型,使其学会从多视角视觉输入中感知物体位置并生成精确的夹爪控制与关节速度指令。
衍生相关工作
基于该数据集,衍生了一系列代表性工作:一是利用隐式分治策略的层级模仿学习框架,将堆叠任务分解为抓取-抬升-放置子阶段;二是结合扩散策略的视觉运动模型,通过去噪过程生成平滑的关节速度轨迹;三是多任务微调方法,将预训练的大语言模型与机器人策略耦合并实现语言指令驱动的堆叠操作。此外,该数据集的标准化格式已被LeRobot社区采纳,成为评估机器人操纵算法性能的基准之一。
数据集最近研究
最新研究方向
在机器人技能学习领域,面向堆叠类复杂操作任务的精细化数据集构建正成为前沿热点。droid_merged_skills_stacking数据集创新性地将经语言过滤的DROID子集与针对同一技能新采集的环境数据有机融合,形成了含319个示范片段、超6万帧的标准化多模态资源库。该数据集以关节速度与夹爪位置联合编码的紧凑动作表征为特色,并保留了原始感知与运动信息的分列存储,为高效训练机器人学习堆叠任务提供了兼具规模与质量的训练基础。结合多视角视觉输入,研究者可在此数据驱动下探索技能泛化与跨场景迁移等前沿问题,对于推动机器人由精准规定操作向复杂场景中的灵活堆叠行为演化具有重要支撑作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务