遇见数据集

jellyho/droid_merged_skills_scooping

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个合并的DROID技能数据集,专注于舀取(scooping)技能。它合并了一个经过语言过滤的DROID技能子集和针对同一技能新收集的环境数据。数据集用于机器人学习任务,状态和动作被标准化为8维向量:观测状态包括关节位置0-6和夹爪位置,动作包括关节速度0-6和夹爪位置。数据集包含319个episodes、102576帧、301个独特任务,提供视频键如observation.images.wrist_left和observation.images.side_view_1_left,以及相关文件如parquet数据文件和MP4视频文件。

This dataset merges a language-filtered DROID skill subset with newly collected environment data for the same skill. It focuses on the scooping skill for robotics learning, with standardized 8D vectors for observation state (joint positions 0-6 and gripper position) and action (joint velocities 0-6 and gripper position). The dataset includes 319 episodes, 102576 frames, 301 unique tasks, video keys such as observation.images.wrist_left and observation.images.side_view_1_left, and files like parquet data and MP4 videos.

提供机构:
jellyho
搜集汇总
数据集介绍
jellyho/droid_merged_skills_scooping 数据集图片
构建方式
本数据集“droid_merged_skills_scooping”由两部分融合而成:一部分源自经过语言筛选的DROID技能子集“jellyho/droid_subsets_scooping”,另一部分为针对同一技能新采集的环境数据“jellyho/droid_scoop_candy”。通过整合共计319个episode,该数据集实现了对舀取动作(scooping)的精细化覆盖,其中语言筛选子集贡献300个episode,新采集数据贡献19个episode。在构建过程中,动作空间被标准化为8维向量,原始DROID子集的动作来源于关节速度与夹爪位置,而新采集数据则从观测的关节速度及原始动作向量中的夹爪位置推导得出,确保了不同来源数据的统一性与可比性。
使用方法
本数据集适用于基于LeRobot框架的机器人技能学习训练,用户可通过访问Hugging Face仓库直接下载parquet格式的数据文件和对应视频。在数据使用过程中,用户应读取标准化后的观测状态与动作向量,其维度均为8,包含关节位置与夹爪位置信息。推荐利用任务描述中的自然语言指令进行条件化策略训练,或采用模仿学习方法从专家演示中学习舀取动作。数据集支持多视角视觉输入,用户可结合左右摄像机图像进行端到端学习。使用前需安装LeRobot代码库并确保版本为v2.1以上,同时按episode划分进行批次加载与评估。
背景与挑战
背景概述
在机器人学习领域,模仿学习与技能迁移的泛化能力长期受制于数据稀缺性与任务多样性之间的矛盾。为此,研究者致力于构建大规模、多任务的操作数据集,以推动具身智能体的技能习得效率。jellyho团队基于DROID大规模机器人数据集,于近期筛选并扩充了与“舀取”(scooping)技能相关的子集,形成了droid_merged_skills_scooping数据集。该数据集由300条DROID原始语言过滤轨迹与19条新采集的环境数据组成,共计319个片段、逾10万帧,覆盖301个独特任务指令。数据以LeRobot标准格式统一存储,采用8维联合位置与夹爪状态表示,支持关节速度控制与夹爪位置动作,为机器人舀取技能的跨场景学习提供了高质量的训练资源,显著填补了该技能在数据融合与标准化方面的空白。
当前挑战
当前机器人操作研究面临的核心挑战在于数据异构性与技能泛化瓶颈。具体而言,不同采集源之间的机械臂构型、传感器配置与动作表示存在差异,即便对于同一技能(如舀取),原始DROID子集与新采集数据的动作空间映射仍需手工对齐与校准,增加了多源融合的工程复杂度。此外,该数据集的构建揭示了一个更根本的领域问题:如何从大规模、弱标注的通用机器人数据中高效提取特定技能子集,并保证跨环境、跨物体类型的任务适配能力。同时,“舀取”类操作涉及工具使用、力度控制与动态交互,现有基于静态示范的模仿学习范式难以鲁棒应对物体形态变化与扰动,亟需在数据规模、动作表征与决策策略层面进行突破性设计。
常用场景
经典使用场景
在机器人操作领域,数据集的构建往往面临真实场景多样性与数据规模的双重挑战。droid_merged_skills_scooping数据集专为“舀取”(scooping)这一精细操作技能设计,融合了来自DROID大规模机器人交互数据集中经由语言筛选的子集,以及针对同一任务新采集的环境数据。该数据集涵盖319个示范片段、超过10万帧图像与状态-动作对,并提供了标准化的8维观测状态与动作空间,包括关节位置、关节速度与夹爪位置。凭借其高密度、多视角的视频记录和统一的行为表示,该数据集成为研究机器人在非结构化环境中学习舀取操作行为的理想基准,广泛应用于模仿学习、行为克隆以及基于视觉的运动策略的训练与评估。
解决学术问题
在机器人学习领域,如何使机器人在真实、多样化的环境中习得通用且鲁棒的操作技能,始终是亟待突破的核心难题。该数据集的构建有效回应了数据稀缺性与任务单一性带来的制约,通过将大规模泛化数据与特定任务的高质量示范进行融合,为解决舀取操作在跨物体、跨容器、跨姿态下的技能迁移问题提供了关键数据支撑。其标准化的动作表征与高变异性的任务描述(包含301个独特任务指令)使得研究者能够系统探索语言条件化策略、多模态融合方法以及跨任务泛化能力。这一数据集不仅推动了技能学习从实验室简化场景向真实复杂环境的跨越,也为评估机器人策略在未见任务上的零样本泛化性能奠定了坚实的实验基础。
实际应用
在现实应用层面,舀取操作广泛存在于厨房烹饪、医疗护理、物料处理等场景中,是服务机器人实现自主化操作的关键环节。该数据集所覆盖的丰富任务变体——包括从碗中舀取糖果、用勺子搅拌并移除物体、将内容物从一个容器转移至另一个容器等——直接映射了家庭服务、餐饮自动化以及实验室操作等实际需求。通过利用该数据集训练得到的策略,机器人能够更好地应对物体形状、容器位置、内容物状态等动态变化,从而提升在未知环境中的操作灵活性与成功率。此外,该数据集所采用的标准化动作格式与多视角视频输入,也为工业场景中的任务编排与人机协作提供了可复用的技术路径。
数据集最近研究
最新研究方向
在机器人操作领域,技能筛选与数据集合并的前沿探索日益聚焦于提升泛化能力与数据效率。droid_merged_skills_scooping数据集通过融合语言筛选的DROID子集与针对同一“舀取”技能的新采集环境数据,构建了包含319个片段、逾10万帧的多视角动作序列,尤其将标准化运动表征压缩为8维联合速度与夹爪位姿向量。这一策略不仅强化了机械臂在精细操控任务中的可迁移学习,还响应了近年来机器人社区对少样本适应与跨领域技能迁移的热切关注,为构建更加鲁棒的灵巧操作基座提供了关键数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务