遇见数据集

yoohoolala/hand_over_the_pill_bottle_01

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot工具创建。它包含100个训练集,总计15409帧,帧率为30fps,数据文件大小为100MB,视频文件大小为200MB。数据集专为跟随者机器人类型设计,涉及单个任务。数据结构包括动作(如机械臂关节位置)、观测状态(关节位置)、RGB图像(720x1280分辨率,30fps,无音频)和深度图像(720x1280分辨率,30fps,无音频),以及时间戳、帧索引、集索引等元数据。数据以Parquet格式存储,视频以MKV格式存储,适用于机器人学习和控制算法研究。

This dataset is a robotics control dataset created using the LeRobot tool. It contains 100 training episodes, totaling 15409 frames with a frame rate of 30 fps. The data files size is 100 MB, and video files size is 200 MB. Designed for a follower robot type, it involves a single task. The data structure includes actions (e.g., robotic arm joint positions), observation states (joint positions), RGB images (720x1280 resolution, 30 fps, no audio), and depth images (720x1280 resolution, 30 fps, no audio), along with metadata such as timestamps, frame indices, and episode indices. Data is stored in Parquet format, and videos in MKV format, suitable for robotics learning and control algorithm research.

提供机构:
yoohoolala
搜集汇总
数据集介绍
yoohoolala/hand_over_the_pill_bottle_01 数据集图片
构建方式
本数据集基于LeRobot框架构建,专注于机器人操作任务中的“递送药瓶”场景。数据由so_follower型机器人采集,共计100个回合(episode),包含15409帧时序数据,采样频率为30帧/秒。每个回合集成了6维关节动作指令(如肩部、肘部、腕部及夹爪位置)与对应观察状态,并同步记录来自Intel相机的RGB图像及深度图,图像分辨率达720×1280。数据以Parquet格式存储结构化信息,视频流则采用MKV容器封装,采用AV1与FFV1编解码以平衡画质与压缩效率。
特点
数据集的核心特征体现在其多模态与高同步性的统一架构中。动作与状态空间均为6维实数向量,涵盖机器人所有自由度,便于策略学习中的直接映射。视觉观测涵盖RGB与深度双通道,为算法提供丰富的空间与纹理线索。所有数据按固定帧率严格对齐时间戳与帧索引,保证了时序学习的连贯性。此外,数据已预先划分为训练集(0至100回合),并采用分块存储策略(每块1000帧),兼顾了加载效率与大规模分布式处理的需求,特别适用于模仿学习与强化学习的离线训练范式。
使用方法
用户可通过HuggingFace Datasets库无障碍加载本数据集,或直接利用LeRobot框架提供的API进行数据解析与回放。加载时需指定default配置,系统将自动索引data目录下的parquet文件与videos目录中的视频流。针对模仿学习任务,可直接提取'action'字段作为专家轨迹,并结合'observation.state'与'observation.images'序列构建观测-动作对。视频数据支持按帧或按时间窗口采样,深度图已被标记为灰度16位格式,便于集成到基于视觉的机器人策略网络中,如扩散策略或行为克隆模型。
背景与挑战
背景概述
hand_over_the_pill_bottle_01数据集是面向机器人操作研究领域的高质量数据集,诞生于LeRobot开源框架之上,旨在推动机器人精细操作技能的自主学习。该数据集由Hugging Face社区主导构建,依托其强大的机器人数据标准化能力,聚焦于让机器人掌握“递送药瓶”这一典型人机协作任务。核心研究问题在于如何通过模仿学习,使机器人能在复杂真实场景中准确执行物体的交接操作,为服务型机器人的家庭或医疗应用奠定关键数据基础。该数据集包含100个演示片段,记录了6自由度的机械臂动作序列及高清视觉与深度图像信息,共计超过15000帧数据,为机器人行为克隆与强化学习算法提供了标准化的训练与评估资源,对缩小仿真与现实之间的技能迁移鸿沟具有重要推动作用。
当前挑战
该数据集所面临的挑战主要源于机器人操作任务的复杂性与数据构建的严苛要求。在领域问题层面,递送药瓶任务要求机器人具备精准的物体抓取、姿态调整与力控反馈能力,尤其是在动态人机交互场景下,需应对目标物体位置变化、遮挡以及不同用户的交接习惯差异,这对当前模仿学习算法的泛化性和鲁棒性构成了严峻考验。在构建过程中,挑战体现在如何通过遥操作确保演示动作的自然性与质量一致性,同时需协调多传感器数据的高频同步采集(包括RGB视频、深度图及关节状态),并解决大规模视频数据存储与压缩中的编码兼容性问题。此外,数据集的规模虽覆盖100个演示片段,但面对真实世界任务的多样性,其样本量仍显有限,难以覆盖所有边缘情况,这为后续数据集扩展与域自适应技术带来了持续挑战。
常用场景
经典使用场景
在机器人操作与模仿学习领域,hand_over_the_pill_bottle_01数据集为研究细粒度物体交接任务提供了宝贵资源。该数据集记录了SO-Follower机械臂在30帧每秒的高采样率下,执行药瓶递送操作的完整轨迹,包含6维关节动作指令与对应状态观测,以及720p分辨率的高清彩色与深度视频流。研究者可基于100个演示片段(共计15409帧)训练机器人从视觉输入到动作输出的端到端映射模型,尤其适用于模仿学习中的行为克隆与基于能量的扩散策略等算法验证。数据集采用统一的LeRobot框架格式存储,便于直接加载并进行策略学习的标准化评估。
解决学术问题
该数据集精准地回应了机器人学习领域中一个核心挑战:如何在非结构化环境中实现精确且鲁棒的物体交接操作。传统方法受限于手工设计的抓取规划与轨迹优化,难以泛化至任务中的微小姿态偏差。通过提供包含完整闭环状态与多模态感知信息的大规模演示数据,该数据集使得学术界可以系统性地探索状态分布偏移问题,并评估模仿学习策略在真实物理交互中的因果推理能力。其公开的标准化格式降低了研究复现门槛,推动了针对机器人操作中长时域依赖与接触传递机制的深入理解,对发展通用操作技能具有奠基意义。
衍生相关工作
基于该数据集的研究脉络已催生多项关键工作。在算法层面,研究者利用其多模态观测结构发展了融合RGB-D视觉与关节角度的高效表征学习方法,如隐式策略架构中引入空间注意力机制以处理交接任务的遮挡问题。同时,该数据集作为LeRobot生态系统的一部分,常被用于对比评估各类模仿学习算法(如扩散策略、IBC与ACT)在精细操作任务上的样本效率与稳健性。此外,数据集的公开促进了跨数据集的元学习研究,使得模型能够在药瓶递送这类基准任务上预训练后,快速微调至具有相似物理特性的物体操作场景,加速了机器人技能迁移的理论验证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务