遇见数据集

yoohoolala/grab_the_pill_bottle_03

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是通过LeRobot创建的机器人相关数据集,专注于机器人控制任务。数据集包含100个训练episodes,总帧数为15098,数据以parquet和视频文件格式存储。机器人类型为“so_follower”,特征包括动作(如肩部、肘部、腕部和夹爪的位置)、观测状态(与动作相同)、图像观测(来自Intel摄像头的RGB图像,分辨率为720x1280,30fps)和深度图像(来自Intel深度摄像头,分辨率为720x1280,单通道,30fps)。数据集还包括时间戳、帧索引、episode索引、索引和任务索引等元数据。数据分割仅包含训练集,覆盖所有episodes。

This dataset was created using LeRobot and is focused on robotics tasks. It contains 100 training episodes with a total of 15098 frames, stored in parquet and video file formats. The robot type is so_follower, and features include actions (e.g., positions of shoulder, elbow, wrist, and gripper), observation states (same as actions), image observations (RGB images from Intel camera with 720x1280 resolution at 30fps), and depth images (from Intel depth camera with 720x1280 resolution, single channel, at 30fps). The dataset also includes metadata such as timestamp, frame index, episode index, index, and task index. The data split only includes a training set covering all episodes.

提供机构:
yoohoolala
搜集汇总
数据集介绍
yoohoolala/grab_the_pill_bottle_03 数据集图片
构建方式
本数据集借助LeRobot框架构建,聚焦于机器人抓取药瓶的单一任务场景。数据采集自so_follower型机器人,共收录100个完整操作回合,包含15098帧时序数据。每一帧均记录6维关节空间状态与对应的动作指令,涵盖肩部、肘部及腕部等多自由度的位置信息,同时同步采集了高清彩色图像与深度影像,形成多模态的感知-运动闭环数据流。数据集以parquet格式存储结构化表格数据,视频数据则采用AV1与FFV1高效编码,并通过分块索引机制进行组织管理,便于大规模分布式训练加载。
特点
该数据集的核心特色在于其高保真的多模态时空对齐特性。所有视觉数据以30帧/秒的速率采集,图像分辨率达到720×1280,原始深度图以16位灰度精度记录场景三维结构,为精细操作提供了丰富的环境感知信息。动作与状态数据均为连续浮点型,且动作空间与状态空间实现了维度上的严格对称(均为6维),便于在模仿学习与强化学习任务中进行端到端建模。此外,数据集采用标准的LeRobot格式封装,包含统一的元信息文件与分块存储策略,兼顾了可扩展性与重放效率。
使用方法
使用本数据集时,推荐依赖LeRobot库中的Dataset与DataLoader模块进行加载。用户可通过指定config名称'default'自动解析数据集中'data'目录下的parquet文件序列,并关联对应视频文件。训练过程中,可直接访问'action'与'observation.state'字段获取机器人运动状态与指令,同时利用'intel'与'intel_depth'两路视觉通道提取空间特征。数据集内置了100个完整回合,适合拆分为训练集与验证集进行策略学习。为提高采样效率,建议采用固定窗口大小的时序切片方式,并结合差分状态或目标导向奖励函数进行算法适配。
背景与挑战
背景概述
该数据集由LeRobot社区于近期创建,聚焦于机器人操作领域的精细抓取任务,具体场景为机械臂抓取药瓶。研究问题集中于如何基于视觉与状态信息,实现高精度的物体抓取动作学习。数据集包含100个示范片段,共计15098帧,记录了六自由度机械臂的关节位置与夹爪状态,并同步采集了高分辨率RGB与深度视频流。其发布为模仿学习与行为克隆方法提供了标准化训练资源,有望推动家庭辅助机器人或医疗场景中物体操控能力的提升。
当前挑战
所解决的领域问题在于机器人操作任务中的动作泛化性与稳定性不足——模型需从有限示范中学习鲁棒的抓取策略,应对物体位置、光照等变化。构建过程中面临多模态数据对齐的挑战,需确保30帧/秒的RGB与深度视频精确同步,并校准六维关节向量与视觉输入的时间戳。此外,深度图采用灰度16位无损格式存储,虽保留高精度但增加了数据处理与压缩的复杂度,需平衡存储效率与信息保真度。
常用场景
经典使用场景
在机器人操作与模仿学习的研究领域中,grab_the_pill_bottle_03数据集为机械臂抓取任务提供了精细化的训练素材。该数据集由LeRobot框架采集,记录了SO Follower型机械臂在100个回合中执行药瓶抓取操作的全过程,囊括了15098帧高分辨率视觉与深度图像,以及关节角度与夹爪状态等共计六维的实时动作与状态数据。研究者常借助此数据集来训练端到端的模仿学习模型,使机器人能够从演示中习得抓取药瓶这一精细操作技能。其标准化的数据格式与30帧/秒的时序采样频率,为复现与比较各类算法提供了理想基准。
实际应用
在实际应用中,该数据集所训练的策略可部署至养老助残或家庭服务机器人上,执行自主抓取药瓶并递送给用户的辅助任务。例如,通过将视觉观测映射为关节空间的动作序列,机器人能够识别桌面上的药瓶并执行稳定的拾取动作,这对于行动不便的长者或慢性病患者而言具有切实的辅助价值。此外,数据集支持的精准夹持与力位混合控制技术还可迁移至药品分拣、实验室自动化等工业场景,其中可靠的抓取成功率与对易碎品的轻柔操作是关键要求。其公开的Apache 2.0许可协议也促进了学术界与产业界在辅助机器人技术上的协同创新。
衍生相关工作
基于grab_the_pill_bottle_03数据集,研究人员衍生出了多项具有代表性的创新工作。在算法层面,针对其提供的多视角视觉输入,有工作提出了融合深度信息的注意力机制网络,显著提升了遮挡条件下的抓取成功率。在数据处理策略上,研究者利用该数据集的标准结构开发了数据增强与域随机化工具,从而提升了策略跨场景迁移的鲁棒性。此外,该数据集还与LeRobot框架中的其他任务数据集配合,形成了多任务模仿学习的基准包,催生了面向通用操作技能的共享表征学习范式。这些衍生工作不仅深化了对物理交互中视觉-运动关联机制的理解,也为构建大规模机器人操作策略库提供了可复用的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务