遇见数据集

hwanghwijun/real-world-so101-cam123-hdf5

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含从LeRobot真实世界SO-ARM / SO-101演示转换而来的STRAP风格HDF5文件。数据集包括目标查询演示、先验演示以及基于检索子轨迹和完整目标查询演示构建的训练HDF5文件。每个演示包含三个RGB相机流(形状为(T, 128, 128, 3),数据类型为uint8)和低维观测数据(如关节状态、末端执行器位置和夹爪状态)。数据集经过验证,确保文件可读、演示和样本计数匹配、相机键一致且数据形状一致。

This dataset contains STRAP-style HDF5 files converted from LeRobot real-world SO-ARM / SO-101 demonstrations. It includes target query demos, prior demos, and training HDF5 files built from retrieved sub-trajectories plus the full target query demos. Each demo contains three RGB camera streams (shape (T, 128, 128, 3), dtype uint8) and low-dimensional observations (e.g., joint states, end-effector position, gripper states). The dataset has been validated for readability, demo and sample counts, camera key consistency, and data shape consistency.

提供机构:
hwanghwijun
搜集汇总
数据集介绍
hwanghwijun/real-world-so101-cam123-hdf5 数据集图片
构建方式
本数据集源于LeRobot真实世界SO-ARM/SO-101机器人操作演示数据,采用STRAP格式的HDF5文件进行存储。构建过程中,首先从原始演示集合中精选出目标查询演示(含3个演示,共计2,564个样本),并整合来自三个不同批次、各含50个演示的先前演示数据(每批次41,729个样本)。随后,基于S-DTW检索与Hybrid v2检索两种策略,从先前演示中分别提取不同数量的子轨迹(top-2至top-4),并与完整的目标查询演示合并,形成六组训练HDF5文件。每个训练文件均包含全局掩码、演示掩码、检索掩码及查询真值掩码,以区分数据来源。
特点
该数据集的核心特色在于其多视角视觉与低维状态信息的深度融合。每个演示同步记录三路RGB摄像头数据(camera1、agentview/camera2、camera3),图像尺寸统一为128×128像素,数据类型为uint8。此外,还包含关节状态、末端执行器位置(3D关节位置代理量)及夹爪状态等低维观测数据,为模仿学习提供丰富的状态表征。数据集的另一亮点是检索增强型训练集的构建,通过S-DTW与Hybrid v2两种检索算法,灵活控制检索演示的数量,支持对策略学习中的演示质量与多样性进行系统性探究。
使用方法
使用时,研究人员可直接加载HDF5文件中的图像与状态序列,用于训练模仿学习或离线强化学习模型。建议以键值对方式访问各观测分量,例如通过`obs/camera1_rgb`获取第一视角RGB帧序列,或通过`obs/joint_states`读取机械臂关节角度轨迹。对于检索增强型训练文件,可利用内置的掩码字段(如`mask/retrieved`与`mask/query_ground_truth`)区分演示来源,便于设计对比实验。所有文件经过数据完整性、样本数量、图像形状一致性及观测长度匹配等严格验证,确保可用性。
背景与挑战
背景概述
在机器人学习与模仿学习领域,高质量的真实世界演示数据集对于推动技能泛化与少样本学习至关重要。该数据集由研究人员基于SO-ARM与SO-101机械臂平台构建,创建于2024年,旨在为基于STRAP框架的机器人操作任务提供标准化的多视角演示数据。数据集核心研究问题聚焦于如何利用检索增强的演示轨迹提升下游策略学习的效率与鲁棒性。通过记录50个先验演示与3个目标查询演示的多视角RGB图像、关节状态及末端执行器位姿信息,该数据集为机器人模仿学习中的少样本适应与跨场景泛化研究提供了基础性资源,对推动真实世界机器人学习领域的数据标准化与方法论验证具有重要影响。
当前挑战
该数据集面临的领域挑战主要源于机器人操作任务的复杂性与高维度特性:如何在有限演示样本下实现精准的技能泛化,是少样本模仿学习的核心难题。此外,真实环境中视觉感知的噪声、光照变化及物体位姿多样性,对多视角RGB特征的提取与对齐构成了严峻考验。在构建过程中,研究者需解决多相机系统的时间同步与空间标定问题,确保每帧图像与对应状态动作序列一致。同时,数据采集的样品一致性(如机械臂起始姿态、末端执行器抓取角度)以及轨迹检索算法(如S-DTW与混合方法)的优化,均要求对大量先验数据与目标查询进行高效匹配,这增加了数据集构建的计算复杂性与质量控制的难度。
常用场景
经典使用场景
该数据集以STRAP格式存储多视角机器人操作演示数据,涵盖三路同步的RGB视觉流与低维状态观测,成为模仿学习与行为克隆任务的经典基准。研究者可从中提取完整的演示轨迹,利用高保真的视觉-状态配对数据训练策略网络,特别适用于需要多模态感知输入的机器人精细操作场景。
解决学术问题
学术界长期面临机器人演示数据稀缺、视角单一且格式不统一的困境,该数据集通过提供标准化多相机观测与关节状态信息,有效支撑了少样本模仿学习、跨任务知识迁移以及子轨迹检索增强策略等前沿课题的研究。其结构化格式降低了数据预处理门槛,使研究者能专注于算法创新,推动了机器人学习领域从数据碎片化向系统化研究的范式转变。
衍生相关工作
围绕该数据集衍生出两条经典研究脉络:其一为基于S-DTW的动态时间规整检索方法,通过子轨迹相似度匹配从先验库中筛选最相关的演示片段;其二为混合式轨迹检索策略,结合欧氏距离与形态学特征提升检索精度。这些工作共同奠定了检索增强模仿学习的基础框架,后续多项研究在此数据集上验证了检索数量与策略泛化能力的非线性关系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务