遇见数据集

ykorkmaz/play_human_single_0

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,包含机器人动作和观测数据,涉及关节状态、多个摄像头的图像(包括RGB和深度图像)以及时间戳。数据集结构详细,包括动作、观测状态、图像数据(高、低摄像头及深度图像)、时间戳、帧索引、任务索引等信息。数据以parquet格式存储,视频以mp4格式存储,深度数据以npy格式存储。

This dataset was created using LeRobot and contains robotic action and observation data, including joint states, images from multiple cameras (both RGB and depth), and timestamps. The dataset structure is detailed, encompassing actions, observation states, image data (from high and low cameras, including depth images), timestamps, frame indices, and task indices. The data is stored in parquet format, videos in mp4 format, and depth data in npy format.

提供机构:
ykorkmaz
搜集汇总
数据集介绍
ykorkmaz/play_human_single_0 数据集图片
构建方式
在机器人学习领域,精准的操控数据是训练智能体的基石。play_human_single_0数据集借助LeRobot框架构建,通过人工示教的方式采集自Trossen AI Stationary机械臂平台。数据集包含单一任务下的一段完整操作轨迹,共计8928帧高帧率数据,并以30fps的速率同步记录了7维关节动作指令与对应的关节状态观测。此外,系统利用五枚摄像头从高空、低位及右腕等视角捕获了多模态视觉信息,包括RGB影像与深度图,其中深度数据以无损格式存储为毫米级精度的数值阵列。数据被组织为Parquet文件与MP4视频文件,按chunk分块存储,确保大规模加载的便捷性。
特点
该数据集的核心特色在于其多模态、高保真的数据结构。动作空间与状态空间均涵盖7个自由度的关节变量,命名直观且便于模型解析。视觉观测层融合了多视角RGB流与深度流,其中深度信息以uint16格式独立保存于numpy文件中,保留了环境的空间几何细节。数据的时间戳、帧索引与任务索引被精确记录,支持时间序列分析与任务对齐。所有视频采用AV1编码,在保持画质的同时优化了存储效率。数据集结构清晰,包含完整的元信息描述,如总帧数、视频参数与拷贝格式,为模仿学习等研究提供了可直接复用的标准化输入。
使用方法
使用者可通过LeRobot库便捷地加载该数据集,其API自动处理Parquet表与视频文件的对齐。配置中预设了训练集切分(train: 0:1),适用于单任务学习场景。加载时,系统将自动解码多视角视频数据为张量,并与状态、动作序列同步。深度图可从指定的.npy路径中恢复为毫米级数值,适用于需要深度感知的操控策略开发。动作与状态维度均为7,便于直接输入策略网络。数据内的帧索引与时间戳提供了时序锚点,有助于实现模型训练中的数据对齐与批处理。
背景与挑战
背景概述
play_human_single_0数据集由Hugging Face团队基于LeRobot框架创建,专为机器人操作任务设计。该数据集记录了一个固定基座机械臂(Trossen AI Stationary)的单一任务执行过程,包含8928帧高分辨率多视角视频(如高空、低空及右腕相机)与7维关节动作状态数据。作为示范性教程数据集,它旨在为机器人学习中的模仿学习提供标准化基准,推动机器人从人类演示中高效学习操作技能的研究。尽管规模较小,但其结构设计体现了对真实机器人数据采集的精确性要求,为后续复杂任务数据集的建设奠定了基础。
当前挑战
领域问题方面,该数据集所解决的挑战在于如何从有限的人类演示中使机器人习得精确、鲁棒的操作技能,尤其在关节空间与图像观测的对齐上。构建过程中,多传感器同步(多摄像头与动作记录)及深度图的无损存储成为技术难点,同时数据采集流程的重复性控制(单一任务样本)限制了泛化能力。此外,数据标注的精确性(如动作与视觉的时序匹配)及计算资源的高效利用(视频压缩编码AV1的权衡)亦是重要挑战,需在保真度与存储效率间寻求平衡。
常用场景
经典使用场景
在机器人学习领域,行为克隆和模仿学习是赋予机械臂灵巧操作能力的关键范式。play_human_single_0数据集由Trossen Robotics Stationary机械臂在单任务、单演示场景下采集,记录了约8928帧、时长近5分钟的高频交互数据。该数据集通过七自由度关节角度动作和状态、五路摄像头(高视角、低视角、右腕及对应深度图)的多模态观测,为学习从视觉输入到连续关节控制的直接映射提供了理想基底。研究者可基于此进行端到端模仿学习训练,验证策略在固定任务中的复现精度与泛化边界,是检验基础行为克隆框架的经典示范数据集。
衍生相关工作
围绕play_human_single_0设计的数据范例,衍生出若干标志性学术工作。其单演示约束催化了“演示增强”技术的探索,如基于几何变换的视角扩充、动作噪声注入及时序缺失重建方法。在架构层面,它启发了针对低延迟机器人策略的轻量级卷积-Transformer混合模型,以及利用深度图进行隐式3D空间推理的视觉编码器。此外,该数据集作为LeRobot教程套件的基础样本,被用于验证扩散策略和基于能量的模型在极低数据量下的收敛稳定性,形成了一套评估模仿学习算法数据效率的标准化协议,推动了机器人学中数据驱动范式的规范化进程。
数据集最近研究
最新研究方向
以play_human_single_0数据集为代表的小样本机器人操作数据集,正推动具身智能领域从大规模预训练向高效少样本模仿学习转变。该数据集基于LeRobot框架采集,记录了单一任务下8928帧的7自由度关节状态、多视角RGB图像及深度图,其流式Parquet与AV1视频编码兼顾实时性,契合前沿的人机协作与柔性制造需求。近期热点聚焦于利用此类精细动作数据训练可泛化的机器人策略,并验证少量轨迹即可完成复杂操作,为降低真实场景部署成本提供了关键基准,对加速服务机器人落地与制造业自动化升级具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务