遇见数据集

Gouspourd/test_02_setup_complet_20260528_030455

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,使用LeRobot框架创建。它包含10个episodes,总计3682帧数据,以parquet格式存储。数据集结构包括动作(action)、观测状态(observation.state)、两个视角的图像观测(腕部摄像头和顶部摄像头),以及时间戳、帧索引等元数据。动作和观测状态都包含6个关节位置:肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置。图像观测来自腕部摄像头(分辨率480x640)和顶部摄像头(分辨率720x1280),视频编码为AV1,帧率30fps。数据集总大小为300MB(数据文件100MB,视频文件200MB),适用于机器人控制和学习任务。

This dataset is a robotics dataset created using the LeRobot framework. It contains 10 episodes with a total of 3682 frames, stored in parquet format. The dataset structure includes actions, observation states, image observations from two perspectives (wrist and top cameras), and metadata such as timestamps and frame indices. Both actions and observation states consist of 6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper position. Image observations are from a wrist camera (resolution 480x640) and a top camera (resolution 720x1280), with video encoded in AV1 at 30fps. The total dataset size is 300MB (100MB for data files and 200MB for video files), suitable for robotics control and learning tasks.

提供机构:
Gouspourd
搜集汇总
数据集介绍
Gouspourd/test_02_setup_complet_20260528_030455 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人操作任务的模仿学习研究。数据采集自so_follower型机器人,涵盖了10个完整任务片段,共计3682帧时序数据。每个片段以30帧/秒的采样率记录,包含六维关节动作指令与对应状态信息,同时配备腕部(480×640)与顶部(720×1280)双视角视频流,采用AV1编码压缩存储。数据以Parquet格式分块组织,视频与结构化数据分别独立存储,并通过元信息文件统一描述特征维度与编码参数,确保了大规模机器人数据集的高效管理与可复现性。
特点
数据集的核心特点在于其多模态感知与结构化设计。动作与状态空间均为六自由度连续向量,覆盖肩部、肘部、腕部及夹爪的关键姿态控制。双摄像头配置提供了丰富的视觉上下文,腕部视角聚焦末端执行器细节,顶部视角则捕获全局场景,两者结合为策略学习赋予空间推理能力。数据包含帧索引、时间戳、任务索引等对齐信息,便于时序建模。总计约300MB的存储体量(含100MB结构化数据与200MB视频)在保证样本多样性的同时兼顾了实际训练效率。
使用方法
数据集与LeRobot生态完全兼容,可通过HuggingFace提供的可视化工具直接预览轨迹与图像。用户可调用LeRobot库的API加载预定义特征,按训练/验证拆分(默认全量用于训练)构建数据管道。典型应用范式包括:利用关节状态与动作序列训练行为克隆模型,或结合双视角图像设计视觉-运动联合策略。数据以标准Parquet快照格式存储,支持流式读取与动态批处理,便于集成至PyTorch等深度学习框架进行机器人操控技能的端到端学习。
背景与挑战
背景概述
该数据集创建于2026年,由Hugging Face团队基于LeRobot框架构建,聚焦于机器人学习领域中的模仿学习与操作技能获取。核心研究问题在于如何通过低成本、标准化的数据采集流程,为机器人提供精准的关节空间状态与视觉观测的联合表征,以支持从人类演示中学习复杂操控任务。数据集包含10个演示片段,涵盖3682帧高精度六轴机械臂(so_follower)的运动轨迹,融合了关节位置、顶部与腕部多视角图像流,为多模态机器人学习提供了规范化的训练基准。依托LeRobot开源生态,该数据集的发布推动了机器人数据共享与算法复现的标准化进程,在少样本模仿学习与泛化操控研究中具有重要的参考价值。
当前挑战
该数据集致力于解决机器人技能学习中高质量演示数据稀缺且获取成本高昂的领域问题,通过提供结构化动作-状态-视觉对齐的标准化样本,降低模仿学习对大规模人工标注的依赖。构建过程中面临多重挑战:首先,机器人关节空间与图像流的高频同步(30FPS)需要精准的时间戳校准,以消除硬件延迟导致的模态错位;其次,视频数据采用AV1编码压缩以平衡存储效率与视觉保真度,但折中方案可能削弱细微纹理特征对精密操控的指导价值;此外,仅含单一机械臂(so_follower)的10个完整片段,其规模不足以覆盖复杂任务的多样性,存在过拟合风险,亟需扩展跨环境、跨构型的数据集以验证算法的泛化性能。
常用场景
经典使用场景
在机器人学习领域,该数据集为模仿学习(Imitation Learning)与行为克隆(Behavioral Cloning)提供了丰富的训练素材。数据集通过记录UR5e协作机器人执行精确操作任务时的完整轨迹,包含6维关节空间状态、动作指令以及多视角视觉观测(腕部与顶部摄像头),支持基于视觉-运动联合表征的策略学习。研究者可将其用于训练机器人从示范中掌握柔顺控制、抓取放置等基本技能,是验证端到端神经网络架构在真实机器人平台迁移能力的经典基准。
衍生相关工作
围绕该数据集的范式,衍生出多项有影响力的工作。例如,基于其多模态轨迹结构,研究人员提出了结合扩散模型的策略学习框架Diffusion Policy,实现了对多峰动作分布的高保真建模。此外,该数据集中标准化动作空间的设计启发了跨具身形态的预训练方法(如R3M与Voltron),推动了共享表征在机器人基础模型中的演进。在基准测试方面,它成为评估“少样本适应”算法在机械臂操作中泛化能力的关键测试集之一。
数据集最近研究
最新研究方向
在机器人学习领域,该数据集聚焦于基于模仿学习的精细操作技能获取,利用LeRobot框架采集了6自由度机械臂(型号so_follower)的关节位置与双视角视觉数据。当前前沿研究倾向结合多模态感知与端到端控制策略,通过30Hz高频采样的动作状态流和480p/720p双路视觉输入,推动机器人从单一任务泛化到复杂装配场景。与具身智能热点事件相呼应,该数据集为物理世界中的灵巧操作提供了标准化基准,其Apache-2.0授权与结构化parquet/video存储格式,显著降低了机器人技能学习的研究门槛,加速了跨场景迁移学习与零样本泛化能力的突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务