遇见数据集

leokswang/23122025-foldclo-07_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,用于机器人技术任务。数据集包含10个episodes,总计23344帧,帧率为30fps。数据以parquet格式存储,特征包括:三个视角(顶部、左侧、右侧)的图像观察,每个图像尺寸为360x640x3(高度、宽度、通道);状态观察为14维浮点数组;动作为14维浮点数组;以及时间戳、帧索引、episode索引、任务索引等元数据。数据集仅包含训练分割,使用Apache 2.0许可证。

This dataset was created using LeRobot for robotics tasks. It contains 10 episodes with a total of 23,344 frames at 30 fps. The data is stored in parquet format and includes features such as: image observations from three perspectives (top, left, right), each with dimensions 360x640x3 (height, width, channels); state observations as a 14-dimensional float32 array; actions as a 14-dimensional float32 array; and metadata including timestamp, frame index, episode index, and task index. The dataset only includes a training split and is licensed under Apache 2.0.

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/23122025-foldclo-07_lerobot_format 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人模仿学习与操控任务设计。数据源自机器人遥操作数据采集,共包含10个演示片段(episodes),总计23344帧时序数据,采样频率为30帧/秒。数据集以parquet格式存储多模态数据,包括来自顶部、左侧与右侧三个视角的RGB图像(分辨率360×640),以及14维的机器人关节状态向量与对应的动作指令。每一帧均附带时间戳、帧索引、片段索引等结构化元信息,便于序列化处理与回放。
特点
数据集采用标准化LeRobot格式,具有高度的一致性与可复现性。其突出特点在于多视角视觉观测与低维状态动作空间的结合,为视觉-运动策略的学习提供了丰富的感知信息。所有数据被组织为单一任务(task)的训练集,无视频文件,仅依赖parquet高效列式存储,适合大规模并行处理。数据集规模适中,帧数充沛,兼具多样性与紧凑性,是验证机器人操控算法的理想基准。
使用方法
数据集可通过HuggingFace Datasets库加载,指定config为'default',数据路径通配符为'data/*/*.parquet'。开发者可直接使用LeRobot库中的DataPipeline模块进行批量读取、批处理与归一化。推荐将观测图像与状态作为输入,动作作为监督目标,搭建例如扩散策略或行为克隆模型。数据集已预设训练划分(指向全部10个片段),无需额外拆分,支持快速迭代训练与评估。
背景与挑战
背景概述
该数据集名为23122025-foldclo-07_lerobot_format,基于LeRobot框架构建,创建于2025年,专注于机器人操作领域。其核心研究问题在于通过多模态观测数据(包括顶部、左侧、右侧三视角图像及14维状态向量)与动作指令的配对,推动机器人技能学习从仿真向真实场景迁移。数据集由Allen AI实验室等机构开发,采用Apache-2.0许可,包含10个演示片段、23344帧影像及单一任务,以30Hz采样频率捕捉细粒度操作轨迹。该数据集在模仿学习与强化学习领域中具有重要意义,为评估机器人从人类演示中泛化行为的能力提供了标准化的低维度结构化基准,尤其服务于YAM机器人平台,弥补了真实机器人数据稀缺的困境。
当前挑战
该数据集面临的挑战首先体现于领域核心问题:机器人操作任务高度依赖环境动态性与实体交互,而现有数据规模仅涵盖单一任务与有限帧数,难以支撑模型对复杂或非结构化场景的泛化能力。构建过程中,数据采集需协调多视角视觉传感器与多维动作空间的同步记录,确保状态与动作时序对齐的精度;此外,演示片段数量稀少(仅10个),在缺乏数据增强或仿真扩展手段的情况下,易导致过拟合与策略脆弱性。数据集采用固定帧率与标准化结构,虽便于训练,却难以覆盖操作过程中的突发扰动与误差累积,对鲁棒性学习构成显著制约。
常用场景
经典使用场景
该数据集专为机器人模仿学习与行为克隆任务而设计,基于LeRobot框架构建,聚焦于YAM型机械臂在特定操作场景下的运动轨迹与视觉观测记录。在机器人学习领域,数据集以高帧率(30 FPS)采集了10个完整示范片段,包含23344帧时序数据,涵盖顶部、左侧、右侧三视角高清图像(360×640像素)与14维关节状态及动作向量。其核心使用场景在于训练端到端的视觉运动策略,使机器人通过观测图像序列与状态信息,学习从感知到动作的映射关系,尤适用于复杂精细的物体抓取或装配任务,为模仿学习算法提供标准化的多模态示范数据。
实际应用
在实际工业与服务业场景中,该数据集可用于快速部署可复现的机器人操作技能。例如,基于其示范数据训练的视觉策略可直接应用于YAM型机械臂的电子元件装配、实验室精密分拣或厨房食材处理等任务。通过微调少量示范片段,机器人可适应不同物体材质与空间排列,减少人工编程成本。此外,多视角图像设计使其适用于非结构化环境下的鲁棒感知,如遮挡场景中的目标定位,为柔性制造、物流仓储与家庭服务等领域的自主作业提供了低门槛的预训练数据支撑。
衍生相关工作
该数据集作为LeRobot生态的标准化样本,衍生出多项经典工作。研究者通常基于其多视角观测与动作序列,开发分层模仿学习框架,将全局运动规划与局部关节控制解耦;或引入对比学习范式,通过图像-状态跨模态对齐增强策略的鲁棒性。其时序结构亦被用于探索基于扩散模型的轨迹生成方法,以及利用Transformer进行长程依赖建模的闭环控制方案。部分工作将其作为真实数据基准,联合仿真环境进行域随机化迁移验证,推动了Sim-to-Real领域对抗训练与风格迁移技术的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务