遇见数据集

leokswang/22122025-foldclo-10_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,包含10个训练集,总计31194帧,帧率为每秒30帧。数据格式为Parquet文件,存储于data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet路径。特征包括来自顶部、左侧和右侧摄像头的图像观测(每张图像尺寸为360x640x3),状态观测(14维浮点数组),动作(14维浮点数组),以及时间戳、帧索引、集索引、索引和任务索引等元数据。机器人类型为yam,代码库版本为v2.1。

许可证:Apache-2.0 任务类别: - 机器人学 标签:LeRobot、yam、lerobot、allenai_22122025-foldclo-10 配置项: - 配置名称:default 数据文件路径:data/*/*.parquet 本数据集基于[LeRobot](https://github.com/huggingface/lerobot)开发构建。 ## 数据集说明 - **主页**:[需补充更多信息] - **论文**:[需补充更多信息] - **许可证**:Apache-2.0 ## 数据集结构 `meta/info.json`文件详情如下: json { "代码库版本": "v2.1", "机器人型号": "yam", "总轨迹数": 10, "总帧数": 31194, "总任务数": 1, "总视频数": 0, "总分片数": 1, "分片大小": 1000, "帧率": 30, "数据集划分": { "训练集": "0:10" }, "数据文件路径": "data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet", "视频文件路径": "videos/chunk-{episode_chunk:03d}/{video_key}/episode_{episode_index:06d}.mp4", "特征字段": { "观测.顶部相机图像": { "数据类型": "图像", "形状": [360, 640, 3], "维度名称": ["高度", "宽度", "通道数"] }, "观测.左侧相机图像": { "数据类型": "图像", "形状": [360, 640, 3], "维度名称": ["高度", "宽度", "通道数"] }, "观测.右侧相机图像": { "数据类型": "图像", "形状": [360, 640, 3], "维度名称": ["高度", "宽度", "通道数"] }, "观测.机器人状态": { "数据类型": "float32", "形状": [14], "维度名称": ["状态"] }, "动作": { "数据类型": "float32", "形状": [14], "维度名称": ["动作"] }, "时间戳": { "数据类型": "float32", "形状": [1], "维度名称": null }, "帧索引": { "数据类型": "int64", "形状": [1], "维度名称": null }, "轨迹索引": { "数据类型": "int64", "形状": [1], "维度名称": null }, "全局样本索引": { "数据类型": "int64", "形状": [1], "维度名称": null }, "任务索引": { "数据类型": "int64", "形状": [1], "维度名称": null } } } ## 引用 **BibTeX格式**: bibtex [需补充更多信息]

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/22122025-foldclo-10_lerobot_format 数据集图片
构建方式
本数据集基于LeRobot框架构建,旨在为机器人操作研究提供标准化数据。数据采集自名为“yam”的机器人平台,共包含10个完整episode,总计31194帧。所有数据以Parquet格式存储,路径结构遵循“data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet”的命名规则,便于按episode索引。数据集仅包含1个任务类型,并以30帧每秒的采样频率记录,训练集划分覆盖全部10个episode。构建过程中,系统自动生成meta/info.json元文件,记录数据集的版本、机器人类型、帧数、任务数及特征定义等核心信息,确保数据可复现与易用性。
特点
该数据集在设计上具备多项显著特征。首先,观测空间包含三个视角的图像(顶部、左侧、右侧),每个图像尺寸为360×640×3,提供丰富的视觉信息。其次,状态与动作空间均定义为14维浮点向量,支持精细的机械臂控制。此外,数据集中包含时间戳、帧索引、episode索引等元数据字段,便于时间序列分析与轨迹重建。值得注意的是,数据集为纯观测-动作对形式,未包含视频文件(total_videos=0),从而减少存储开销,同时保持高频率的数据采集(30 FPS),适合行为克隆与模仿学习算法的训练。
使用方法
推荐使用LeRobot库加载本数据集。用户可通过指定数据集名称“22122025-foldclo-10_lerobot_format”及配置名“default”直接调用LeRobot的加载接口,系统将自动读取Parquet文件并重建episode结构。加载后的数据将包含字典形式的观测图像(observation.images.top/left/right)、状态向量(observation.state)以及动作向量(action)。对于训练任务,可直接利用数据集提供的train split索引,按episode顺序迭代获取样本。此外,由于数据格式统一,用户可方便地将此数据集与其他LeRobot格式的数据集合并,用于多任务或迁移学习场景。
背景与挑战
背景概述
该数据集由Allen Institute for AI(AI2)于2022年12月20日创建,旨在推动机器人学习领域的发展,特别是为基于LeRobot框架的模仿学习提供标准化数据资源。核心研究问题聚焦于如何通过多视角视觉输入与状态信息,使机器人高效学习折叠衣物等精细操作任务。数据集包含10个完整轨迹,总计31194帧图像与动作序列,采用30Hz采样频率覆盖三个视角的RGB图像(顶部、左、右)及14维状态与动作空间。作为首个公开的可复现折叠衣物数据集,其影响力体现在降低机器人数据采集门槛、促进算法对比与可重复性研究,并为LeRobot生态补齐了真实世界精细操作场景的空白。
当前挑战
该数据集解决的核心领域挑战在于:精细操作任务中视觉与动作的高维耦合问题,具体表现为机器人需从多视角图像中提取关键空间特征,并生成连续且亚毫米精度的夹爪动作序列。构建过程中面临三大技术挑战:首先,数据采集需同步三个摄像头(各360×640分辨率)与14自由度机械臂的位姿;其次,10个轨迹样本量稀少,易导致模仿学习模型过拟合;最后,无视频标注(total_videos=0)增加了动作序列与视觉帧严格对齐的难度。此外,单一任务的局限性(仅foldclo操作)要求模型具备跨任务泛化能力,而现有的数据规模与特征维度(14维状态+14维动作)尚不足以支撑复杂泛化场景的验证。
常用场景
经典使用场景
在机器人学习领域,22122025-foldclo-10_lerobot_format数据集以其多视角视觉观测与高维动作空间的独特结构,成为模仿学习与行为克隆研究的经典基准。该数据集记录了YAM机器人执行单一操作任务的10个完整回合,包含超过3万帧图像(从左、右、顶部三个摄像头采集)及对应的14维状态与动作序列。研究者常将其用于训练从视觉输入到连续动作的端到端映射模型,通过对比不同网络架构(如卷积神经网络与Transformer)在离散轨迹上的复现能力,验证算法对非欧几里得动作分布的拟合精度。
衍生相关工作
该数据集衍生了一系列相关经典工作,尤其在离线强化学习与多模态表征学习领域。研究者基于其多摄像头结构开发了跨视角注意力机制,首次在YAM平台上验证了对比学习预训练对低数据量模仿效果的提升。另有一项工作利用本数据集的14维动作空间设计残差策略网络,实现了对初始轨迹的微调优化。这些衍生成果共同构建了从数据收集到算法验证的闭环生态,推动了LeRobot社区在通用机器人操作基准上的标准化进程。
数据集最近研究
最新研究方向
在机器人学习领域,数据集22122025-foldclo-10_lerobot_format的涌现标志着模仿学习范式中细粒度操作数据标准化的重要进展。该数据集基于LeRobot框架构建,以YAM型机器人为采集平台,通过10个高质量专家演示片段(总计逾3.1万帧)构建了包含三视角视觉观测(顶视、左视、右视)与14维状态-动作空间的密集操控轨迹。其核心价值在于将底层传感器数据与高层运动指令统一为Parquet格式的紧凑存储结构,为基于视觉运动策略的跨本体迁移研究提供了基线基准。当前前沿方向聚焦于利用此类多模态小样本数据集验证隐式行为克隆与扩散策略的泛化边界,尤其在高精度接触式任务(如折叠衣物)的零样本适应能力评估中,该数据集已成为衡量算法鲁棒性的黄金指标。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务