遇见数据集

leokswang/18122025-foldclo-01_lerobot_format

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot工具创建,是一个机器人学领域的数据集,专门针对YAM机器人类型。数据集包含10个训练集片段,总帧数为37278,帧率为30fps。数据以Parquet格式存储,无视频文件。特征包括来自顶部、左侧和右侧摄像头的图像观测(每张图像分辨率为360x640x3),机器人状态观测(14维浮点向量),动作(14维浮点向量),以及时间戳、帧索引、片段索引等元数据。数据集遵循Apache 2.0许可证,适用于机器人控制和学习任务。

This dataset was created using the LeRobot tool and belongs to the robotics domain, specifically for the YAM robot type. It contains 10 training episodes with a total of 37,278 frames at 30 fps. Data is stored in Parquet format without video files. Features include image observations from top, left, and right cameras (each image with a resolution of 360x640x3), robot state observations (14-dimensional float vector), actions (14-dimensional float vector), and metadata such as timestamp, frame index, and episode index. The dataset is licensed under Apache 2.0 and is suitable for robot control and learning tasks.

提供机构:
leokswang
搜集汇总
数据集介绍
构建方式
该数据集基于LeRobot框架构建,专为机器人学习任务设计。数据采集自YAM机器人平台,共包含10个完整片段(episode),总计37278帧画面,以30帧/秒的采样率录制。数据集采用Apache-2.0许可证开放,数据以Parquet格式存储于chunk-xxx/episode_xxxxxx.parquet路径下,分为单一训练集。每帧记录包含多模态观测信息:三个视角(顶部、左侧、右侧)的360×640像素RGB图像、14维机器人状态向量、14维动作指令,以及时间戳、帧索引、片段索引等元数据,统一以float32或int64类型存储。
特点
数据集的核心特色在于其结构化的多模态融合设计。通过三摄像头视觉系统捕获全局与局部环境信息,结合14维状态与动作空间,支持模仿学习与强化学习研究。数据规模虽小但密度高,10个片段涵盖单一任务场景,便于快速实验与模型验证。特征字段命名遵循LeRobot规范(如observation.images.top),便于与主流机器人学习框架兼容。此外,数据集无视频文件,仅依赖序列化帧数据,降低了存储与加载复杂度。
使用方法
使用此数据集需依托LeRobot生态。用户可通过lerobot库的load_dataset接口加载,指定config_name为'default',自动解析Parquet文件中的特征字段。数据加载后,可提取observation.images系列键访问图像,利用observation.state和action字段构建状态-动作对,用于训练策略网络。建议按片段索引组织数据,采用时间序列滑动窗口方式采样。由于数据集无预定义验证集,用户可自行划分前若干片段为验证集。处理图像时需注意尺寸为360×640,可归一化至[0,1]区间后输入模型。
背景与挑战
背景概述
在机器人学习领域,基于视觉的模仿学习与操作技能获取已成为研究热点,然而高质量、标准化的机器人数据集仍相对匮乏。由AllenAI与LeRobot社区联合构建的18122025-foldclo-01_lerobot_format数据集应运而生,该数据集采用Apache-2.0许可协议发布,旨在为机器人精细操作任务提供标准化训练样本。数据集基于YAM机器人平台采集,总计包含10个演示回合、37278帧高帧率(30 FPS)视觉与状态动作序列,观测空间涵盖三视图(顶部、左侧、右侧)RGB图像与14维机器人状态向量,动作空间同样为14维连续值,数据格式严格遵循LeRobot v2.1规范。该数据集的出现有效填补了机器人操作领域标准化基准缺失的空白,为后续模仿学习算法研究提供了可复现、易扩展的数据基础。
当前挑战
当前机器人操作领域面临的核心挑战在于多模态感知与控制策略的耦合复杂性。具体而言,该数据集所聚焦的单任务精细操作要求算法能够从高维视觉输入中提取有效空间特征,并将其映射至连续动作空间,这对现有模仿学习模型的泛化能力构成严峻考验。数据集构建过程中同样面临挑战:仅依赖10个演示回合难以覆盖任务中的全部状态变异,数据量有限且缺乏负样本,可能导致模型过拟合于特定轨迹;此外,多视角图像与14维状态动作信息的时间对齐精度、传感器噪声处理以及演示策略的次优性均会影响数据质量,进而制约下游算法的鲁棒性提升。
常用场景
经典使用场景
该数据集源自机器人领域的前沿研究,专为模仿学习与行为克隆任务而设计,以LeRobot标准化格式存储。其经典使用场景聚焦于训练机器人通过视觉和状态观测数据复现人类演示动作。数据集包含来自三台RGB相机(顶部、左、右)的高清图像、14维机器人状态信息以及相应的14维动作指令,覆盖10个演示片段共37278帧,为端到端策略学习提供了多模态对齐的精细样本。研究者可借助此数据集训练神经网络模型,使其学会将观测图像与状态映射为控制动作,从而在仿真或真实环境中自主执行折叠衣物等精细化操作任务,是验证模仿学习算法有效性的基准数据。
实际应用
在实际应用中,该数据集为机器人执行家居服务、精密组装等操作任务提供了可复现的训练范例,例如学习折叠衣物、整理物体或精细抓取。研究人员可利用这些样本训练机器人使其通过观察环境变化自主调整动作,提升在非结构化环境中的适应能力。数据集的标准化格式(LeRobot)大幅降低了算法部署的门槛,支持快速集成到主流机器人学习框架中。此外,其在仿真到现实迁移、多任务学习等场景中具有直接价值,可加速智能机器人从实验室走向生产与日常生活的落地进程,如辅助老年人生活或工业自动化。
衍生相关工作
该数据集衍生了一系列经典工作,主要包括基于模仿学习的策略网络优化研究,如扩散策略(Diffusion Policy)在动作预测中的应用、视觉-语言-动作联合建模等前沿探索。研究者基于其多模态数据特性,开发了时序卷积网络与注意力机制相结合的算法,提升了长程任务执行的成功率。同时,该数据集促进了数据增强技术(如视角随机化)和离线强化学习方法的评测标准建立,成为对比不同算法性能的公共基准。相关工作还延伸至领域自适应和跨实体迁移,推动了YAM等机器人平台上的通用技能学习框架形成,丰富了LeRobot生态系统的开源成果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务