遇见数据集

leokswang/20122025-foldclo-08_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot工具创建,是一个机器人操作数据集,包含10个训练episodes,总计43296帧数据(帧率30fps)。数据集提供多视角视觉观测(顶部、左侧、右侧三个摄像头,分辨率360x640 RGB图像)、14维机器人状态观测、14维动作指令,以及时间戳、帧索引、episode索引等元数据。数据以Parquet格式存储,适用于机器人学习与模仿学习任务。

This dataset was created using LeRobot and consists of robotic manipulation data with 10 training episodes totaling 43,296 frames at 30fps. It provides multi-view visual observations (top, left, and right camera views at 360x640 RGB resolution), 14-dimensional robot state observations, 14-dimensional action commands, along with metadata such as timestamps, frame indices, and episode indices. Stored in Parquet format, it is suitable for robot learning and imitation learning tasks.

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/20122025-foldclo-08_lerobot_format 数据集图片
构建方式
在机器人学习领域,高质量的数据集是推动技能泛化与策略迁移的关键基石。本数据集依托LeRobot框架构建,专为YAM型机器人设计,旨在为操作技能学习提供标准化数据支撑。数据集采集自2012年2月25日至2025年期间的折叠式操作实验,共包含10个完整轨迹(episode),总计43296帧有效数据,全部归属单一操作任务。数据以Parquet格式按块存储于“data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet”路径下,并按照0至9的索引统一归入训练集,确保了数据加载的一致性与高效性。
特点
该数据集在结构设计上呈现出多模态与高精度的特点。观测空间包含来自顶部、左侧及右侧三个视角的640×360像素RGB图像,辅以14维浮点型状态向量;动作空间同样为14维浮点向量,实现了状态与动作之间的维度对齐。所有数据以30帧/秒的恒定速率采集,并附有精确时间戳与帧索引,便于进行时序建模。此外,数据集遵循LeRobot的v2.1规范,具备良好的跨平台兼容性,可直接用于模仿学习与强化学习算法的训练与评估。
使用方法
使用本数据集时,研究者可通过HuggingFace Datasets库加载Parquet文件,或基于LeRobot的DataPipeline接口进行流式读取。由于无视频文件存储,所有图像数据已编码于Parquet中,适合以离线批处理方式进行模型训练。建议用户依据元信息中的特征定义(observation.state与action维度均为14)构建神经网络输入输出层,并利用train split(0-9号轨迹)进行训练曲线优化。对于复现实验,可参考LeRobot官方示例脚本,通过调整episode_index参数遍历全部10个轨迹以实现完整数据集利用。
背景与挑战
背景概述
该数据集由Allen人工智能研究所与Hugging Face团队合作创建,于2025年发布,旨在推动机器人操作领域的模仿学习研究。核心研究问题聚焦于如何通过高保真度的传感器数据(包括多视角视觉图像、机器人状态与动作序列)训练机器人完成复杂操作任务,例如折叠衣物等柔性物体操控。数据集采用LeRobot标准格式,包含10个完整示范片段,共计43296帧以30帧每秒采样的时序数据,并配备360×640像素的三视角视觉观测。作为机器人学习领域标准化数据资源,该数据集为验证模仿学习算法在真实机器人平台上的泛化能力提供了基准,对推动机器人从演示中学习精细操作技能具有重要学术价值。
当前挑战
该数据集主要解决柔性物体操控这一机器人领域的核心难题,折叠衣物涉及布料的三维变形感知与动作规划,与传统刚性物体操纵存在本质差异。构建过程中面临多源挑战:首先,需同步采集三视角视觉图像与14维状态-动作空间数据,确保时序对齐精度;其次,示范数据仅包含单一任务的10次演示,样本稀缺性对学习算法的泛化能力提出严苛要求;最后,数据采集依赖固定的YAM机器人平台与传感器配置,限制了跨平台迁移的可行性。这些挑战共同指向如何从有限的高维异质数据中提取鲁棒的操作策略这一根本问题。
常用场景
经典使用场景
在机器人学习与操控领域,20122025-foldclo-08_lerobot_format数据集为模仿学习与行为克隆提供了高质量的示范数据。该数据集通过LeRobot框架采集,包含10个演示片段、超过4.3万帧的观测图像与状态信息,并同步记录了14维的机器人与环境状态及对应动作。其核心价值在于将多视角视觉输入(顶部、左、右三目摄像头)与本体感知状态融合,为从视觉到动作的端到端策略学习提供了标准化训练素材。研究者可基于该数据集训练机器人执行精细化的折叠或取放任务,尤其适用于高自由度机械臂在复杂场景下的技能迁移与泛化能力研究。
解决学术问题
该数据集针对机器人操作中示范数据稀缺与多模态对齐难题提供了重要支撑。传统研究常受限于单一视角或低维状态输入,难以实现鲁棒的视觉运动策略。此数据集通过30帧/秒的高频采样与14维度动作空间标注,解决了从原始视觉到连续动作映射的学术瓶颈。它为验证扩散策略、基于Transformer的动作预测等前沿方法提供了基准,推动了模仿学习中‘少样本高效学习’与‘跨任务泛化’等关键问题的突破。数据集的开源协议(Apache-2.0)进一步降低了复现门槛,促进了机器人学习社区在操作技能结构化表示上的理论创新。
衍生相关工作
基于此数据格式,研究社区衍生出多项代表性工作。LeRobot框架本身即为该数据集的标准化基础设施,支持流畅的数据回放与策略评估流程。许多工作利用此数据验证了基于能量模型的机器人动作生成方法,或探索了隐空间中的视觉-运动联合表征学习。此外,多视角对齐与时序一致性建模成为后续研究热点,推动了如跨视角注意力机制、在线适配策略优化等方向的发展。这些衍生工作不仅拓展了数据集的学术影响力,也为构建通用机器人操作基础模型奠定了数据与算法基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务