遇见数据集

SryTaisei/il_gym1

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot创建,包含30个总片段和2795个总帧,帧率为10fps。数据特征包括4维动作(delta_x、delta_y、delta_z和夹爪控制)、奖励信号、完成标志、离散惩罚、观测数据(前摄像头和手腕摄像头的视频,每个视频为3通道128x128分辨率,以及18维的状态观测),以及时间戳、帧索引、片段索引等元数据。数据集以parquet格式存储数据文件,mp4格式存储视频文件,适用于机器人学习和强化任务。

This dataset is a robotics control dataset created using LeRobot, containing a total of 30 episodes and 2795 frames with a frame rate of 10fps. The features include 4-dimensional actions (delta_x, delta_y, delta_z, and gripper control), reward signals, done flags, discrete penalties, observations (videos from front and wrist cameras, each with 3 channels and 128x128 resolution, and 18-dimensional state observations), as well as metadata such as timestamps, frame indices, and episode indices. The dataset is stored in parquet format for data files and mp4 for video files, suitable for robotics learning and reinforcement tasks.

提供机构:
SryTaisei
搜集汇总
数据集介绍
SryTaisei/il_gym1 数据集图片
构建方式
il_gym1数据集基于LeRobot框架构建,专为机器人模仿学习场景设计。其数据采集过程通过模拟环境中的机器人交互任务生成,涵盖了30个完整回合(episodes),共计2795帧时序数据。数据以Parquet格式存储,分为多个chunk文件,并辅以AV1编码的MP4视频记录,确保视觉与状态信息的同步。训练集与全部数据一致,未划分验证或测试子集,便于集中利用有限样本进行策略学习。
特点
该数据集的核心特点在于其精炼的观测与动作空间设计。动作空间包含4维连续值,分别对应末端执行器的三维位移与夹爪开合,适应精细操作任务。观测方面融合了18维机器人状态向量与双视角视觉输入(正面128×128图像和腕部128×128图像),提供丰富的环境感知信息。此外,数据以10帧/秒的固定频率记录,并附带奖励、终止标志及时间戳,支持标准的强化学习与模仿学习训练范式。
使用方法
使用该数据集时,可借助LeRobot库无缝加载与处理。用户通过指定数据集路径,即可将Parquet中的状态、动作及视频数据解析为统一的Dataset对象。典型流程包括:利用`observation.state`与`observation.images`作为输入,以`action`作为监督目标训练策略网络,或结合`next.reward`与`next.done`进行强化学习。视频数据以高效AV1编码存储,降低储存开销,并支持按帧索引实时抽取。
背景与挑战
背景概述
il_gym1数据集由研究者在LeRobot框架下创建,旨在为机器人模仿学习提供标准化训练数据。该数据集包含30个训练片段,共计2795帧,聚焦于单一操作任务,记录包括前视与腕部摄像头图像(128x128分辨率)、机器人关节状态(18维)及末端执行器动作(4维,含位置增量与夹爪控制)在内的多模态信息。作为开源机器人学习社区的重要资源,il_gym1填补了低成本、易获取的机器人操作数据集的空白,为研究从视觉输入到动作输出的端到端学习算法提供了基准平台。其简洁的结构设计便于与其他基于LeRobot的数据集兼容,促进了机器人学领域在模仿学习、行为克隆等方向上的可复现研究。
当前挑战
该数据集所应对的领域挑战主要聚焦于机器人操作任务的模仿学习——如何利用少量示范数据使机器人学会精确的物理交互技能。由于仅有30条示范轨迹,模型面临从稀疏演示中泛化到新场景的困难,且高维视觉-状态-动作耦合关系加大了策略学习的复杂度。在构建过程中,挑战体现在确保数据质量与一致性:多视角视频与状态传感器需要在10Hz采样率下精确同步,动作空间(含连续平移与离散夹爪控制)的标注精度直接影响学习效果。此外,数据规模有限(约100MB参数文件与200MB视频)限制了模型在复杂环境下的鲁棒性,而缺少多样化任务与机器人类型信息则增加了领域迁移的难度。
常用场景
经典使用场景
在机器人学习与模仿学习的交叉领域中,il_gym1数据集以其精细的动作空间与多模态观测数据脱颖而出。该数据集包含30个完整演示片段,共计2795帧时序数据,记录了单一任务下机器人的连续动作与状态变化。研究者可借助前视与腕部双视角视频流(分辨率128×128,帧率10fps)以及18维的状态向量,构建端到端的视觉运动策略。其中动作特征囊括了三轴平移增量与夹爪开合控制,为精细操作任务的模仿学习提供了标准化的基准训练素材。
解决学术问题
该数据集有效解决了机器人模仿学习中高质量演示数据稀缺的核心瓶颈。传统方法常因数据维度不统一或传感器信息缺失而难以复现,而il_gym1以统一的LeRobot格式整理了视觉、状态与动作的完整时空对应关系。它支持行为克隆、逆强化学习等经典方法的训练与评测,帮助研究者量化不同算法在有限样本下的泛化能力。数据集对奖励信号与终止条件的记录,还推动了层级式决策与任务分解理论的实证研究。
衍生相关工作
围绕il_gym1数据集,学界已衍生出多项代表性的研究工作。LeRobot框架提供了从数据采集到策略部署的全链路工具,显著降低了机器人学习的研究门槛。后续工作包括基于扩散策略的轨迹生成模型、跨任务元学习架构以及多视角融合的状态估计网络。这些成果不仅验证了数据集在评估动作预测精度上的可靠性,还推动了通用机器人基础模型在模拟环境与真实硬件之间的知识迁移方法发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务