遇见数据集

Greynar/eval_act_PermaBotLabo

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个使用LeRobot创建的机器人数据集,专为so101_follower机器人设计。数据集包含9个episodes,总计9006帧数据,以30fps的速率采集。数据以parquet文件格式存储,视频文件以mp4格式存储。特征包括机器人的动作(如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观测状态(与动作相同的关节位置)、来自顶部和前置摄像头的图像观测(分辨率为480x640,3通道彩色视频),以及时间戳、帧索引、episode索引、索引和任务索引等元数据。数据集主要用于机器人控制和学习任务,所有数据分为训练集。

This dataset was created using LeRobot and is designed for the so101_follower robot. It contains 9 episodes with a total of 9006 frames, captured at 30fps. The data is stored in parquet format, and video files are in mp4 format. Features include robot actions (such as shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), observation states (joint positions identical to actions), image observations from top and front cameras (with resolutions of 480x640, 3-channel color video), and metadata such as timestamp, frame index, episode index, index, and task index. The dataset is primarily used for robot control and learning tasks, with all data split into the training set.

提供机构:
Greynar
搜集汇总
数据集介绍
Greynar/eval_act_PermaBotLabo 数据集图片
构建方式
在机器人学习领域,高质量的数据集是驱动模仿学习与行为克隆算法进步的核心要素。eval_act_PermaBotLabo数据集基于LeRobot框架构建,专门用于评估和训练机器人操作技能。该数据集由9个完整操作片段组成,共计9006帧,源自一个so101_follower型号的机器人平台,针对单一操作任务进行采集。数据以Parquet格式存储,并配备AV1编码的高清视频,帧率为30 FPS。数据集结构明确,特征空间涵盖六维动作指令(涵盖肩、肘、腕及夹爪自由度)与对应的环境状态观测,同时包含两个视角(顶部与前方)的RGB图像,为端到端机器人控制模型提供了丰富的时空对齐信息。
特点
该数据集的核心特点在于其精细化的结构与多模态对齐。首先,其动作空间与状态空间采用相同的六维名称体系,便于直接进行模仿学习中的状态-动作映射建模。其次,视觉观测包含分辨率为640x480的双视角视频流,顶部视角与前方视角的联合提供了对机器人工作空间的立体感知能力。数据集中还整合了时间戳、帧索引及片段索引等结构化元数据,保障了序列连贯性。此外,数据集以1000帧为单位进行分块存储,便于分布式处理与流式加载。这些设计使其成为验证行为克隆算法、特别是行动者-评论家架构在真实机器人平台上迁移能力的理想基准。
使用方法
使用该数据集进行模型训练时,推荐采用LeRobot生态系统的标准流程。用户可通过配置data_path与video_path字段加载Parquet格式的数值数据及对应的压缩视频,利用LeRobot内置的数据集类Dataset实现自动切片、批处理与帧对齐。在训练阶段,可定义动作维度为6维的连续输出空间,并将双视角图像作为视觉编码器输入,配合时间序列建模模块(如Transformer或LSTM)进行端到端策略学习。由于数据已按8:2比例隐含划分为训练集与未说明的验证集,研究者可直接开展监督式行为克隆或离线强化学习实验,亦可轻松调整分块大小以适应不同计算资源需求。
背景与挑战
背景概述
eval_act_PermaBotLabo数据集由Hugging Face主导的LeRobot社区在2024年前后创建,聚焦于机器人操作技能的学习与评估。该数据集采用so101_follower型号机器人,采集了9个回合共9006帧数据,包含动作指令、状态观测及多视角视觉图像,涵盖单任务场景。作为LeRobot框架下的基准数据集,它旨在推动模仿学习与行为克隆算法在真实机器人平台上的可复现性研究,为机器人操作领域的标准化评估提供了重要资源。
当前挑战
该数据集主要面临以下挑战:首先,机器人操作领域普遍存在高维状态-动作空间与复杂动力学建模难题,要求算法能够从有限的演示数据中泛化出鲁棒策略。其次,数据集仅包含9个回合、单任务样本,数据规模极为有限,如何在稀疏数据条件下克服过拟合、提升策略的迁移性与泛化能力是核心挑战。此外,多视角视觉观测的同步与压缩编码(如AV1)带来的信息损失,以及遥操作数据中的噪声与歧义,进一步增加了模型训练的难度。
常用场景
经典使用场景
在机器人操作与模仿学习领域,eval_act_PermaBotLabo数据集为基于视觉的运动策略研究提供了高质量的示范数据。该数据集记录了一台SO101型六自由度机械臂执行单一任务时产生的9006帧轨迹,包含上肢关节角度、夹爪状态及多视角视频流(顶视与前置摄像头,640×480分辨率,30帧/秒)。经典使用场景聚焦于行为克隆(Behavior Cloning)和扩散策略(Diffusion Policy)的训练与评估——研究者可借助观测图像序列与对应的关节动作,构建从像素到电机指令的端到端映射模型,实现机械臂对演示技能的精准复现与泛化。
解决学术问题
该数据集着力回应了机器人学习领域的两大核心困境:其一是小样本下的高效模仿学习,凭借9个完整演示片段,为验证低数据量场景中的策略泛化能力提供了基准;其二是视觉运动耦合的表征问题,通过同步采集的原始图像与精确的6维动作标签,支撑学界探究隐式视觉特征提取与动作序列预测的协同机制。其开源结构和标准化格式(依托LeRobot框架)显著降低了重复采集成本,使研究者能够聚焦于算法创新,推动了少样本模仿学习、轨迹平滑及多模态融合等方向的学术进展。
衍生相关工作
该数据集衍生出的经典工作主要围绕模仿学习算法的对比评估与模型轻量化展开。研究者基于其标准化接口,验证了ACT(Action Chunking with Transformers)在长程轨迹预测中的优势,并与扩散策略在动作噪声抑制上的表现进行对比;衍生工作中还出现了更高效的状态表示网络和跨机器人迁移的微调方案。此外,该数据集被用于测试多视角图像融合对操作精度的影响,催生出以视觉注意力机制为核心的端到端控制器,进一步丰富了LeRobot社区中的基线模型库和领域迁移研究路向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务