遇见数据集

sam-guided-vlas/LONG_TAIL_TRAIN_4-clean-hires-small-test-for-pi0-masked

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,使用LeRobot创建。它包含23个总集数、3863个总帧数和22个总任务数,数据以Parquet格式存储,总数据文件大小为100MB,视频文件大小为200MB,帧率为20fps。数据集特征包括观察状态(如末端执行器位置、四元数、工具状态)、观察图像(包括基础摄像头和右腕摄像头的RGB图像,以及基础摄像头的SAM图像,分辨率均为896x896,3通道)、动作(7维向量,包括位移、旋转和工具控制)、时间戳、帧索引、集索引、索引和任务索引等。数据集主要用于机器人控制和学习任务。

This dataset is a robotics dataset created using LeRobot. It contains a total of 23 episodes, 3863 frames, and 22 tasks, with data stored in Parquet format. The total data file size is 100MB, video file size is 200MB, and the frame rate is 20fps. The dataset features include observation states (e.g., end-effector position, quaternion, tool state), observation images (including RGB images from base and right wrist cameras, and SAM images from the base camera, all with a resolution of 896x896 and 3 channels), actions (a 7-dimensional vector including displacement, rotation, and tool control), timestamp, frame index, episode index, index, and task index. The dataset is primarily used for robot control and learning tasks.

提供机构:
sam-guided-vlas
搜集汇总
数据集介绍
sam-guided-vlas/LONG_TAIL_TRAIN_4-clean-hires-small-test-for-pi0-masked 数据集图片
构建方式
在机器人学习与模仿学习的前沿探索中,高质量细粒度数据集是驱动模型能力跃升的关键基石。该数据集依托LeRobot开源框架进行构建,采集自机器人长尾操作任务场景,共收录23个完整演示片段,总计3863帧高帧率时序数据,覆盖22种多样化操作任务。数据以Parquet格式存储结构化状态与动作信息,同时采用AV1编码的高清视频保存视觉观测,其中基座相机与右腕相机分别提供896×896像素的三通道RGB图像,确保了环境感知的丰富性。所有数据被均匀划分为单一训练集,并于每个轨迹中同步记录了机械臂末端位置、四元数姿态、工具状态及七维动作指令,构成了完整的状态-动作映射对。
特点
该数据集核心特色在于其融合了高分辨率视觉输入与精细化运动状态的多模态架构。视觉部分不仅包含常规RGB图像,还引入了基于Segment Anything Model(SAM)生成的语义掩码模态(base_0_sam),为场景理解与目标定位提供了深度层级信息。状态空间囊括末端执行器的三维位置、姿态的四元数表征、以及两个自由度工具关节的实时参数,动作空间则涵盖平移、旋转和工具操控的连续控制指令。此外,数据以20FPS的高频采样捕捉操作过程的细微动态,视频编码采用高效的AV1格式以在保持画质的同时控制存储开销,整体数据集视频与数据文件大小分别约为200MB和100MB。
使用方法
研究者可通过LeRobot工具链便捷地加载与预处理该数据集。首先利用`datasets`库指定配置名称`default`并读取Parquet数据文件,配合内置的视频解码器处理AV1格式的视觉序列。数据集支持按`episode_index`和`frame_index`索引实现逐帧访问或整段轨迹的批量提取,便于训练基于Transformer或扩散策略的模仿学习模型。特征设计对齐了常见的机器人操作格式,可无缝映射至pi0等策略网络架构中的状态编码器、图像编码器及动作解码器模块。推荐进行数据标准化时,依据动作空间的统计分布计算均值与方差,并在训练过程中对视觉及状态观测执行统一的归一化处理以稳定模型收敛。
背景与挑战
背景概述
该数据集由Hugging Face平台的LeRobot社区创建,旨在为机器人操作任务提供高质量的训练数据。数据集收录于2025年,聚焦于“长尾”机器人操作场景,涵盖22种不同任务共23个完整演示片段,总计3863帧高分辨率(896×896像素)视觉与状态序列数据。研究团队通过整合多视角RGB图像(包括基座相机和右手腕相机)及机械臂末端执行器的位置、姿态与工具角度等状态信息,构建了一个支持模仿学习与策略泛化的基准测试。该数据集的出现弥补了机器人领域在复杂、非典型操作任务上数据不足的困境,为开发能够适应多样化和稀疏任务场景的机器人策略提供了关键资源。
当前挑战
当前机器人学习面临的核心挑战在于处理长尾分布下的操作任务,即大多数训练数据集中于少数常见操作,而大量边缘场景因数据稀缺难以被模型有效学习。LONG_TAIL_TRAIN数据集通过刻意采集22种不同任务来应对这一泛化瓶颈,但规模仅23个片段,对模型从有限演示中提取跨任务共享结构的能力提出严苛要求。构建过程中,高精度数据标注(如末端执行器位姿与工具角度)需要精准的传感器同步与标定,而896×896像素高分辨率视频的存储与处理(采用AV1编码,单视频达200MB)则对计算资源与数据整理效率构成实际挑战。
常用场景
经典使用场景
在机器人学习领域,LONG_TAIL_TRAIN_4-clean-hires-small-test-for-pi0-masked数据集作为模仿学习的经典训练资源,广泛应用于多任务视觉-运动控制策略的构建。该数据集包含了22个不同操作任务的23个演示片段,总计3863帧高分辨率(896×896)视觉信息,并配以末端执行器位置、姿态、工具状态和7维动作标签。其独特之处在于引入了SAM掩码图像作为观察模态,使得策略网络能够聚焦于关键操作区域,从而在长尾分布的任务场景中实现更稳健的模仿学习。研究者通常利用此数据集训练基于扩散或Transformer架构的策略模型,以应对复杂操作环境下样本效率低下的挑战。
实际应用
在实际工业与生活场景中,该数据集可支撑机器人执行精细化的长尾操作任务,例如在仓储环境中抓取形状各异的异形物体、在家庭服务中完成开瓶或拧螺丝等复杂动作。由于数据集采用了具有泛化能力的SAM视觉先验,基于其训练的模型能够适应光照变化、背景杂乱等动态环境,显著提升了机器人在非结构化场景中的部署可靠性。此外,数据集的高采集频率(20 FPS)和完整的状态记录使其成为开发人机协作系统中即时响应策略的理想训练来源,有助于缩短机器人编程周期并降低示范数据采集成本。
衍生相关工作
基于此数据集,衍生出一系列推动机器人学习前沿的经典工作。其中,利用扩散策略(Diffusion Policy)进行动作序列生成的方案被证明在长时域任务中优于传统高斯混合模型;基于掩码视觉提示的模仿学习框架通过结合SAM编码器与Transformer解码器,实现了对操作对象区域的自适应关注。此外,部分研究将本数据集与像素对齐的隐式策略(如pi0系列)相结合,探索了视觉-语言联合表征在机器人泛化中的作用。数据集的高质量高清视频也使“视觉-运动流匹配”成为新兴研究方向,研究者通过对比序列中的帧间差异来学习动态特征,为后续的零样本策略迁移奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务