遇见数据集

SortPaper_20260529_145930

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

该数据集是一个用于机器人学习的多模态数据集,基于LeRobot框架构建,专注于so_follower型机器人的操作任务。它包含60个完整的操作序列(episodes),总计32,472帧数据,采集频率为30帧/秒,数据规模约为300MB,其中包含100MB的结构化数据文件(Parquet格式)和200MB的视频文件。数据集的核心内容包括:动作(一个6维浮点向量,表示机器人六个关节的目标位置,如shoulder_pan.pos等)、观察(状态为6维浮点向量表示相同关节的当前观测位置,以及来自两个视角的同步视频流:前视和顶视摄像头,分辨率640x480像素,RGB格式,编码为AV1,帧率30fps)和元数据与索引(如时间戳、帧索引、episode索引等)。该数据集适用于机器人模仿学习、强化学习或行为克隆等任务,提供动作与多视角视觉感知及本体状态的配对数据,所有数据均被划分为训练集使用。

This dataset is a multimodal dataset for robot learning, created using the LeRobot framework, focusing on robotic manipulation tasks specifically for so_follower type robots. It contains 60 complete operation sequences (episodes), totaling 32,472 frames of data collected at a frequency of 30 frames per second. The dataset size is approximately 300MB, including 100MB of structured data files and 200MB of video files, stored in Parquet format. The core content includes: action (a 6-dimensional floating-point vector representing target positions for six robot joints, such as shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos), observation (state as a 6-dimensional floating-point vector for the current observed positions of the same six joints, and synchronized video streams from two perspectives: front and top cameras, with a resolution of 640x480 pixels, RGB format, AV1 encoding, and a frame rate of 30fps), and metadata and indexing (such as timestamp, frame_index, episode_index, global index, and task_index, with this dataset containing only one task). This dataset is suitable for tasks like robot imitation learning, reinforcement learning, or behavior cloning, providing paired data of robot joint control commands (actions) with corresponding multi-view visual perception and proprioceptive states (observations). All data is divided for training set use.

创建时间:
2026-05-29
原始信息汇总

数据集概述:SortPaper_20260529_145930

  • 许可证: Apache-2.0
  • 任务类别: 机器人学(robotics)
  • 标签: LeRobot
  • 创建工具: 使用 LeRobot 创建

数据集结构

数据集包含以下特征字段:

字段名称 数据类型 形状 说明
action float32 (6,) 机器人动作指令,包含6个关节(shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll、gripper)的位置
observation.state float32 (6,) 机器人观测状态,包含与动作相同的6个关节位置
observation.images.front video (480, 640, 3) 前置摄像头视频流,分辨率480x640,AV1编码,30 FPS
observation.images.top video (480, 640, 3) 顶部摄像头视频流,分辨率480x640,AV1编码,30 FPS
timestamp float32 (1,) 时间戳
frame_index int64 (1,) 帧索引
episode_index int64 (1,) 回合索引
index int64 (1,) 全局索引
task_index int64 (1,) 任务索引

数据集统计

  • 总回合数: 60
  • 总帧数: 32,472
  • 总任务数: 1
  • 数据文件大小: 约100 MB
  • 视频文件大小: 约200 MB
  • 帧率: 30 FPS
  • 机器人类型: so_follower

数据划分

  • 训练集: 全部60个回合(索引0-59)

数据格式

  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 代码库版本: v3.0
  • 数据块大小: 1000帧/块

引用信息

暂无提供引用信息。

搜集汇总
数据集介绍
SortPaper_20260529_145930 数据集图片
构建方式
SortPaper_20260529_145930数据集基于LeRobot框架构建,旨在为机器人操作任务提供标准化的训练数据。数据集通过远程操作(teleoperation)方式采集,涵盖了60个完整的情节(episode),共计32472帧数据。每个情节记录了机器人从初始状态到任务完成的完整动作序列,数据以Parquet格式存储,并辅以高分辨率视频流。数据集的构建遵循了模块化设计,将动作、观测状态和多视角图像(前视和顶视)作为核心特征,并以30帧每秒的采样频率进行同步记录,确保了时序信息的一致性和连贯性。
特点
该数据集的核心特点在于其多模态数据整合能力。它同时提供了6维关节动作指令(包含肩部、肘部、腕部和夹爪位置)和对应的观测状态,以及来自前视和顶视两个摄像头的640x480分辨率视频数据。支持LeRobot框架的标准化数据集结构,便于直接用于模仿学习或强化学习算法的训练与评估。此外,数据集包含了明确的元信息,如时间戳、帧索引和情节索引,方便研究人员进行时序分析。采用AV1编码的视频文件在保持视觉质量的同时有效压缩了存储空间,使总数据量控制在300MB以内。
使用方法
使用该数据集时,推荐通过Hugging Face的LeRobot可视化工具(Visualize Dataset)进行快速预览。用户可通过LeRobot库加载数据,并直接利用其提供的数据加载器(dataloader)进行批量处理。数据集已按6:0比例划分为训练集,无需额外分割。研究人员可基于action和observation.state字段进行策略学习,结合observation.images字段进行视觉观测建模。支持Python环境下的深度学习框架(如PyTorch),通过简单的API即可实现数据的迭代与预处理,为机器人操控任务的算法开发提供了便捷的入口。
背景与挑战
背景概述
SortPaper_20260529_145930数据集诞生于2025年,由研究团体MrPsarik采用LeRobot框架构建,旨在推动机器人操作领域的发展。该数据集聚焦于纸张分拣任务,通过记录机械臂(so_follower型号)执行动作时的高频状态与视觉信息,为模仿学习与强化学习提供标准化训练资源。其核心研究问题围绕如何使机器人精确感知并分拣不同状态的纸张,涉及抓取、放置等精细操作的控制策略。数据集包含60个完整轨迹,共计32472帧,覆盖前视与俯视双视角视频,并以30帧/秒的采样频率捕捉机械臂六自由度关节位置与夹爪状态。作为机器人学习领域的开放式数据集,它弥补了现有数据集在柔性物体操作任务上的不足,为验证多模态感知与运动控制算法的有效性提供了基准平台。
当前挑战
该数据集所解决的领域挑战在于,纸张作为柔性且形态易变的物体,其分拣任务要求机器人具备高度灵巧的操作能力与视觉反馈闭环控制。传统刚性物体抓取策略在此情境下难以直接迁移,因此数据集的构建过程中面临两大难题:一是如何在高频采样下同步采集机械臂运动状态(6维关节位置)与多视角视觉信息(480×640分辨率),以确保动作与图像精准对齐;二是需在有限轨迹(60个回合)内覆盖纸张摆放姿态、折叠程度及环境光照的多样性,避免模型过拟合于单一场景。此外,数据标注的精细度(如夹爪与纸张接触点的界定)以及跨硬件平台的可迁移性,也对数据集的应用潜力构成了隐性挑战。
常用场景
经典使用场景
在机器人操作与模仿学习的前沿领域,SortPaper_20260529_145930 数据集为研究中的视觉-运动耦合任务提供了关键数据支撑。该数据集聚焦于纸张分拣这一精细操作场景,通过前视与顶视双通道摄像头以30帧/秒的高频率采集图像信息,同时记录六自由度机械臂的关节位置与夹爪状态,形成了从感知到执行的完整数据链路。其经典应用在于训练基于视觉的模仿学习模型,使机器人能够通过观察示范动作,学习如何精准抓取并分类放置不同形态的纸张,从而在非结构化环境中复现人类操作的精髓。
解决学术问题
该数据集致力于破解机器人领域长期存在的“灵巧操作泛化性”难题,即如何让机器人在面对柔性、易变形的物体时,仍能保持动作的稳定与精准。传统数据集多关注刚性物体抓取,而SortPaper提供了60个完整演示片段、超过三万余帧的高质量时序数据,使研究者能够探索状态空间中的动作因果关系,并建立对复杂接触动力学的鲁棒建模。其意义在于推动了从简单抓取向智能分拣的范式跃迁,为开发适应多形态物体的通用操作策略奠定了数据基石。
衍生相关工作
围绕SortPaper_20260529_145930 数据集,衍生出了多项推动技能学习领域发展的代表性工作。研究者曾基于该数据构建了“演示-强化”混合学习流水线,将模仿学习获取的初始策略通过深度强化学习微调,以提升对未见过纸张褶皱状态的鲁棒性。另有工作聚焦于跨任务迁移,利用该数据集中的状态-动作对预训练视觉编码器,再将其知识迁移至瓶子摆放或杯子倒置等相似操作场景。这些衍生成果不仅验证了数据集的广泛适配性,也彰显了其在连接示教学习与自主决策之间的桥梁作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务