遇见数据集

so101_camera_dataset

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集是基于LeRobot框架创建的机器人操作数据集,记录了so_follower型机器人在单一任务上的演示数据。数据集包含13个episode,共计13419帧图像和对应的状态动作序列。每个时间步提供以下特征:从外部摄像头采集的RGB图像(480x640x3)和深度图像(480x640x1,单位毫米),以及从腕部摄像头采集的RGB图像和深度图像。同时记录机器人6维关节状态(包括肩部、肘部、腕部、夹爪位置)和对应的6维动作指令。数据以parquet文件格式存储,附带时间戳、帧索引、episode索引和任务索引。该数据集适用于机器人模仿学习、行为克隆、离线强化学习等研究任务。

This dataset is a robot manipulation dataset created based on the LeRobot framework, recording demonstration data of the so_follower robot on a single task. The dataset contains 13 episodes, totaling 13,419 frames of images and corresponding state-action sequences. Each timestep provides the following features: RGB images (480x640x3) and depth images (480x640x1, in millimeters) from an external camera, as well as RGB and depth images from a wrist camera. It also records the robots 6-dimensional joint states (including shoulder, elbow, wrist, and gripper positions) and corresponding 6-dimensional action commands. The data is stored in parquet file format, accompanied by timestamps, frame indices, episode indices, and task indices. This dataset is suitable for research tasks such as robot imitation learning, behavioral cloning, and offline reinforcement learning.

创建时间:
2026-08-07
原始信息汇总

SO101 相机数据集

数据集简介

该数据集是使用 LeRobot(Hugging Face 的机器人学习框架)创建的机器人操作数据集,主要包含相机图像和机器人状态信息。

基本信息

  • 许可证: Apache-2.0
  • 任务类别: 机器人技术(Robotics)
  • 数据格式: Parquet(数据文件位于 data/*/*.parquet

数据规模

项目 数值
总片段数(Episodes) 13
总帧数(Frames) 13,419
总任务数(Tasks) 1
数据文件大小 100 MB
视频文件大小 200 MB
采样频率 30 FPS
机器人类型 so_follower

数据特征(Features)

图像数据

特征名 类型 尺寸 说明
image RGB图像 640×480×3 主相机彩色图像
image_depth 深度图 640×480×1 主相机深度图像(单位:mm)
wrist_image RGB图像 640×480×3 腕部相机彩色图像
wrist_image_depth 深度图 640×480×1 腕部相机深度图像(单位:mm)

状态与控制数据

特征名 类型 维度 含义
state float32 6 机器人关节状态(肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)
actions float32 6 机器人动作指令(对应相同的6个关节控制量)

元数据

特征名 类型 说明
timestamp float32 时间戳
frame_index int64 帧索引
episode_index int64 片段索引
index int64 全局索引
task_index int64 任务索引

数据集划分

  • 训练集: 全部13个片段(train: 0:13

代码库版本

  • LeRobot 版本: v3.0
  • 块大小(Chunk Size): 1000
搜集汇总
数据集介绍
so101_camera_dataset 数据集图片
构建方式
在机器人学习领域,高质量的多模态数据集是推动算法进步的核心基础。so101_camera_dataset的构建依托于LeRobot开源框架,通过so_follower机器人平台采集。该数据集以30帧每秒的频率记录操作任务,涵盖十三个独立回合,总计一万三千四百一十九帧画面。每帧数据同步捕获了主视角与腕部视角的彩色图像及对应的深度信息,同时记录了六自由度机械臂的关节位置状态与动作指令。数据以Parquet格式按块存储,遵循LeRobot v3.0代码库版本的结构规范,确保了数据的完整性与可复现性。
特点
该数据集的核心特点在于多模态视觉-动作信息的深度融合。视觉层面,主视角与腕部视角均提供了高分辨率的RGB图像和深度图,深度信息以毫米为单位,为三维环境感知提供了直接支持。状态与动作空间覆盖肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转及夹爪六个维度,完整刻画了机械臂的精细操作。数据集规模适中,包含十三个回合和单一任务场景,适合针对特定操作技能的快速验证与算法迭代,其标准化格式也便于与LeRobot生态工具无缝对接。
使用方法
使用该数据集时,研究者可通过LeRobot框架提供的可视化工具在线浏览数据样本,直观了解任务执行过程。数据加载方面,Parquet文件按块组织,每一帧包含图像、深度图、状态、动作及时间戳等字段,可直接被PyTorch或TensorFlow等深度学习框架读取。针对模仿学习或强化学习任务,用户可将状态与动作序列作为策略网络的输入输出对,利用视觉信息增强环境表征能力。训练集划分覆盖全部十三回合,使用者无需额外分割即可进行模型训练,也可根据需求自定义数据划分或任务筛选。
背景与挑战
背景概述
在机器人学习领域,高质量、多模态的示范数据是推动算法进步的关键。so101_camera_dataset由LeRobot框架构建,于2024年发布,旨在为机器人操作任务提供包含视觉、深度和状态信息的示范数据集。该数据集基于so_follower机器人平台,采集了13个回合、13419帧数据,涵盖RGB图像、深度图以及关节位置和动作,支持模仿学习与视觉运动策略研究。其多模态特性为机器人感知与控制的融合提供了宝贵资源,有助于推动端到端机器人学习的发展。
当前挑战
so101_camera_dataset所应对的核心挑战在于机器人操作任务中多模态感知与动作生成的复杂性。具体而言,其领域问题涉及如何利用视觉和深度信息实现精确的机械臂控制与抓取,这对算法的泛化能力和鲁棒性提出高要求。构建过程中,需确保多传感器数据的同步采集与标定,并处理高维状态空间与动作空间的映射问题。此外,数据集规模有限,仅包含单任务示范,可能限制模型在多样化场景下的迁移能力。
常用场景
经典使用场景
在机器人学习领域,视觉-动作映射的建模长期依赖高质量的示教数据,so101_camera_dataset恰为这一需求提供了典型支撑。该数据集以30帧每秒的采样频率,同步记录了主视角图像、深度图、腕部视角图像及其深度信息,以及六自由度机械臂的关节位置与动作指令,构成了多模态观测与本体感知的完整序列。其最经典的使用场景在于模仿学习中的行为克隆,研究者可基于连续视觉帧预测机械臂的关节动作,实现从感知到控制的端到端策略学习。
解决学术问题
该数据集针对机器人操作中视觉表征与动作生成之间的语义鸿沟问题,提供了时间对齐的多视角RGB-D观测和精确状态轨迹,使得学界得以系统探究深度信息对策略泛化性的增益,以及腕部视角在精细操作中的互补价值。通过13个回合、逾一万三千帧的连续记录,它缓解了真实机器人数据稀缺的困境,为视觉运动策略的稳健性评估、域随机化方法验证及多模态融合机制研究奠定了可复现的数据基础,推动了从仿真到现实迁移的相关探索。
衍生相关工作
以该数据集为训练基础,LeRobot生态内衍生出若干经典工作,包括基于扩散策略的视觉运动生成模型、采用ACT算法的双臂协同模仿学习框架,以及针对深度模态设计的多尺度特征融合网络。部分研究进一步将其作为基准,评估不同视觉骨干网络在机械臂控制中的表现,并提出了结合时序卷积与注意力机制的改进策略。这些工作共同丰富了开源机器人学习社区的方法论,并促进了标准化评测流程的形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务