遇见数据集

so101_lego_20260613_20260613_131100

收藏
Hugging Face2026-06-14 更新2026-06-15 收录
官方服务:

资源简介:

该数据集由LeRobot平台创建,专为机器人技术任务设计,包含机器人操作任务的演示数据,涵盖状态观测、动作执行及视觉感知。数据集规模为157个任务片段(episodes)和95234个时间步(frames),以Parquet文件格式存储,并包含MP4格式的视频文件。核心特征包括:动作空间(action)为6维浮点数组,对应肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置;状态观测(observation.state)为6维浮点数组,记录机器人各关节实时位置;视觉观测(observation.images.front)提供前向摄像头视频流,分辨率为480x640,3通道彩色图像,编码格式为AV1,帧率为30fps。此外,数据集包含时间戳、帧索引、片段索引、全局索引和任务索引等元数据字段,数据按块(chunks)组织,每块包含1000个frames。适用于机器人模仿学习、强化学习、行为克隆及视觉-动作策略学习等研究与应用场景。

This dataset is created by the LeRobot platform and designed for robotics tasks, containing demonstration data for robot manipulation tasks that encompass state observations, action execution, and visual perception. The dataset scale includes 157 complete task episodes and 95,234 timesteps (frames), stored in Parquet file format along with MP4 video files. Core features include: action space (action) as a 6-dimensional floating-point array corresponding to shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, and gripper position; state observation (observation.state) as a 6-dimensional floating-point array recording real-time joint positions of the robot; visual observation (observation.images.front) providing a front-facing camera video stream with a resolution of 480x640, 3-channel color images, AV1 encoding format, and a frame rate of 30fps. Additionally, the dataset includes metadata fields such as timestamps, frame indices, episode indices, global indices, and task indices. Data is organized into chunks, with each chunk containing 1,000 frames. It is suitable for research and application scenarios like robot imitation learning, reinforcement learning, behavior cloning, and vision-action policy learning.

创建时间:
2026-06-13
原始信息汇总

数据集概述

  • 数据集名称: emboss369/so101_lego_20260613_20260613_131100
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 标签: LeRobot

数据集来源与创建

  • 该数据集使用 LeRobot 框架创建。
  • 机器人类型: so_follower

数据集规模

  • 总集数 (Episodes): 157
  • 总帧数 (Frames): 95,234
  • 总任务数 (Tasks): 1
  • 帧率 (FPS): 30
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB

数据划分

  • 训练集 (Train): 所有 157 集 (索引 0 到 156)

数据结构

数据集包含以下特征字段:

字段名 数据类型 形状 说明
action float32 (6,) 机器人动作,包含6个关节位置 (肩部回转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪)
observation.state float32 (6,) 机器人观测状态,与动作维度相同
observation.images.front video (480, 640, 3) 前置摄像头视频,编码格式为 AV1,像素格式 yuv420p,帧率30
timestamp float32 (1,) 时间戳
frame_index int64 (1,) 帧索引
episode_index int64 (1,) 集索引
index int64 (1,) 整体索引
task_index int64 (1,) 任务索引

数据存储格式:

  • 表格数据存储为 Parquet 文件,路径格式: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件存储为 MP4,路径格式: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

代码库版本: v3.0

引用

暂无提供 BibTeX 引用信息。

搜集汇总
数据集介绍
so101_lego_20260613_20260613_131100 数据集图片
构建方式
该数据集由开源机器人学习框架LeRobot构建,通过采集SO-100机械臂在真实环境下执行单一任务的遥操作数据而成。数据集共计包含157个演示片段,累计超过9.5万帧,以30帧/秒的采样率记录。数据以Parquet格式存储结构化的时间序列,包括6维关节动作与状态(各关节位置及夹爪开合度),同时同步采集640×480像素的前置视觉图像,视频采用AV1编码压缩。数据按块(chunk)组织,每块约1000帧,便于分布式加载。
特点
数据集核心特点在于其多模态对齐与高效压缩结构。动作与状态空间完全一致,均为6维浮点向量,支持直接监督学习范式。图像流以视频形式存储而非独立帧,通过CRF编码平衡画质与存储效率,200MB视频数据对应9.5万帧,压缩比显著。数据划分仅含训练集,157个episode覆盖单一任务,适合模仿学习场景。此外,LeRobot标准化的元数据格式(含时间戳、帧索引、任务标签)为跨数据集迁移提供了可扩展性基础。
使用方法
通过HuggingFace `datasets` 库加载时,需指定LeRobot专用配置,调用`load_dataset('emboss369/so101_lego_20260613_20260613_131100', trust_remote_code=True)`。数据以`default`配置接入,返回字典结构包含`action`、`observation.state`、`observation.images.front`、`episode_index`等字段。图像解码依赖PyAV后端,支持实时流式读取。用户可按`episode_index`进行轨迹分组,利用预置的`train`划分(0-156号episode)直接训练策略网络。推荐结合LeRobot的`Dataset`类进行批处理与数据增强。
背景与挑战
背景概述
so101_lego_20260613_20260613_131100数据集由研究机构基于LeRobot框架构建,发布于2026年6月,聚焦于机器人操作领域的模仿学习研究。该数据集利用SO-100型跟随机械臂,通过遥操作采集了157个乐高积木搭建任务的示教轨迹,包含95,234帧、30FPS的高频动作与视觉观测数据。动作空间涵盖6维关节位置(肩部、肘部、腕部及夹爪),同步记录640×480分辨率的前视RGB图像,为机器人从演示中学习精细操作技能提供了标准化基准。其Apache-2.0许可协议鼓励学术界与工业界广泛使用,推动了机器人学习领域数据共享与算法复现的进程。
当前挑战
该数据集核心解决的领域问题在于构建高精度、可泛化的机器人模仿学习系统,尤其针对乐高积木这类包含微小零件与精准对齐要求的装配任务。挑战包括:1)柔顺控制难题,机械臂需在夹持、对准和插接过程中平衡刚度与顺应性以避免损坏零件;2)视觉-触觉融合缺失,仅依赖单目RGB图像难以感知深度与接触力,导致空间定位误差;3)数据收集瓶颈,遥操作示范需要熟练操作者,且10万帧规模对长尾分布的复杂装配动作覆盖不足;4)域迁移困难,不同光照、背景或机械臂型号下,模型泛化能力受限。构建过程中还需处理视频编码(AV1)与Parquet文件的高效存储,以及多片段数据的一致性对齐挑战。
常用场景
经典使用场景
在机器人学习与操控领域,该数据集以乐高积木的精细装配为任务载体,记录了机械臂末端执行器从抓取、对准到插入的全过程动作序列。其经典使用场景聚焦于模仿学习与行为克隆研究,研究者可利用157个演示回合中同步采集的6维关节动作指令、机器人状态信息以及640×480像素的前向视觉影像,构建从感知到动作的端到端映射模型,从而复现并泛化复杂的装配技能。
解决学术问题
该数据集直面机器人技能学习中数据稀缺性与任务复杂性的矛盾,为攻克少样本模仿学习、跨任务泛化等核心学术难题提供了标准化基准。通过提供高频率(30FPS)的多模态对齐数据,它推动了基于视觉的运动规划、接触动力学建模以及犹豫-恢复行为分析等方向的研究进展,深刻影响了机器人操作从特定任务编程向数据驱动的技能自主习得范式转型。
衍生相关工作
围绕该数据集衍生了诸多奠基性工作,包括基于扩散策略的装配动作生成模型、融合时序对比学习的技能表示框架,以及利用仿真环境对乐高装配轨迹进行域随机化增强的迁移学习方法。此外,研究者还以其为测试床,提出了结合注意力机制的多视角动作预测架构,并探索了通过跨任务经验回放实现零样本泛化的技术路径,持续拓展了数据驱动机器人操控的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务