遇见数据集

rishgang22/single_lego_pick_place_combined

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人操作数据集,专门用于单乐高块的抓取和放置任务。数据集包含163个episodes,总计70636帧,帧率为30fps。数据特征包括动作(6个浮点数,对应机器人关节位置)、观测状态(6个浮点数,同样对应关节位置)、观测图像(顶部和腕部摄像头视频,分辨率480x640,3通道,视频编码为av1,格式为yuv420p)、时间戳、帧索引、episode索引、索引和任务索引。数据集以parquet文件格式存储,视频文件为mp4格式,总数据大小为100MB,视频大小为200MB。机器人类型为so_follower,所有数据均用于训练集。

This is a robotic manipulation dataset developed using LeRobot, specifically designed for single Lego block grasping and placement tasks. The dataset contains 163 episodes, totaling 70636 frames with a frame rate of 30fps. The data features include actions (6 floating-point numbers corresponding to robot joint positions), observation states (6 floating-point numbers, also corresponding to joint positions), observation images (videos captured by top and wrist cameras, with a resolution of 480x640, 3 channels, encoded in av1 format with yuv420p pixel format), timestamps, frame indices, episode indices, global indices, and task indices. The dataset is stored in parquet file format, while the video files are in mp4 format. The total size of the non-video data is 100 MB, and the total size of the video files is 200 MB. The robot type used is so_follower, and all the data is allocated to the training set.

提供机构:
rishgang22
搜集汇总
数据集介绍
rishgang22/single_lego_pick_place_combined 数据集图片
构建方式
在机器人操作数据集的构建中,基于真实机器人平台采集多模态演示逐渐成为推动策略学习的重要途径。该数据集借助LeRobot框架,由SO-100 follower机械臂执行单一乐高积木拾取与放置任务,通过遥操作或预设轨迹生成动作序列。采集过程中同步记录关节位置与夹爪状态作为动作及本体感知观测,并以30帧每秒的帧率捕获顶部与腕部两路视频流。所有轨迹经时间对齐与格式化后,以Parquet文件存储于data目录,辅以meta/info.json描述元信息,最终形成包含163个回合、70636帧的规范化数据集。
特点
该数据集聚焦于单一乐高积木拾取放置任务,涵盖163个演示回合,总计超过七万帧的时序数据,为机器人精细操作研究提供了密集且结构化的样本。动作空间与状态空间均为六维关节位置,包括肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转及夹爪开合,表征清晰且物理意义明确。视觉模态由顶部全局视图和腕部局部视图构成,分辨率达480×640,以AV1编码存储,兼顾空间细节与数据压缩效率。所有数据以统一配置和训练集划分方式组织,便于直接加载与复现。
使用方法
在机器人模仿学习或策略训练中,可通过HuggingFace datasets库直接加载该数据集,利用configs定义自动解析Parquet数据文件与元信息。研究人员能够以回合为单位抽取动作、状态、视觉观测和任务索引,用于行为克隆、视觉运动策略或时序预测模型的训练。借助LeRobot提供的可视化工具,可在线预览数据集中的操作轨迹与视频片段,辅助验证数据质量。数据集亦可与LeRobot训练流程无缝对接,支持端到端的策略学习与评估,为拾取放置任务的算法对比提供标准化基准。
背景与挑战
背景概述
机器人操作技能的数据驱动学习近年来成为具身智能研究的关键路径,高质量演示数据的匮乏长期制约着模仿学习与视觉-语言-动作模型的泛化能力。single_lego_pick_place_combined数据集依托LeRobot开源框架构建,于2024至2025年间由Hugging Face社区贡献者整理发布,聚焦单块乐高积木的抓取与放置这一经典操作任务,包含163个演示回合、逾七万帧同步视觉与本体感知记录。该数据集以SO-100系列低成本机械臂为平台,为机器人抓取策略学习、多模态表征对齐及端到端控制研究提供了标准化基准,对推动数据高效机器人学习具有基础性意义。
当前挑战
该数据集所应对的核心领域问题在于,如何在视觉观测与关节构型的高维耦合中实现稳定且可泛化的抓取-放置控制。构建过程中面临多重挑战:其一,单一任务设定下演示多样性有限,姿态、光照与物体摆放的分布偏移容易导致策略过拟合;其二,六自由度关节位姿与双路视频流的时空对齐需在30帧率下保持严格同步,对数据采集与后处理提出精度要求;其三,乐高积木的规则几何形态虽降低感知歧义,却使接触动力学对抓取力与位姿误差高度敏感,成功演示的筛选与标注依赖细致的质量控制流程。
常用场景
经典使用场景
在机器人学习与具身智能领域,单块乐高积木的抓取与放置任务构成了验证精细操作策略的典型试验台。该数据集以30帧每秒的频率同步采集了六自由度机械臂的关节位置、夹爪状态以及俯视与腕部双视角的视觉流,共涵盖163个完整回合、逾七万帧的交互记录。研究者依托此类数据,通常将模仿学习或视觉-运动策略学习范式作为核心方法,通过监督学习的方式训练智能体从原始像素与本体感知信号中直接映射出动作序列,进而实现端到端的抓取-搬运-放置行为复现。其最经典的使用场景即在于为基于示教的机器人操作策略提供高保真的时序对齐训练素材,使模型能够在连续动作空间中习得稳定且可泛化的操控技能。
解决学术问题
该数据集直面机器人操作学习中长期存在的若干基础性难题,包括高维视觉输入与低维动作输出之间的语义鸿沟、多阶段任务中的时序依赖建模以及示范数据稀缺条件下的策略泛化能力不足等。借助其多模态同步记录,研究者得以系统探究视觉表征与本体感知的融合机制,检验不同时序建模架构在长程操作任务中的有效性,并量化分析示范数量与策略性能之间的缩放规律。该数据集的公开为精细操作任务的基准评测提供了可复现的实验平台,推动了模仿学习与视觉运动控制领域的方法论对比与迭代,其意义在于降低了机器人学习研究的准入门槛,并为算法鲁棒性评估确立了可参照的标准化任务设定。
衍生相关工作
围绕该数据集衍生的经典工作主要集中于视觉-语言-动作模型与扩散策略等前沿方向。研究者利用其双视角视觉流与关节轨迹数据,探索了基于Transformer架构的动作分块预测方法,验证了长时序动作序列建模在精细抓取任务中的优势;亦有工作将扩散概率模型引入动作生成过程,借助该数据集的多模态示范学习复杂动作分布,显著提升了策略在接触丰富场景下的稳定性。此外,该数据集被广泛用于LeRobot生态中的策略预训练与迁移学习实验,催生了一系列面向低成本机械臂的模仿学习基线,为后续多任务操作数据集的设计与评测提供了范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务