遇见数据集

CV-Rob/rollout_so101_lego_pick_place_20260526_230408

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

--- license: apache-2.0 task_categories: - robotics tags: - LeRobot configs: - config_name: default data_files: data/*/*.parquet --- This dataset was created using [LeRobot](https://github.com/huggingface/lerobot). <a class="flex" href="https://huggingface.co/spaces/lerobot/visualize_dataset?path=CV-Rob/rollout_so101_lego_pick_place_20260526_230408"> <img class="block dark:hidden" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl.svg"/> <img class="hidden dark:block" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl-dark.svg"/> </a> ## Dataset Description - **Homepage:** [More Information Needed] - **Paper:** [More Information Needed] - **License:** apache-2.0 ## Dataset Structure [meta/info.json](meta/info.json): ```json { "codebase_version": "v3.0", "fps": 30, "features": { "action": { "dtype": "float32", "names": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "shape": [ 6 ] }, "observation.state": { "dtype": "float32", "names": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "shape": [ 6 ] }, "observation.images.gripper": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "height", "width", "channels" ], "info": { "video.height": 480, "video.width": 640, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "video.fps": 30, "video.channels": 3, "has_audio": false, "video.g": 2, "video.crf": 30, "video.preset": 12, "video.fast_decode": 0, "video.video_backend": "pyav", "video.extra_options": {} } }, "observation.images.top": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "height", "width", "channels" ], "info": { "video.height": 480, "video.width": 640, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "video.fps": 30, "video.channels": 3, "has_audio": false, "video.g": 2, "video.crf": 30, "video.preset": 12, "video.fast_decode": 0, "video.video_backend": "pyav", "video.extra_options": {} } }, "intervention": { "dtype": "bool", "shape": [ 1 ], "names": null }, "timestamp": { "dtype": "float32", "shape": [ 1 ], "names": null }, "frame_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "episode_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "task_index": { "dtype": "int64", "shape": [ 1 ], "names": null } }, "total_episodes": 1, "total_frames": 12272, "total_tasks": 1, "chunks_size": 1000, "data_files_size_in_mb": 100, "video_files_size_in_mb": 200, "data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "video_path": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "robot_type": "so_follower", "splits": { "train": "0:1" } } ``` ## Citation **BibTeX:** ```bibtex [More Information Needed] ```

This dataset is a robotics manipulation dataset focused on Lego brick pick-and-place tasks. It was created using the LeRobot framework and includes features such as robot joint positions (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), observation states (including video streams from top and gripper cameras with 480x640 resolution, 30fps frame rate, av1 encoding), intervention signals, timestamps, frame indices, episode indices, and more. The dataset contains 1 episode, 12272 frames, and 1 task, stored in parquet format for data and mp4 for videos, with a total size of approximately 300MB (100MB for data, 200MB for videos). The robot type is so_follower, making it suitable for robotics learning and control research.

提供机构:
CV-Rob
搜集汇总
数据集介绍
CV-Rob/rollout_so101_lego_pick_place_20260526_230408 数据集图片
构建方式
该数据集依托LeRobot框架,于SO-101机械臂上执行乐高积木抓取与放置任务时采集生成。构建过程以30帧每秒的采样频率同步记录机械臂六自由度的关节位置状态与动作指令,并集成夹爪视角与俯视视角的双路视频流,完整保留单次任务执行中从接近、抓取到放置的全过程时序信息。数据以parquet列式格式存储,按分块结构组织,视频以AV1编码压缩,兼顾存储效率与解码性能,为机器人操作策略的学习与复现提供原始轨迹支撑。
特点
数据集的显著特征在于多模态同步与精细时序标注的融合。观测状态与动作空间均涵盖肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转及夹爪开合六个维度,配以双视角视觉信息,形成完整的感知-动作映射。数据集包含单条任务轨迹,总帧数达12272帧,单任务设定使标注聚焦且一致。此外,干预标志位的引入可区分人工干预与自主执行片段,为模仿学习中的行为克隆与离线强化学习提供可筛选的监督信号。
使用方法
使用者可借助LeRobot工具链直接加载该数据集,通过Hugging Face数据集库读取parquet数据文件,并利用元信息中的路径模板定位视频资源。数据集支持可视化预览,便于快速核验轨迹质量。在模型训练阶段,可将观测状态与图像输入策略网络,以动作序列作为监督目标,开展行为克隆或条件模仿学习。干预与时间戳字段可用于片段筛选与因果分析,任务索引与回合索引则支持多任务扩展场景下的数据组织与检索。
背景与挑战
背景概述
机器人操作技能的学习长期依赖真实环境中的交互数据,而高质量演示数据的稀缺制约了模仿学习与视觉-语言-动作模型的泛化能力。本数据集由CV-Rob团队于2026年依托LeRobot框架构建,聚焦SO-101机械臂执行乐高积木拾取与放置任务的单次完整 rollout。数据采集以30帧/秒同步记录双路视觉观测与六维关节状态,并引入干预标志以区分自主策略与人工接管片段,为精细操作策略研究提供了基准测试资源。其核心价值在于以标准化格式捕捉接触密集、位姿敏感的抓放过程,对机器人操作学习与数据驱动控制领域具有实证参考意义。
当前挑战
乐高拾取与放置任务的难点在于积木尺寸小、形状规则但抓取容差极低,机械臂需在有限视野内完成亚厘米级的对准与稳定的力控闭合,任意关节的微小偏差都会导致抓取失败或滑落。构建过程中的挑战则在于:单次rollout仅含一条轨迹,数据规模有限,难以覆盖初始位姿变化和光照扰动,训练策略易过拟合;同时干预标志的引入要求精确划分人工接管与自主执行边界,而视频编码压缩与关节状态的时间对齐可能引入观测与动作间的细微错位,对时序建模的鲁棒性构成额外考验。
常用场景
经典使用场景
在机器人学习与具身智能领域,机械臂抓取与放置任务始终是检验控制策略泛化能力的试金石。该数据集以SO-101跟随型机械臂为平台,围绕乐高积木的抓取与放置构建了单一回合、共计12272帧的视觉-动作序列,采样频率为30帧每秒,涵盖夹爪与俯视双视角视频流以及六自由度关节位置信息。其最经典的使用场景在于模仿学习框架下的行为克隆训练,即利用高频率同步采集的状态-动作对与多视角视觉观测,驱动策略网络学习从原始像素到关节控制指令的端到端映射,尤其适合评估视觉表征在精细操作任务中的有效性。
解决学术问题
该数据集直面机器人模仿学习中演示数据稀缺与高维视觉输入难以有效对齐的学术难题。在真实世界机械臂操作研究中,获取大规模、高质量且时间同步的视觉-动作数据成本高昂,而该数据集通过LeRobot标准化格式提供了完整的时序标注与多模态观测,使研究者能够系统探究视觉编码器架构、时序建模策略以及动作分块等关键设计对策略性能的影响,为破解演示数据有限条件下精细操作策略的泛化瓶颈提供了可复现的实证基础,对推动数据驱动的机器人操控研究具有基准性意义。
衍生相关工作
依托LeRobot开源生态,该数据集催生了若干围绕视觉-语言-动作模型与扩散策略的经典衍生工作。研究者常将其作为基准数据,用于验证ACT、Diffusion Policy及π0等先进模仿学习算法在真实机械臂任务上的表现,并据此开展多任务联合训练与跨本体迁移实验;同时,该数据集的结构化元信息也为数据增强、视频预测与离线强化学习等方向提供了标准化测试床,推动了机器人学习社区在数据格式统一与算法可比性方面的持续进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务