community_dataset_v3
收藏资源简介:
Lerobot Community Datasets v3 是一个大规模、众包的开源机器人数据集,专为视觉-语言-动作模型的跨具身预训练而设计。该数据集由全球235名社区贡献者共同创建,汇集了791个独立的数据集,总计包含50,622个任务片段、超过2,500万帧图像数据,以及总计251.5小时(约10.5天)的机器人操作演示。数据集涵盖了46种不同的机器人具身类型,包括单臂操作器(占88.4%)、双臂系统(6.7%)、移动操作平台(3.4%)和人形机器人(1.3%),并包含12种不同的动作维度配置。数据以标准化的LeRobot格式组织,每个数据集包含Parquet格式的观测数据文件、多视角MP4视频记录以及描述任务和机器人配置的JSON元数据。该数据集旨在支持跨具身视觉-语言-动作学习,使训练出的策略能够泛化到不同的机器人平台。其应用场景包括多任务操作(抓取放置、分类、装配等)、模仿学习、迁移学习、通用机器人策略开发以及移动操作研究。数据集经过系统清理,移除了存在文件缺失或数据类型问题的条目,确保了训练稳定性,并标准化了多摄像头视图输入以处理不同数据收集设置下的异质性问题。
Lerobot Community Datasets v3 is a large-scale, crowdsourced open-source robot dataset designed for cross-embodiment pretraining of vision-language-action models. The dataset is created by 235 community contributors worldwide, aggregating 791 independent datasets, totaling 50,622 task episodes, over 25 million image frames, and 251.5 hours (approximately 10.5 days) of robot demonstration data. It covers 46 different robot embodiment types, including single-arm manipulators (88.4%), dual-arm systems (6.7%), mobile manipulators (3.4%), and humanoid robots (1.3%), with 12 different action dimension configurations. Data is organized in the standardized LeRobot format, with each dataset containing Parquet-format observation files, multi-view MP4 video recordings, and JSON metadata describing tasks and robot configurations. The dataset aims to support cross-embodiment vision-language-action learning, enabling trained policies to generalize across different robot platforms. Applications include multi-task manipulation (grasping, placing, sorting, assembly, etc.), imitation learning, transfer learning, general robot policy development, and mobile manipulation research. The dataset is systematically cleaned to remove entries with missing files or data type issues, ensuring training stability, and standardizes multi-camera view inputs to address heterogeneity from different data collection setups.
数据集概览
Community Dataset v3 是一个大规模、跨本体(Cross-Embodiment)的机器人视觉-语言-动作(VLA)预训练数据集,由 LeRobot 社区贡献者众包创建。
核心信息
- 许可协议:Apache-2.0
- 任务类别:机器人学(Robotics)
- 语言:英语
- 数据规模:约 1000 万至 1 亿条数据(10M < n < 100M)
- 数据集名称:Community Dataset v3
数据统计
| 指标 | 数值 |
|---|---|
| 总数据集数 | 791 |
| 总片段数(Episodes) | 50,622 |
| 总帧数(Frames) | 25,971,082 |
| 总时长 | 251.5 小时(约 10.5 天) |
| 贡献者人数 | 235 |
| 机器人类型 | 46 种不同本体 |
| 动作维度配置 | 12 种 |
| 平均每数据集时长 | 0.30 小时 |
机器人类型分布
按类别划分
- 单臂操作器:88.4%(699 个数据集)
- 双臂系统:6.7%(53 个数据集)
- 移动操作:3.4%(27 个数据集)
- 人形平台:1.3%(10 个数据集)
- 其他配置:0.3%(2 个数据集)
前 10 种机器人类型
- so100:248 个数据集(31.4%),单臂
- so101_follower:124 个数据集(15.7%),单臂
- so100_follower:121 个数据集(15.3%),单臂
- so101:82 个数据集(10.4%),单臂
- arx5:43 个数据集(5.4%),单臂
- koch:38 个数据集(4.8%),单臂
- trossen_ai_mobile:25 个数据集(3.2%),移动
- bi_xarm6_follower:16 个数据集(2.0%),双臂
- so100_bimanual:12 个数据集(1.5%),双臂
- koch_follower:8 个数据集(1.0%),单臂
数据集结构
数据集按贡献者组织,目录结构如下:
community_dataset_v3_clean/ ├── contributor1/ │ ├── dataset_name_1/ │ │ ├── data/ # Parquet 文件,包含观测数据 │ │ ├── videos/ # MP4 文件,多视角录像 │ │ └── meta/ # 元数据,如 info.json │ └── dataset_name_2/ ├── contributor2/ └── ...
数据清洗过程
从最初的 851 个数据集开始,经过系统清理后得到 791 个数据集。主要问题是:
- 缺失视频文件:移除约 15-20 个数据集。
- 数据类型不兼容:移除约 10-15 个数据集。
- 多相机配置问题:修复并重新处理了 16 个数据集,并标准化了输入图像数量(最多 3 张)。
- 视频时间戳未对齐:自动回退到最近帧,不影响训练。
- 不同帧率:许多数据集具有不同帧率(FPS),但保持有效。
预期用途
- 跨本体 VLA 训练:学习可跨机器人类型泛化的策略。
- 多任务操作:包括抓取、放置、分拣、组装、双臂任务等。
- 迁移学习:利用多样化演示为新机器人提供训练基础。
- 模仿学习研究:大规模行为克隆。
- 通用机器人策略:训练可在多个平台上工作的模型。
- 移动操作:结合导航与操作任务。
- 具身 AI 研究:视觉-运动协调。
主要贡献者(前 10 位)
- shuohsuan:57 个数据集(7.2%)
- villekuosmanen:47 个数据集(5.9%)
- LeRobot-worldwide-hackathon:31 个数据集(3.9%)
- lt-s:27 个数据集(3.4%)
- Qipei:23 个数据集(2.9%)
- bjb7:18 个数据集(2.3%)
- kumarhans:18 个数据集(2.3%)
- Ryosei2:17 个数据集(2.1%)
- kyomangold:16 个数据集(2.0%)
- psg777:16 个数据集(2.0%)
相关资源
- VLAb Framework - 大规模预训练框架
- SmolVLA Model - 预训练 VLA 模型
- SmolVLA Blog - 介绍与教程
- SmolVLA Paper - 技术细节
- LeRobot Docs - 完整文档
- Dataset Guide - 最佳实践指南
- Community Dataset v2 - 上一个版本
- Community Dataset v1 - 首个版本




