遇见数据集

community_dataset_v3

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

Lerobot Community Datasets v3 是一个大规模、众包的开源机器人数据集,专为视觉-语言-动作模型的跨具身预训练而设计。该数据集由全球235名社区贡献者共同创建,汇集了791个独立的数据集,总计包含50,622个任务片段、超过2,500万帧图像数据,以及总计251.5小时(约10.5天)的机器人操作演示。数据集涵盖了46种不同的机器人具身类型,包括单臂操作器(占88.4%)、双臂系统(6.7%)、移动操作平台(3.4%)和人形机器人(1.3%),并包含12种不同的动作维度配置。数据以标准化的LeRobot格式组织,每个数据集包含Parquet格式的观测数据文件、多视角MP4视频记录以及描述任务和机器人配置的JSON元数据。该数据集旨在支持跨具身视觉-语言-动作学习,使训练出的策略能够泛化到不同的机器人平台。其应用场景包括多任务操作(抓取放置、分类、装配等)、模仿学习、迁移学习、通用机器人策略开发以及移动操作研究。数据集经过系统清理,移除了存在文件缺失或数据类型问题的条目,确保了训练稳定性,并标准化了多摄像头视图输入以处理不同数据收集设置下的异质性问题。

Lerobot Community Datasets v3 is a large-scale, crowdsourced open-source robot dataset designed for cross-embodiment pretraining of vision-language-action models. The dataset is created by 235 community contributors worldwide, aggregating 791 independent datasets, totaling 50,622 task episodes, over 25 million image frames, and 251.5 hours (approximately 10.5 days) of robot demonstration data. It covers 46 different robot embodiment types, including single-arm manipulators (88.4%), dual-arm systems (6.7%), mobile manipulators (3.4%), and humanoid robots (1.3%), with 12 different action dimension configurations. Data is organized in the standardized LeRobot format, with each dataset containing Parquet-format observation files, multi-view MP4 video recordings, and JSON metadata describing tasks and robot configurations. The dataset aims to support cross-embodiment vision-language-action learning, enabling trained policies to generalize across different robot platforms. Applications include multi-task manipulation (grasping, placing, sorting, assembly, etc.), imitation learning, transfer learning, general robot policy development, and mobile manipulation research. The dataset is systematically cleaned to remove entries with missing files or data type issues, ensuring training stability, and standardizes multi-camera view inputs to address heterogeneity from different data collection setups.

创建时间:
2026-07-16
原始信息汇总

数据集概览

Community Dataset v3 是一个大规模、跨本体(Cross-Embodiment)的机器人视觉-语言-动作(VLA)预训练数据集,由 LeRobot 社区贡献者众包创建。

核心信息

  • 许可协议:Apache-2.0
  • 任务类别:机器人学(Robotics)
  • 语言:英语
  • 数据规模:约 1000 万至 1 亿条数据(10M < n < 100M)
  • 数据集名称:Community Dataset v3

数据统计

指标 数值
总数据集数 791
总片段数(Episodes) 50,622
总帧数(Frames) 25,971,082
总时长 251.5 小时(约 10.5 天)
贡献者人数 235
机器人类型 46 种不同本体
动作维度配置 12 种
平均每数据集时长 0.30 小时

机器人类型分布

按类别划分

  • 单臂操作器:88.4%(699 个数据集)
  • 双臂系统:6.7%(53 个数据集)
  • 移动操作:3.4%(27 个数据集)
  • 人形平台:1.3%(10 个数据集)
  • 其他配置:0.3%(2 个数据集)

前 10 种机器人类型

  1. so100:248 个数据集(31.4%),单臂
  2. so101_follower:124 个数据集(15.7%),单臂
  3. so100_follower:121 个数据集(15.3%),单臂
  4. so101:82 个数据集(10.4%),单臂
  5. arx5:43 个数据集(5.4%),单臂
  6. koch:38 个数据集(4.8%),单臂
  7. trossen_ai_mobile:25 个数据集(3.2%),移动
  8. bi_xarm6_follower:16 个数据集(2.0%),双臂
  9. so100_bimanual:12 个数据集(1.5%),双臂
  10. koch_follower:8 个数据集(1.0%),单臂

数据集结构

数据集按贡献者组织,目录结构如下:

community_dataset_v3_clean/ ├── contributor1/ │ ├── dataset_name_1/ │ │ ├── data/ # Parquet 文件,包含观测数据 │ │ ├── videos/ # MP4 文件,多视角录像 │ │ └── meta/ # 元数据,如 info.json │ └── dataset_name_2/ ├── contributor2/ └── ...

数据清洗过程

从最初的 851 个数据集开始,经过系统清理后得到 791 个数据集。主要问题是:

  • 缺失视频文件:移除约 15-20 个数据集。
  • 数据类型不兼容:移除约 10-15 个数据集。
  • 多相机配置问题:修复并重新处理了 16 个数据集,并标准化了输入图像数量(最多 3 张)。
  • 视频时间戳未对齐:自动回退到最近帧,不影响训练。
  • 不同帧率:许多数据集具有不同帧率(FPS),但保持有效。

预期用途

  • 跨本体 VLA 训练:学习可跨机器人类型泛化的策略。
  • 多任务操作:包括抓取、放置、分拣、组装、双臂任务等。
  • 迁移学习:利用多样化演示为新机器人提供训练基础。
  • 模仿学习研究:大规模行为克隆。
  • 通用机器人策略:训练可在多个平台上工作的模型。
  • 移动操作:结合导航与操作任务。
  • 具身 AI 研究:视觉-运动协调。

主要贡献者(前 10 位)

  1. shuohsuan:57 个数据集(7.2%)
  2. villekuosmanen:47 个数据集(5.9%)
  3. LeRobot-worldwide-hackathon:31 个数据集(3.9%)
  4. lt-s:27 个数据集(3.4%)
  5. Qipei:23 个数据集(2.9%)
  6. bjb7:18 个数据集(2.3%)
  7. kumarhans:18 个数据集(2.3%)
  8. Ryosei2:17 个数据集(2.1%)
  9. kyomangold:16 个数据集(2.0%)
  10. psg777:16 个数据集(2.0%)

相关资源

搜集汇总
数据集介绍
community_dataset_v3 数据集图片
构建方式
该数据集通过全球范围内235位社区贡献者的众包协作方式构建而成,所有数据均采用LeRobot框架进行采集与标准化处理。作为SmolVLA预训练所用数据集的扩展版本,它在先前发布的Community Dataset v1与v2基础上,经过系统性的清洗与整理,形成了一个跨本体(cross-embodiment)的视觉-语言-动作(VLA)预训练语料库。数据从851个原始数据集中经过严格筛选,剔除了缺失视频文件、数据类型不兼容及多相机配置导致的张量形状不一致等问题,最终保留了791个高质量数据集。
特点
该数据集覆盖了46种不同的机器人本体类型,包括单臂操作器(占88.4%)、双臂系统(6.7%)、移动操作平台(3.4%)以及人形机器人(1.3%),动作空间维度多达12种配置,展现了极高的多样性与异质性。数据总量包含约2600万帧、总计超过251小时的机器人操作演示,涵盖了各类精细操作任务。其最大特点在于支持跨本体策略学习,为训练能够在不同机器人平台间泛化的通用型具身智能体提供了宝贵的训练资源。
使用方法
用户可通过Hugging Face认证后,使用`hf download`命令将数据集下载至本地。数据以贡献者-数据集的层级目录组织,每个数据集包含Parquet格式的观测序列、多视角MP4视频文件及元数据JSON。借助LeRobot的`LeRobotDataset`接口,研究人员能够方便地加载单个子集并进行探索;而针对大规模跨本体VLA训练,推荐使用VLAb框架进行加速训练,支持在配置文件中指定多个数据集的组合路径,并结合多GPU环境与wandb进行实验追踪与监控。
背景与挑战
背景概述
随着具身智能与视觉-语言-动作(VLA)模型的迅猛发展,构建能够跨机器人形态泛化的通用策略成为领域内的重要研究方向。然而,数据规模不足、机器人形态单一始终制约着模型的泛化能力。在此背景下,由Hugging Face LeRobot社区与SmolVLA团队联合发起的Community Dataset v3数据集于近期发布,汇集了来自全球235位贡献者的791组子数据集,覆盖46种机器人类型,包括单臂、双臂、移动操作及少量人形机器人。该数据集基于LeRobot框架采集,专为跨形态VLA预训练设计,旨在推动通用机器人策略的研究。其规模与多样性在同类社区数据集中首屈一指,为跨形态模仿学习与多任务操作提供了宝贵的训练资源。
当前挑战
该数据集面临的核心挑战源于其社区众包特性带来的数据异构性与质量控制难题。从领域问题看,跨形态VLA训练需要模型在不同机器人运动学结构、传感器配置与动作空间之间建立统一的表示,当前数据集虽然覆盖了12种不同的动作维度配置,但不同形态间的动作语义差异仍构成重大学习障碍,尤其在双臂与移动操作任务中更为突出。从构建过程看,数据清洗过程中发现了四类典型问题:缺失视频文件导致训练崩溃、数据类型的隐性不兼容引发前向传播错误、多摄像头配置不一致引发张量形状不匹配(最终通过限制最大图像数为3来缓解)、以及视频帧时间戳偏移超出容差阈值。原始851组数据中最终清洗出791组可用,约7%的数据因质量问题被移除,凸显了大规模社区数据集标准化的艰巨性。
常用场景
经典使用场景
在机器人学与具身智能领域,community_dataset_v3被广泛用于跨本体视觉-语言-动作模型的预训练与泛化能力评估。该数据集汇集了来自全球235位贡献者的791个子数据集,涵盖46种机器人类型,包括单臂操作、双臂协同、移动操作及人形机器人等丰富构型。研究者通常利用其多样性,训练能够跨越不同机器人形态与任务场景的通用策略网络,尤其适用于迁移学习与行为克隆范式中对多源异构演示数据的整合与利用。
衍生相关工作
围绕community_dataset_v3,已衍生出一系列具有影响力的研究工作。其中,SmolVLA模型直接基于该数据集的前期版本进行预训练,开创了轻量化视觉-语言-动作模型在跨本体场景下的训练范式。VLAb训练框架则为此类数据的规模化使用提供了标准化流水线,兼容多机器人数据加载与多策略训练。此外,数据集的清洗与组织过程本身也催生了关于社区贡献数据质量控制的方法论探讨,如视频完整性校验、数据类型统一与多视角归一化策略,这些技术被后续的LeRobot生态系统采纳,推动了开源具身智能数据集的规范化建设。
数据集最近研究
最新研究方向
以社区数据集v3为代表的跨具身预训练研究正引领具身智能领域迈向通用化机器人策略的新纪元。该数据集汇聚了全球235名贡献者的791个数据集,横跨46种机器人形态,涵盖单臂、双臂、移动操作及人形机器人,为视觉-语言-动作模型提供了前所未有的规模化、多形态训练资源。这一前沿方向直接响应了机器人领域长期面临的跨形态泛化挑战——如何让一个单一策略适应不同机械结构与任务场景。通过配套的VLAb预训练框架,研究重心正在从单一任务模仿学习转向大规模跨具身行为克隆,旨在催生具备零样本迁移能力的通用型机器人智能体。该工作不仅彰显了开源社区协作的惊人力量,更标志着机器人学习范式正从实验室封闭环境向真实世界开放生态的历史性跨越,为构建通用机器人基础模型奠定了坚实的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务