遇见数据集

vla0-real-world-dataset-v3

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

该数据集是使用LeRobot框架创建的真实世界机器人数据集,旨在支持机器人学习和视觉语言动作(VLA)任务。数据采集自so_follower机器人平台,以30 FPS帧率记录,包含400个episode,总计124,624帧,覆盖4个不同任务。数据集结构丰富,主要特征包括:动作指令(6维浮点数组,表示肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置);观测状态(6维关节位置);来自五个摄像头视角(腕部、上方、右侧、左侧、中间)的彩色图像观测,每帧图像分辨率为480x640,3通道,以AV1编码视频格式存储;电机电流和速度(各6维整数数组);以及来自中间摄像头的深度图(480x640,uint16类型)。此外,还包含时间戳、帧索引、episode索引、全局索引和任务索引等元数据。数据以Parquet文件格式分块存储,总数据文件大小约100 MB,视频文件大小约200 MB。该数据集适用于机器人控制策略学习、模仿学习、强化学习以及多模态感知与动作生成等研究。

This dataset is a real-world robot dataset created using the LeRobot framework, designed to support robot learning and Vision-Language-Action (VLA) tasks. Data is collected from a robot platform named so_follower, recorded at 30 FPS, containing 400 episodes with a total of 124,624 frames, covering 4 different tasks. The dataset has a rich structure, with key features including: action commands (6-dimensional float arrays representing shoulder translation, shoulder lift, elbow bend, wrist bend, wrist rotation, and gripper position); observation states (6-dimensional joint positions); color image observations from five camera perspectives (wrist, overhead, right, left, center), each frame with a resolution of 480x640, 3 channels, stored in AV1-encoded video format; motor currents and speeds (each as 6-dimensional integer arrays); and depth maps from the center camera (480x640, uint16 type). Additionally, it includes metadata such as timestamps, frame indices, episode indices, global indices, and task indices. Data is stored in chunked Parquet file format, with a total data file size of approximately 100 MB and video file size of about 200 MB. This dataset is suitable for research in robot control policy learning, imitation learning, reinforcement learning, and multimodal perception and action generation.

创建时间:
2026-06-22
原始信息汇总
  • 数据集名称: vla0-real-world-dataset-v3
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 标签: LeRobot
  • 创建工具: 使用 LeRobot 创建
  • 数据文件: 位于 data/*/*.parquet,包含 400 个片段 (episodes),共 124,624 帧 (frames),数据文件大小约 100 MB,视频文件大小约 200 MB
  • 帧率 (FPS): 30
  • 机器人类型: so_follower
  • 任务总数: 4 个任务 (tasks)
  • 数据集划分: 训练集 (train) 包含第 0 到第 399 个片段 (共 400 个)

特征 (Features)

该数据集包含以下特征,每个特征均以 30 FPS 记录:

动作 (Action) 与观测状态 (Observation.State)

  • 维度: 6 维
  • 数据类型: float32
  • 名称: shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos

观测图像 (Observation.Images)

共包含 5 个摄像头视角,均为视频格式,分辨率为 480x640,3 个通道 (RGB),使用 AV1 编码,yuv420p 像素格式,帧率 30 FPS:

  • wrist (手腕)
  • above (上方)
  • right (右侧)
  • left (左侧)
  • middle (中间)

观测电机信号 (Observation.Motor)

  • 电机电流 (motor_currents): int32,6 维,包含 shoulder_pan.current, shoulder_lift.current, elbow_flex.current, wrist_flex.current, wrist_roll.current, gripper.current
  • 电机速度 (motor_velocities): int32,6 维,包含 shoulder_pan.velocity, shoulder_lift.velocity, elbow_flex.velocity, wrist_flex.velocity, wrist_roll.velocity, gripper.velocity

观测深度图 (Observation.Depths)

  • middle: 深度图像,uint16 类型,分辨率为 480x640

元数据 (Metadata)

  • timestamp: float32,形状 [1]
  • frame_index: int64,形状 [1]
  • episode_index: int64,形状 [1]
  • index: int64,形状 [1]
  • task_index: int64,形状 [1]

数据路径结构

  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 分块大小 (chunks_size): 1000
搜集汇总
数据集介绍
vla0-real-world-dataset-v3 数据集图片
构建方式
在机器人学习领域,高质量的数据集是推动策略泛化与鲁棒性提升的关键基石。vla0-real-world-dataset-v3 数据集由研究者通过 LeRobot 框架精心构建,采集自真实世界环境。该数据集包含 400 个演示片段,总计 124,624 帧数据,涉及 4 种不同的任务。数据以每秒 30 帧的采样率记录,并采用高效的 AV1 视频编码对视像流进行压缩存储。数据集的模态设计极为丰富,囊括来自机械臂六个关节的实时状态、动作指令(包含位置与速度)、电机电流信息,以及五个不同视角(腕部、上方、左侧、右侧、中部)的高清视觉图像,辅以中部深度图,从而为模仿学习与多模态融合提供了完备且同步的信号。
特点
该数据集最显著的特点在于其多模态融合感知能力与对机器人本体控制的全面覆盖。除了标准的关节位置与动作数据,它还引入了电机电流与速度信息,为研究基于动力学特征的精细操控提供了先验。视觉部分涵盖了五个空间视角,特别是腕部与中部视角的深度图结合,赋予模型立体感知与精细定位能力。所有观测信号均在同一时间戳下对齐,保证了序列学习中的时空一致性。数据集的存储格式(Parquet 与压缩视频)也兼顾了查询效率与存储开销。
使用方法
用户可通过 LeRobot 库的 API 直接加载与使用此数据集,其预定义的数据结构(包括训练集与无测试集划分)遵循了机器人学习领域内成熟的 HDF5 兼容范式。在具体应用时,研究者可将视觉观测序列与动作指令配对,训练基于行为克隆或隐式策略的端到端操控模型。利用其包含的电流、速度等本体感受信号,亦可开展借鉴人类肌肉记忆的触觉力觉先验融合研究。数据集的 4 种任务划分通过 task_index 标识,便于进行多任务学习环境的搭建与评估。
背景与挑战
背景概述
在机器人操作领域,数据驱动的模仿学习方法近年来取得了显著进展,但其性能高度依赖于大规模、高质量的真实世界演示数据。vla0-real-world-dataset-v3数据集由研究人员mattpidden于2024年创建,基于Hugging Face的LeRobot框架构建,旨在为基于视觉-语言-动作(VLA)模型的机器人操纵任务提供标准化训练资源。该数据集采用SO-Follower机器人平台,以30帧/秒的采样率采集了400个episode、超过12万帧的多视角视觉与关节状态数据,涵盖4类操作任务。数据集整合了5个不同角度的RGB摄像头图像、深度图及6维关节动作与状态信息,为多模态融合的机器人学习研究奠定了坚实基础,对推动VLA模型在真实环境中的泛化能力具有重要参考价值。
当前挑战
构建该数据集所面临的核心挑战在于解决机器人操控领域长期存在的感知-行动耦合难题。具体挑战包括:1) 真实环境中的物体多样性、光照变化与空间遮挡导致视觉观测的鲁棒性不足,需通过多视角成像与高分辨率视频记录来缓解;2) 机械臂6自由度运动与夹爪控制之间的时序同步要求极高,30Hz的高频采样对硬件同步与存储系统提出了严格考验;3) 数据采集过程中,人工遥操作演示的动作一致性难以保证,不同episode间可能存在轨迹歧义,增加了后续学习算法的收敛难度;4) 多模态数据(图像、深度、关节电流与速度)的异构融合与标准化编码,要求在LeRobot框架下统一parquet与视频文件的存储格式,以确保数据的高效加载与复现性。
常用场景
经典使用场景
在机器人学习与操控领域,vla0-real-world-dataset-v3为视觉-语言-动作(VLA)模型的训练与评估提供了关键数据支撑。该数据集通过同步记录机械臂六个关节的位姿、电机电流与速度、多视角高清视觉图像及深度信息,构建了从感知到执行的完整闭环。其典型应用场景涵盖模仿学习、行为克隆以及基于视觉的机器人操控策略学习,研究者可利用640×480分辨率的腕部、上方、左右及中部摄像头数据,结合30Hz高频采样的动作序列,训练机器人完成精密抓取、装配等复杂任务。数据集中400个演示回合覆盖4种不同任务,为多任务泛化与零样本迁移学习奠定了坚实基础。
实际应用
在实际工业与生活场景中,该数据集驱动了灵巧操作机器人的智能化升级。基于其训练出的视觉-语言-动作模型,机器人能够通过多摄像头融合感知环境,自适应调整关节角度与夹爪力控,完成精密电子元件的装配、柔性物料的抓取以及个性化物品的分拣等任务。其所蕴含的多样化演示数据,使机器人具备小样本快速适应新场景的能力,例如在仓储物流中根据视觉反馈动态调整抓取策略,或在医疗辅助领域实现轻柔且精准的操作。这些应用显著降低了机器人编程门槛,提升了生产线的柔性与自主决策水平。
衍生相关工作
该数据集催化了一系列前沿研究成果的诞生。围绕其多模态感知与动作对齐特性,衍生出基于Transformer的视觉-语言-动作联合建模框架,以及利用扩散策略生成平滑操控轨迹的创新方法。研究者借鉴其关节电流与速度数据,开发出融合动力学先验的强化学习算法,大幅提升了机器人操作的鲁棒性与安全性。同时,数据集的公开发布催生了针对多任务泛化的元学习工作,以及利用对抗训练增强视觉特征不变性的探索。这些工作不仅深化了对机器人技能获取机制的理解,也为构建通用型具身智能体提供了可复现的基准与实验平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务