遇见数据集

svla_so101_pickplace

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

该数据集是使用 LeRobot 框架创建的机器人操控数据集,适用于模仿学习、机器人控制等任务。数据集包含 50 个 episode,共 11939 帧,来自 1 个任务,并包含 100 个视频(每个摄像头视角各一个视频)。数据以 30 FPS 的帧率采集,机器人类型为 so100_follower。数据特征包括:6 维动作(关节位置,如 shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll、gripper)、6 维机器人状态(与动作维度相同)、两个摄像头图像(上方视角和侧面视角,分辨率 480x640,AV1 编码,3 通道),以及时间戳、帧索引、episode 索引、索引和任务索引等辅助字段。所有数据存储为 Parquet 文件,视频存储为 MP4 文件。数据集采用 Apache-2.0 许可证,所有训练数据未划分验证集(train 为 0:50)。

This dataset is a robot manipulation dataset created using the LeRobot framework, suitable for imitation learning, robot control, and other tasks. It contains 50 episodes, totaling 11,939 frames, from 1 task, and includes 100 videos (one video per camera view). The data is collected at a frame rate of 30 FPS, with the robot type being so100_follower. Data features include: 6-dimensional actions (joint positions: shoulder_pan, shoulder_lift, elbow_flex, wrist_flex, wrist_roll, gripper), 6-dimensional robot states (same dimensions as actions), two camera images (top view and side view, resolution 480x640, AV1 codec, 3 channels), as well as auxiliary fields like timestamps, frame indices, episode indices, indices, and task indices. All data is stored as Parquet files, and videos are stored as MP4 files. The dataset is licensed under Apache-2.0, and all training data is not split into validation sets (train is 0:50).

创建时间:
2026-08-14
原始信息汇总

数据集概述:svla_so101_pickplace

基本信息

  • 许可证:Apache 2.0
  • 任务类别:机器人学(Robotics)
  • 创建工具:该数据集使用 LeRobot 创建
  • 数据集格式:Parquet 文件(数据存储于 data/*/*.parquet

数据集规模

指标 数值
总片段数(Episodes) 50
总帧数(Frames) 11,939
总任务数(Tasks) 1
总视频数(Videos) 100
总块数(Chunks) 1
块大小(Chunks Size) 1000
帧率(FPS) 30

数据划分

  • 训练集:0:50(全部50个片段用于训练)

机器人类型

  • 机器人型号:SO-100 跟随者机械臂(so100_follower)

数据特征

数据集中包含以下特征:

1. 动作(Action)

  • 数据类型:float32,维度为6
  • 动作名称:肩部旋转(shoulder_pan.pos)、肩部抬升(shoulder_lift.pos)、肘部弯曲(elbow_flex.pos)、腕部弯曲(wrist_flex.pos)、腕部旋转(wrist_roll.pos)、夹爪(gripper.pos)

2. 观测状态(Observation State)

  • 数据类型:float32,维度为6
  • 状态名称:与动作特征一致,包括肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置

3. 观测图像(Observation Images)

包含两个摄像头视角,均为视频格式:

  • 上方视角(up):480×640 分辨率,3通道,AV1编码,30 FPS
  • 侧方视角(side):480×640 分辨率,3通道,AV1编码,30 FPS

4. 其他元数据特征

  • timestamp:时间戳(float32,1维)
  • frame_index:帧索引(int64,1维)
  • episode_index:片段索引(int64,1维)
  • index:全局索引(int64,1维)
  • task_index:任务索引(int64,1维)

文件结构

  • 数据文件:存储于 data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet
  • 视频文件:存储于 videos/chunk-{episode_chunk:03d}/{video_key}/episode_{episode_index:06d}.mp4
搜集汇总
数据集介绍
svla_so101_pickplace 数据集图片
构建方式
在机器人学习领域,高质量的操作演示数据集是训练模仿学习与强化学习策略的关键基础。该数据集依托LeRobot框架构建,采用SO100 follower机械臂执行抓取放置任务,通过遥操作或预设策略采集50条完整演示轨迹,总计11939帧,以30帧每秒的频率同步记录六维关节位置与动作空间,并配备上视角与侧视角两路640×480分辨率的AV1编码视频,所有数据以Parquet列式格式按分块存储,确保高效读取与时间对齐。
特点
该数据集聚焦单一抓取放置任务,包含50个回合的精确操作记录,动作与状态空间均为六自由度,涵盖肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转及夹爪位置,利于策略泛化研究。其突出特点在于多视角视觉观测,上视角与侧视角视频流提供丰富的空间信息,帧率与时间戳严格同步,数据以v2.1版本规范组织,无需额外预处理即可直接用于训练。
使用方法
使用该数据集时,可借助LeRobot库或HuggingFace datasets接口加载Parquet数据文件,按episode索引读取轨迹与视频。研究者可依据info.json中的路径模板定位数据分块,结合PyTorch或TensorFlow构建数据加载器,将动作序列与多视角图像输入模仿学习模型。数据划分已预设训练集为0至50回合,便于复现性实验,并支持对观察图像进行解码与增强以适应不同网络架构。
背景与挑战
背景概述
机器人模仿学习与视觉-语言-动作(VLA)模型的发展,有赖于高质量、标准化操作数据的持续供给。svla_so101_pickplace数据集依托LeRobot框架构建,聚焦SO100机械臂的抓取-放置任务,采集了50个回合、11939帧、30fps的同步视频与关节状态流,涵盖肩部旋转、肘部弯曲及夹爪开合等六维动作。该数据集为具身智能领域提供了可复现的基准,推动了低成本机械臂在真实场景中的策略泛化研究,其结构化设计亦为社区贡献了标准化的数据采集范式。
当前挑战
该数据集所解决的核心领域问题是机械臂在视觉引导下的精细抓取与放置,其挑战在于:单一任务设定限制了策略对未见物体与场景的泛化能力;双视角视频与关节状态的精确对齐需克服时序同步与视角遮挡的干扰;构建过程中需确保动作空间与观测空间在长时间采集中的一致性,并维持视频编码质量与帧率稳定,以支撑端到端VLA模型的有效训练与评估。
常用场景
经典使用场景
在机器人学习与具身智能领域,基于视觉的抓取与放置任务长期被视为检验感知-运动协调能力的基准问题。svla_so101_pickplace数据集以50条演示轨迹、近1.2万帧、30帧每秒的采样频率,提供了SO100机械臂在执行单任务拾取放置过程中的多视角视觉观测与本体状态序列,成为模仿学习与视觉-语言-动作模型训练的典型数据来源。研究者常将其用于离线策略学习、行为克隆以及端到端动作预测,通过同步的上视角与侧视角视频流和6维关节位置信号,探究机器人在非结构化环境中实现精细操作的可能性。
实际应用
在实际场景中,该数据集支撑了低成本机械臂在物流分拣、实验室自动化与教育科研中的快速部署。基于其训练的视觉运动策略可直接迁移至SO100平台,完成目标物体的识别、接近、抓取与放置全流程,尤其适用于小批量、多品种的柔性操作任务。在仓储环境中,此类策略可辅助完成货品上架与订单拣选;在科研教学中,则作为具身智能课程的标准实践数据,帮助学生理解从原始像素到关节指令的完整映射。数据集的开源特性还促进了硬件与算法协同设计,为边缘计算设备上的实时推理提供了验证条件。
衍生相关工作
围绕svla_so101_pickplace,学术界与开源社区衍生出若干经典工作。在算法层面,基于该数据集的扩散策略与动作分块Transformer被广泛验证,推动了从单任务模仿到多任务泛化的方法演进。在系统层面,LeRobot生态中的训练脚本与评估协议以此数据集为模板,形成了标准化的机器人学习流水线。此外,部分研究将其作为视觉-语言-动作模型的微调数据,探索语言指令引导下的操作策略迁移。这些工作共同丰富了低成本机械臂操作的研究图谱,并为后续多模态具身数据集的构建提供了参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务