遇见数据集

Prism_vla_setupcup

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

该数据集是使用LeRobot框架创建的机器人操控数据集,旨在为机器人学习任务提供标准化数据。数据集包含56个episode,共68336帧,均来自单一任务。数据以30fps的帧率采集,包含两个视角的摄像头图像(front和arm),分辨率均为480x640像素,采用AV1编码。此外,还提供了机器人关节状态(6维,包括shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll和gripper的位置)和对应的动作指令。机器人类型为so_follower。数据集结构包括时间戳、帧索引、episode索引、任务索引等辅助字段。所有数据存储在parquet文件中,视频存储在mp4文件中。该数据集适用于机器人模仿学习、行为克隆、强化学习等任务。

This dataset is a robot manipulation dataset created using the LeRobot framework, aimed at providing standardized data for robot learning tasks. It contains 56 episodes with a total of 68,336 frames, all from a single task. The data is collected at a frame rate of 30fps, including camera images from two perspectives (front and arm), both with a resolution of 480x640 pixels, encoded using AV1. Additionally, robot joint states (6 dimensions, including positions of shoulder_pan, shoulder_lift, elbow_flex, wrist_flex, wrist_roll, and gripper) and corresponding action commands are provided. The robot type is so_follower. The dataset structure includes auxiliary fields such as timestamps, frame indices, episode indices, and task indices. All data is stored in parquet files, and videos are stored in mp4 files. This dataset is suitable for tasks such as robot imitation learning, behavior cloning, and reinforcement learning.

创建时间:
2026-08-23
原始信息汇总

数据集概述

名称:Prism_vla_setupcup (Salim-Aissi/Prism_vla_setupcup)

任务类型:机器人学 (robotics)

许可证:Apache-2.0

创建工具:LeRobot (https://github.com/huggingface/lerobot)


数据集结构

基本信息

  • 机器人类型:so_follower
  • 帧率 (fps):30
  • 总片段数 (episodes):56
  • 总帧数 (frames):68,336
  • 总任务数 (tasks):1
  • 数据划分:仅训练集(片段 0 至 55)

数据内容

数据文件为 Parquet 格式,视频文件为 MP4 格式(使用 AV1 编码,分辨率 480×640,30 fps)。

  • 数据文件大小:约 100 MB
  • 视频文件大小:约 200 MB

特征(Features)

特征名 类型 维度 具体含义
action float32 6 机械臂6个关节位置(肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪)
observation.state float32 6 机械臂6个关节位置(同 action 定义)
observation.images.front video 480×640×3 机器人前视摄像头图像
observation.images.arm video 480×640×3 机械臂视角摄像头图像
timestamp float32 1 时间戳
frame_index int64 1 帧索引
episode_index int64 1 片段索引
index int64 1 全局索引
task_index int64 1 任务索引(本数据集仅1个任务)

数据用途

该数据集适用于机器人操控任务的模仿学习或视觉-语言-动作(VLA)模型训练,包含了从固定视角和机械臂视角拍摄的图像,以及对应的机械臂关节位置控制动作序列。


引用信息

该数据集暂无 BibTeX 引用信息(标注为 "More Information Needed")。

搜集汇总
数据集介绍
Prism_vla_setupcup 数据集图片
构建方式
Prism_vla_setupcup数据集由Salim-Aissi构建,旨在服务于机器人操作任务的研究。其构建依托于LeRobot框架,通过记录真实机器人执行任务的过程,采集了包括六维关节位置动作指令、观测状态及前视与机械臂视角的视觉图像在内的多模态数据。数据集包含56个完整操作轨迹,共计68336帧,以30帧每秒的采样频率捕捉细腻的操作动态。数据存储采用分块Parquet文件与AV1编码视频,确保了高效的数据压缩与读取,并附有详尽的元数据信息,便于科研人员深入解析与应用。
特点
该数据集的核心特色在于其多模态、高频率的数据采集与高度结构化的组织形式。每一帧数据均同步记录了机器人6个自由度的状态与动作指令,辅以两个视角的同步视频流,为模仿学习与视觉运动策略的研发提供了丰富的时空信息。数据集的清晰分层——包含索引、时间戳、任务标识等元字段,以及专门划分的训练集(56个 episode),极大地便利了算法的训练与评估。此外,Apache 2.0许可协议使得数据集能够被广泛复用与二次开发,促进了机器人学习社区的协作与创新。
使用方法
该数据集可便捷地集成于基于LeRobot的机器人学习流水线中。研究者可通过HuggingFace提供的可视化工具直观预览数据质量,亦可利用LeRobot库中的API直接加载数据,进行策略训练与评估。数据集默认划分为训练集,适用于训练视觉运动策略模型,例如通过行为克隆或强化学习方法学习从视觉观测至动作的映射。搭配机器人类型为so_follower,该数据集尤其适合用于研究基于视觉的遥操作或自主控制任务,为算法验证与跨数据集比较提供了标准化的数据基础。
背景与挑战
背景概述
Prism_vla_setupcup 数据集由 Salim-Aissi 于近期创建,基于 Hugging Face 的 LeRobot 框架构建,旨在推动机器人操作领域的发展。该数据集聚焦于机械臂的杯子摆放任务,通过记录 56 个演示片段、共 68,336 帧的高频(30 FPS)视觉与状态数据,为视觉-语言-动作(VLA)模型提供了宝贵的训练资源。其核心研究问题在于利用多模态感知信息(包括前置摄像头和机械臂摄像头捕捉的 RGB 图像)与关节状态数据,实现精确的物体操纵。该数据集为机器人学习社区提供了一致且可复现的基准,促进了 VLA 模型在真实世界操作任务中的泛化能力与性能评估,对具身智能研究具有重要影响力。
当前挑战
该数据集面临的挑战主要涵盖领域问题与构建过程两个方面。在领域问题层面,机械臂的杯子摆放任务要求高精度的空间推理和动作控制,VLA 模型需有效融合视觉、状态与动作信息,以应对光照变化、视角差异、物体位置不确定性等复杂环境因素,实现鲁棒的操作。在构建过程中,数据采集涉及同步多摄像头视频流(分辨率为 480×640)与高频率(30 Hz)的六维关节状态记录,确保时间戳对齐与数据一致性是一大难点;同时,仅有 56 个演示片段,数据量有限,容易导致模型过拟合,难以泛化到新的场景或物体配置。此外,视频压缩编码(AV1)与存储格式的选择需要在数据保真度和文件大小之间取得平衡,以保证数据集的可复用性与训练效率。
常用场景
经典使用场景
Prism_vla_setupcup数据集是面向机器人操作学习领域的高质量视觉-动作数据集,其核心应用场景在于训练和评估视觉-语言-动作(VLA)模型。该数据集包含56个演示片段和68336帧同步图像与运动状态数据,动作空间涵盖六自由度关节角度与夹爪开合,观测数据包括前端相机和机械臂视角的RGB视频流。研究者常利用此数据集进行模仿学习、行为克隆以及端到端机器人操控策略的训练,尤其在桌面级物体摆放任务上,通过解耦视觉表征与动作生成,推动多模态感知-控制模型的泛化与鲁棒性研究。
实际应用
在实际应用层面,Prism_vla_setupcup数据集承载着将前沿算法转化为生产力工具的潜力。基于此数据集训练的机器人操控能力可迁移至智能制造中的零件装配、物流分拣中的物品摆放、餐饮服务中的器具整理等场景,帮助自动化系统适应非结构化环境并完成精细操作。该数据集的公开还降低了机器人应用开发的门槛,使中小型企业能够利用预训练模型快速定制专用任务,加速智能机器人在日常服务与工业协作中的落地部署。
衍生相关工作
此数据集的发布催生了一系列衍生工作,包括用于视觉-动作预训练的通用机器人基础模型、基于扩散策略的动作生成器,以及融合语言指令的多模态操控决策系统。后续研究者利用此数据评估不同骨干网络(如ResNet、ViT)对操作性能的影响,并开发了数据增强和仿真到现实迁移技术以扩展现有数据效用。此外,该数据集已成为LeRobot生态中社区驱动研究的重要基石,推动了开源机器人学习基准的完善以及跨任务泛化评估体系的构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务