遇见数据集

nyush-vlai-l1-block-placement-joint-v21

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

NYUSH VLAI L1 - Block Placement Joint 是一个机器人操作数据集,由 ColinSkywalker 收集,格式为 LeRobotDataset v2.1。数据集包含单个任务:将蓝色方块放入红色盘子中。共计31个 episode,12,043帧(30 FPS),动作表示为7个绝对右领导关节目标加上夹爪目标(单位为度),观测状态为7个测量右跟随关节加上测量夹爪(单位为度)。配备两个摄像头:agent 视角(480x480 RGB)和 wrist_right 视角(640x480 RGB),共62个H.264 MP4视频文件。数据集源自经过验证的 VLAI L1 右-only LeRobot v3 规范数据集,重建时采用了与实时采集相同的领先静止门控,移除了2,060个静止前缀帧,同时保留了配置的六帧预卷,确保机器人状态、动作、任务、episode 顺序以及两个摄像头流保持对齐。

NYUSH VLAI L1 - Block Placement Joint is a robot manipulation dataset collected by ColinSkywalker, formatted as LeRobotDataset v2.1. The dataset involves a single task: placing a blue block into a red plate. It contains 31 episodes, 12,043 frames (30 FPS). Actions are represented as 7 absolute right leader joint targets plus gripper target (in degrees), and observations are 7 measured right follower joints plus measured gripper (in degrees). It is equipped with two cameras: agent view (480x480 RGB) and wrist_right view (640x480 RGB), totaling 62 H.264 MP4 video files. The dataset originates from a validated VLAI L1 right-only LeRobot v3 specification dataset, reconstructed with the same lead-stationary gating as real-time acquisition, removing 2,060 stationary prefix frames while retaining the configured six-frame pre-roll, ensuring alignment of robot state, action, task, episode order, and both camera streams.

创建时间:
2026-08-03
原始信息汇总

数据集概述

基本信息

  • 名称:NYUSH VLAI L1 - Block Placement Joint (LeRobot v2.1)
  • 数据集格式:LeRobotDataset v2.1
  • 收集者:ColinSkywalker
  • 来源:经过验证的 VLAI L1 仅使用右臂的 LeRobot v3 标准数据集

任务与规模

  • 任务数:1
  • 任务描述:将蓝色积木放入红色盘子中
  • 采集片段数(Episodes):31
  • 总帧数:12,043 帧,以 30 FPS 采集
  • 视频文件数:62 个 H.264 MP4 格式文件

动作与状态

  • 动作(Action):7 个绝对右臂主从关节目标 + 夹爪目标,单位为度
  • 观察状态(Observation State):7 个实测右臂跟随关节 + 实测夹爪状态,单位为度

相机配置

  • agent 相机:480x480 RGB
  • wrist_right 相机:640x480 RGB

数据处理说明

  • 源数据集使用与实机采集相同的“起始静止门控(leading-stillness gate)”进行了重建
  • 移除了 2,060 帧静止前缀帧,同时保留了配置的六帧预滚动(preroll)后持续动作运动
  • 机器人状态、动作、任务、片段顺序以及两个相机流均保持对齐

使用方式

可通过 Hugging Face 下载命令获取该数据集,仓库 ID 可用于兼容 LeRobot Dataset v2.1 的版本。精确的动作和观察约定存储在 meta/info.json 中,源数据身份、迁移参数和计数信息保存在 meta/source_vlai_l1.jsonmeta/vlai_l1_derivative.json 中。

搜集汇总
数据集介绍
nyush-vlai-l1-block-placement-joint-v21 数据集图片
构建方式
在具身智能与机器人操作研究领域,高质量演示数据的采集与规范化是训练视觉-语言-动作模型的基础。该数据集源自VLAI L1右臂LeRobot v3规范数据集,经重建流程转化为LeRobotDataset v2.1格式。重建过程采用与实时采集阶段一致的起始静止帧门控策略,剔除2,060帧静止前缀,同时保留持续动作发生前预设的六帧预卷,确保机器人状态、动作指令、任务标签、回合顺序及两路摄像头流在裁剪后仍保持严格对齐,最终形成31个回合、12,043帧、30 FPS的关节目标控制数据集。
特点
该数据集聚焦于单一操作任务——将蓝色方块放入红色托盘,涵盖31个回合与12,043帧有效数据。动作空间为七维右臂主导关节绝对目标值加夹爪目标,以角度为单位,观测状态则对应七维右从动关节实测值及夹爪实测值。视觉观测由两路摄像头构成,包括480×480分辨率的第三人称视角和640×480分辨率的手腕摄像头,共62个H.264 MP4视频文件。源数据集身份、迁移参数与帧数统计完整保留于元数据文件中,为可追溯性与实验复现提供依据。
使用方法
研究者可通过Hugging Face命令行工具下载该数据集至本地目录,下载命令指定仓库类型为数据集。在使用阶段,需搭配兼容LeRobotDataset v2.1版本的LeRobot发行版,并直接引用仓库标识符加载数据。精确的动作与观测契约定义存放于meta/info.json文件中,而规范源身份、迁移参数及计数信息则记录于meta/source_vlai_l1.json与meta/vlai_l1_derivative.json中,用户应参照这些元数据文件以确保训练或评估流程与数据格式严格匹配。
背景与挑战
背景概述
在具身智能与机器人操作学习迅猛发展的背景下,高质量、标准化的演示数据集成为训练视觉-语言-动作模型的关键基础。纽约大学上海分校VLAI实验室于2025年前后构建了VLAI L1系列数据集,旨在为机器人精细操作任务提供可复现的基准。其中,block-placement-joint-v21数据集由研究者ColinSkywalker发布,聚焦“将蓝色方块放入红色盘子”这一经典抓取-放置任务,采集了31个回合、12043帧、30FPS的遥操作演示数据,涵盖智能体视角与腕部相机双路RGB视频,并遵循LeRobot v2.1格式。该数据集通过统一的动作与观测接口,为联合关节目标预测与视觉策略学习提供了标准化的实验平台,对推动可复现的机器人学习研究具有积极意义。
当前挑战
从领域问题来看,方块放置任务要求机器人融合视觉感知、空间推理与精细运动控制,在非结构化环境中实现稳定抓取与精准放置,其核心挑战在于视觉-动作映射的高维非线性、接触动力学的不确定性以及长时序操作的误差累积。就构建过程而言,该数据集面临多源异构数据的同步与对齐难题,需确保双路相机流、机器人状态与动作指令在时间上严格一致;同时原始数据中存在的静止前缀冗余会引入无效样本,需设计静止性门控机制进行过滤,并保留动作起始前的预卷帧以维持时序完整性,这一系列处理对数据清洗与质量保障提出了较高要求。
常用场景
经典使用场景
在具身智能与机器人操作研究领域,基于示教数据的策略学习已成为实现精细操作任务的核心范式。该数据集以LeRobot v2.1格式封装了31条遥操作演示,任务为将蓝色方块放入红色盘子,涵盖7自由度绝对关节目标与夹爪指令,并同步采集了主视角与腕部相机双路RGB视频流。其经典使用场景在于模仿学习与视觉-语言-动作模型的离线训练,研究者可借此驱动机械臂在非结构化环境中完成抓取、搬运与放置的端到端闭环,尤其适合评估动作空间建模、多模态观测融合及长时序操作策略的泛化能力。
实际应用
在工业与服务机器人落地场景中,该数据集可支撑抓取-放置类任务的快速策略部署。借助LeRobot兼容接口,开发者能够便捷地加载数据并微调预训练策略,使机械臂适应分拣、装配或物流搬运等实际工序。双路相机配置尤其适用于遮挡频繁的桌面操作环境,腕部视角可补偿主视角的视野盲区,提升放置精度。此外,数据集保留的源数据集身份与迁移参数信息,便于在不同机器人平台间进行动作空间适配与迁移学习,为低成本构建专用操作技能提供了切实的数据基础。
衍生相关工作
作为VLAI L1系列的一部分,该数据集衍生出多项围绕LeRobot生态的经典工作,包括基于其动作契约构建的模仿学习基线、视觉-语言-动作联合建模实验以及跨数据集迁移策略研究。其源数据集向v2.1格式的转换流程本身亦构成数据工程范例,推动了社区对数据集版本兼容与元信息追溯的讨论。后续研究常将其与同系列其他操作任务数据集联合使用,以评估多任务学习与指令泛化性能,进而催生了面向关节空间控制与多相机融合的算法改进,为具身智能数据标准的演进提供了实践参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务