遇见数据集

cables_vla_red_v2

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

该数据集使用LeRobot工具创建,是一个面向机器人学领域的示范数据集。数据集记录了机器人执行任务的过程,包含动作指令、机器人状态观测以及来自两个视角(正面和侧面)的视觉观测。数据以episodes形式组织,总计包含33个episodes,共13200帧数据,帧率为每秒10帧。数据文件格式为Parquet,并包含对应的MP4格式视频文件。数据特征具体包括:一个6维的浮点型动作向量(对应肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置);一个6维的浮点型观测状态向量(与动作向量维度相同);两个分辨率为640x480的三通道彩色视频观测(分别来自正面和侧面摄像头);以及时间戳、帧索引、episode索引、数据索引和任务索引等元数据字段。该数据集适用于机器人模仿学习、行为克隆、视觉运动策略学习等任务的研究与开发。

This dataset is created using the LeRobot tool and serves as a demonstration dataset in the field of robotics. It records the process of a robot performing tasks, including action commands, robot state observations, and visual observations from two perspectives (front and side). The data is organized in episodes, totaling 33 episodes with 13,200 frames at a frame rate of 10 frames per second. The data files are in Parquet format and include corresponding MP4 video files. Specific features include: a 6-dimensional floating-point action vector (corresponding to shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, and gripper position); a 6-dimensional floating-point observation state vector (with the same dimensions as the action vector); two 640x480 resolution three-channel color video observations (from front and side cameras, respectively); and metadata fields such as timestamp, frame index, episode index, data index, and task index. This dataset is suitable for research and development in tasks such as robot imitation learning, behavior cloning, and visual-motor policy learning.

创建时间:
2026-06-05
原始信息汇总

数据集概述

  • 名称: cables_vla_red_v2
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (robotics)
  • 创建工具: 使用 LeRobot 创建
  • 数据集形式: Parquet 文件 (位于 data/*/*.parquet)

数据集结构

  • 代码库版本: v3.0
  • 机器人类型: so_follower
  • 总片段数: 101
  • 总帧数: 40400
  • 总任务数: 1
  • 分块大小: 1000
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB
  • 帧率 (FPS): 10
  • 数据划分: 仅包含训练集 (片段 0 到 100)

数据特征

  • 动作 (action): 包含 6 个维度的浮点数,对应机器人关节位置 (shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos)
  • 观测状态 (observation.state): 与动作特征相同,6 维浮点数,描述机器人关节状态
  • 观测图像 (observation.images): 包含两个摄像头视角:
    • 前视 (front): 视频数据,分辨率 480x640,3 通道,AV1 编码,10 FPS
    • 侧视 (side): 视频数据,分辨率 480x640,3 通道,AV1 编码,10 FPS
  • 时间戳 (timestamp): 1 维浮点数
  • 帧索引 (frame_index): 1 维整数
  • 片段索引 (episode_index): 1 维整数
  • 索引 (index): 1 维整数
  • 任务索引 (task_index): 1 维整数

数据路径

  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

可视化

搜集汇总
数据集介绍
cables_vla_red_v2 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人操作任务设计。数据采集自so_follower机器人,共包含101个示范轨迹,总计40400帧图像及对应动作序列。每个轨迹均通过遥控操作或自主演示方式采集,并按照1000帧为单位的chunk进行分块存储。数据以parquet格式保存动作序列与状态信息,同时以av1编码的MP4视频文件记录正面与侧面双视角RGB图像,分辨率统一为640×480像素,帧率为10Hz。训练集与验证集按0:101的比例划分,完整覆盖全部轨迹。
特点
数据集以精细的6自由度关节空间动作为核心,涵盖shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll及gripper六个维度,动作与观测状态维度严格对齐,便于模仿学习中的状态-动作映射。双视角视觉观测(front与side)提供丰富的场景信息,支持基于视觉的机器人策略训练。数据格式标准化,包含时间戳、帧索引、轨迹索引等元数据字段,便于时序建模。整体数据量约300MB,兼顾了多样性与训练效率。
使用方法
数据集可直接通过HuggingFace LeRobot库加载,使用from_pretrained或load_dataset接口即可获取分块数据。用户可借助LeRobot内置的dataset可视化工具在线预览轨迹与图像。在模型训练时,推荐将action序列作为回归目标,observation.state与visual观测作为输入,利用双视角图像与关节状态联合训练视觉运动策略。数据已按episode_index组织,支持批量化序列采样与时间一致性建模。
背景与挑战
背景概述
在具身智能与机器人学习领域,精细操作任务一直是研究的前沿与难点,尤其是针对线缆等柔性物体的操控,因其高自由度与复杂动力学特性,对机器人的感知与决策能力提出了严峻挑战。cables_vla_red_v2数据集由研究团队借助LeRobot框架精心构建,于近期发布,旨在为视觉-语言-动作模型在机器人操作中的发展提供标准化基准。该数据集聚焦于红色线缆的特定操作任务,采集了101个完整任务片段,总计超过四万帧的高频观测数据,包含来自正面和侧面的视觉图像流以及六维关节动作状态。其开源许可(Apache-2.0)极大地促进了学术界的复现与扩展,为研究如何从多模态感知中学习精准的线缆操控策略奠定了重要的数据基石,对推动机器人从仿真走向真实世界的柔顺操作具有深远影响。
当前挑战
该数据集所解决的领域问题核心挑战在于:线缆类柔性物体的操作缺乏明确的几何约束,传统的刚性物体抓取算法难以直接迁移,需要模型理解非线性变形与非刚体动力学,并结合视觉反馈实时调整动作。这一跨模态的映射难题是当前视觉-语言-动作模型突破的关键瓶颈。在构建过程中,数据集面临的技术挑战同样显著:如何设计稳定的遥操作策略以高效采集长达四十余万帧的演示数据,如何保证不同片段间动作策略的一致性以降低噪声干扰,以及如何在前置摄像头视角下避免因线缆遮挡导致的关键特征丢失。此外,对高分辨率视频(480×640)与事件序列的同步编码及高效压缩(选用AV1编码器)也构成了工程实现上的严峻考验。
常用场景
经典使用场景
在机器人操作领域,cables_vla_red_v2数据集以其细致入微的线缆操控任务而独树一帜。该数据集记录了SO Follower机械臂在10 FPS下完成的101个完整演示片段,总帧数高达40,400帧,涵盖肩关节、肘关节、腕部及夹爪的六维度动作序列与状态观测。研究者可借助该数据集,训练视觉-语言-动作(VLA)模型,使机器人通过前视与侧视双摄像头影像,精准模仿人类演示的线缆插拔或布线等精细操作。这一经典用途推动了从原始感知到复杂运动策略端到端学习的范式演进。
实际应用
实际应用层面,cables_vla_red_v2数据集为工业自动化与智能服务机器人注入了新的活力。在电子装配、汽车线束整理以及航空缆线维护等场景中,机器人需要自主完成精确的线缆抓取、插入与束扎动作。基于该数据集训练的模型,能够有效应对线缆遮挡、多支线交织等复杂情况,大幅提升生产线的柔性与效率。此外,家庭服务机器人亦可利用此类技能完成电线整理、充电线插拔等日常家务,从而拓宽了智能装备在非结构化环境中的人机协作边界。
衍生相关工作
cables_vla_red_v2数据集的发布催生了一系列前沿的衍生工作。基于LeRobot软件栈,研究者们开发了针对柔性物体操控的视觉预训练策略,例如利用对比学习从多视角视频中提取不变特征,并应用于下游模仿学习。同时,部分工作尝试将扩散策略与这一数据集结合,生成了更为平滑且适应性强的高维动作序列。此外,该数据集还激发了对通用机器人基础模型适配性的探索,如将在大规模刚体操作上预训练的视觉-语言模型通过微调适应于线缆操控,展现了跨任务迁移学习的巨大潜力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务