遇见数据集

move_clutter_rect_for_xvla

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

该数据集是一个用于机器人操作任务的数据集,由LeRobot框架创建。数据集包含1417个episode,共931255帧,涉及5个不同的任务。机器人类型为stringman。数据特征包括:动作(11维,包含线速度、角速度、腕部速度、手指速度、接触向量及episode结束标志)、状态(20维,包含速度、位置、角度、激光测距、压力、目标力、物体方位和距离等)、以及来自三个摄像头(gripper_camera、anchor_camera_0、anchor_camera_1)的彩色视频图像(分辨率384x684,30fps)。此外,还包含时间戳、帧索引、episode索引、任务索引等元数据。数据集适用于机器人模仿学习、行为克隆、强化学习等任务,并支持通过LeRobot进行可视化。

This dataset is designed for robot manipulation tasks, created using the LeRobot framework. It contains 1417 episodes with a total of 931,255 frames, covering 5 different tasks. The robot type is stringman. Data features include: actions (11-dimensional, encompassing linear velocity, angular velocity, wrist velocity, finger velocity, contact vector, and episode end flag), states (20-dimensional, including velocity, position, angle, laser ranging, pressure, target force, object orientation and distance, etc.), and color video images from three cameras (gripper_camera, anchor_camera_0, anchor_camera_1) with resolution 384x684 at 30fps. Additionally, metadata such as timestamps, frame indices, episode indices, and task indices are included. The dataset is suitable for tasks like robot imitation learning, behavior cloning, and reinforcement learning, and supports visualization via LeRobot.

创建时间:
2026-08-02
原始信息汇总

数据集概述:move_clutter_rect_for_xvla

基本信息

  • 数据集名称: move_clutter_rect_for_xvla
  • 创建工具: 使用 LeRobot 创建
  • 许可证: Apache-2.0
  • 任务类型: 机器人(Robotics)
  • 机器人类型: stringman

数据集规模

  • 总片段数(Episodes): 1417
  • 总帧数(Frames): 931,255
  • 总任务数(Tasks): 5
  • 帧率(FPS): 30
  • 数据文件大小: 约100 MB
  • 视频文件大小: 约200 MB
  • 数据集划分: 全部数据(1417个片段)用于训练(train)

数据特征

动作(Action)

  • 维度: 11维
  • 数据类型: float32
  • 包含字段: 速度(x/y/z)、房间速度(x/y)、手腕速度、手指速度、接触向量(x/y/z)、片段结束标志

观测状态(Observation State)

  • 维度: 20维
  • 数据类型: float32
  • 包含字段: 速度(x/y/z)、手腕速度、手指速度、夹爪位置(x/y/z)、旋转角度、手指角度、激光测距仪读数、手指压力、手腕角度、目标力、障碍物方位/距离、玩具箱方位/距离、垃圾桶方位/距离

观测图像(Observation Images)

包含三个摄像头视角,均为视频流,具体参数如下:

  • 分辨率: 384×684像素
  • 通道数: 3(RGB)
  • 视频编码: AV1
  • 像素格式: yuv420p
  • 帧率: 30 FPS
  • 摄像头视角:
    • gripper_camera: 夹爪摄像头
    • anchor_camera_0: 锚点摄像头0
    • anchor_camera_1: 锚点摄像头1

其他特征

  • 时间戳(timestamp): float32,1维
  • 帧索引(frame_index): int64,1维
  • 片段索引(episode_index): int64,1维
  • 索引(index): int64,1维
  • 任务索引(task_index): int64,1维

数据存储结构

  • 数据文件路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 分块大小: 1000

可视化

可通过 可视化工具 在线预览该数据集。

搜集汇总
数据集介绍
move_clutter_rect_for_xvla 数据集图片
构建方式
该数据集源于对机器人操作任务的精细采集,利用LeRobot框架构建,旨在捕捉移动杂乱矩形的操作过程。数据以parquet格式存储,包含1417个episodes,总计931255帧,涵盖5种任务。每个episode记录了30Hz频率下的多维动作与状态信息,包括11维动作向量、20维观测状态,以及来自三个摄像头(gripper_camera和两个anchor_camera)的高清视频流。数据采集注重环境感知与操作细节,融合了速度、位置、力传感等多源信息,为机器人学习提供了丰富且结构化的训练素材。
特点
该数据集的一大特色在于其高维度的传感器融合设计,动作空间精确定义了空间速度、关节速度及接触力向量等11个维度,观测状态则扩展至20个变量,涵盖抓手位置、角度、压力、激光测距及目标物(如hamper、toybox、trashcan)的相对方位等。视频数据采用av1编码,分辨率为384x684,帧率30fps,从三个视角同步捕获操作场景,增强了空间理解。此外,数据集包含多种任务变体,总计1417个episodes,规模适中,且以Apache-2.0协议开源,便于学术研究与工业应用。
使用方法
该数据集通过LeRobot生态系统无缝集成,用户可借助HuggingFace提供的可视化工具直观预览数据。在训练阶段,数据被划分为训练集(全部1417个episodes),支持离线强化学习或模仿学习。数据格式遵循LeRobot v3.0标准,便于与现有机器人学习流水线对接。每帧数据包含时间戳、帧索引和任务索引,方便进行时序建模与任务识别。视频与状态数据分离存储,但通过索引关联,用户可灵活加载,适用于视觉-语言-动作模型(如XVLA)的训练与评估,推动机器人操作技能的泛化与迁移。
背景与挑战
背景概述
该数据集由naavox团队于近期创建,基于LeRobot框架构建,旨在为机器人操作任务提供高质量的演示数据。数据集聚焦于将杂乱矩形物体移动至指定位置的任务,由'stringman'机器人执行,包含1417个演示片段,总计931255帧,覆盖5个子任务。数据采集涉及多视角相机(包括夹爪相机和两个锚定相机)以及丰富的状态信息(如速度、位置、接触力等),为模仿学习和机器人控制研究提供了宝贵资源。该数据集特别适用于评估和训练视觉-语言-动作(VLA)模型,如XVLA,在真实世界机器人操作中的性能。其主要研究人员来自naavox团队,数据集采用Apache-2.0许可证,对推动机器人学习领域的发展具有重要意义。
当前挑战
该数据集面临的挑战主要分为两类。首先,在领域问题层面,机器人操作任务要求模型能够从高维视觉和状态输入中学习鲁棒的控制策略,尤其是在非结构化环境中处理杂乱物体时,对模型的泛化能力和实时性提出严苛要求。其次,在构建过程中,数据采集面临多传感器同步、动作与状态的高频记录、以及长时间运行的稳定性等难题。此外,数据集中包含的5个子任务增加了动作空间的多样性,但同时也为模型学习带来了类间区分和迁移学习的挑战。视频压缩编码(AV1)的使用虽节省存储空间,但可能引入视觉信息损失,影响模型性能。这些挑战共同构成了该数据集在实际应用中需要攻克的关键技术瓶颈。
常用场景
经典使用场景
该数据集是面向机器人操作任务的专家演示数据集,其核心应用场景在于训练和评估具身智能体在多杂物环境下的矩形物体移动能力。数据中包含多视角相机图像(夹爪相机与双锚点相机)以及高维运动状态与动作序列,适用于模仿学习、行为克隆以及基于视觉-语言-动作(VLA)模型的端到端策略学习。凭借其30Hz的高频采样和超过93万帧的规模,该数据集为研究视觉运动策略在动态抓取与整理任务中的泛化性和鲁棒性提供了坚实的数据基础。
衍生相关工作
基于此数据集,研究者可以衍生出多项经典工作,如利用预训练的VLA模型进行微调以适应特定机器人平台、开发新的数据增强方法以提升跨场景泛化能力、或设计分层强化学习框架以优化长程任务。此外,该数据集的格式与LeRobot框架兼容,可促进机器人学习领域的基准制定和社区驱动的研究,催生新的算法评估标准与多任务学习模型。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作中的杂乱物体整理任务,包含1417个训练片段,采集自‘stringman’机械臂,通过多视角视觉输入(抓取相机与双锚定相机)及高维状态特征(线速度、关节角度、力觉反馈、目标物方位)为视觉-语言-动作模型(如XVLA)提供精细的行为克隆训练数据。当前研究前沿集中于利用此类多模态具身数据提升机器人在非结构化环境中的泛化能力与操作精准度,尤其在家庭服务、智能仓储等场景下的动态物体搬移与空间重排。数据集的高采样率(30Hz)及多任务标签设计,支撑了从感知到控制的端到端模仿学习,成为推动具身智能体实现复杂物理交互与鲁棒决策的关键资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务