遇见数据集

indory_xlerobot_pick_delivery

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

该数据集是一个用于机器人学习任务的演示数据集,使用LeRobot平台创建,包含30个完整的情节(episodes),共计30,287帧数据,涵盖3种不同的任务。数据采用分块存储,每块包含1000帧,总大小约为300MB(其中数据文件100MB,视频文件200MB),以15fps的帧率采集,仅提供训练集。数据内容包含多模态信息:动作(action)为17维浮点向量,控制双机械臂(左/右各6个关节+夹爪)和头部(2个电机)的运动及底盘速度(x, y, theta方向);状态观测(observation.state)为与动作相同的17维浮点向量,表示机器人的当前关节和速度状态;视觉观测(observation.images)包含三路RGB视频流,分别来自头部摄像头、左腕摄像头和右腕摄像头,分辨率均为640x480,采用H.264编码;索引信息包括时间戳、帧索引、情节索引、全局索引和任务索引。该数据集适用于机器人模仿学习、强化学习、多模态感知与控制等研究任务,特别针对双机械臂移动机器人的操作技能学习。

This is a demonstration dataset for robotic learning tasks, created using the LeRobot platform. It contains 30 full episodes, totaling 30,287 frames of data and covering 3 distinct tasks. The data is stored in chunks, with each chunk containing 1000 frames. The total size of the dataset is approximately 300 MB (100 MB for data files and 200 MB for video files), collected at a frame rate of 15 fps, and only the training split is provided. The dataset includes multimodal information: the action is a 17-dimensional floating-point vector, which controls the movements of the dual robotic arms (6 joints plus gripper for each left and right arm), the head unit (2 motors), and the base velocity in x, y, and theta directions; the state observation (observation.state) is a 17-dimensional floating-point vector matching the action space, representing the robot's current joint positions and velocity states; the visual observation (observation.images) consists of three RGB video streams sourced from the head camera, left wrist camera, and right wrist camera respectively, all with a resolution of 640×480 and encoded using H.264; the accompanying index information includes timestamps, frame indices, episode indices, global indices, and task indices. This dataset is applicable to research tasks including robotic imitation learning, reinforcement learning, multimodal perception and control, and is specifically designed for the learning of manipulation skills for mobile robots equipped with dual robotic arms.

创建时间:
2026-06-06
原始信息汇总

数据集概述

  • 数据集名称: hanbin5/indory_xlerobot_pick_delivery
  • 许可协议: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 相关工具: 该数据集使用 LeRobot 创建,并支持通过 可视化空间 预览数据。

数据集结构

  • 机器人类型: xlerobot_client
  • 总集数: 30 集
  • 总帧数: 30,287 帧
  • 总任务数: 3 个任务
  • 帧率: 15 FPS
  • 数据文件大小: 约 100 MB
  • 视频文件大小: 约 200 MB
  • 数据分块: 每块 1000 帧
  • 数据分割: 全部 30 集用于训练 (train: "0:30")

数据文件路径

  • 数据文件路径格式: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径格式: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

数据特征

动作与状态特征 (actionobservation.state)

两者均为 17 维的 float32 数组,包含以下关节状态:

  • 左臂: 肩关节旋转、肩关节俯仰、肘关节弯曲、腕关节弯曲、腕关节旋转、夹爪
  • 右臂: 肩关节旋转、肩关节俯仰、肘关节弯曲、腕关节弯曲、腕关节旋转、夹爪
  • 头部: 电机 1、电机 2
  • 移动: x 方向速度、y 方向速度、角度速度

图像观察特征 (observation.images)

包含三个摄像头视角,均为视频类型,分辨率为 480x640,3 通道,H.264 编码,15 FPS:

  • 头部摄像头: head
  • 左手腕摄像头: left_wrist
  • 右手腕摄像头: right_wrist

其他特征

  • timestamp: 时间戳,float32,形状 [1]
  • frame_index: 帧索引,int64,形状 [1]
  • episode_index: 集索引,int64,形状 [1]
  • index: 数据索引,int64,形状 [1]
  • task_index: 任务索引,int64,形状 [1]
搜集汇总
数据集介绍
indory_xlerobot_pick_delivery 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人操作任务的模仿学习。数据集包含30个演示片段,总计30287帧,涵盖3种不同的任务。数据由xlerobot_client平台采集,记录了双臂操作及移动底盘的运动信息。每个片段以15帧每秒的频率同步记录高分辨率视觉观测与运动状态数据。视觉模态包含头部及左右腕部三个视点的H.264编码视频,分辨率为480×640。运动状态与动作信号则涵盖双臂各关节角度、夹爪位置、头部电机及底盘三维速度共17维连续变量。数据被划分为1000帧大小的块,并以Parquet格式高效存储,总计约300 MB。
特点
本数据集在机器人模仿学习领域具有鲜明特色。首先,它融合了高维视觉观测与精细的运动控制信息,提供了头部及双腕三个视点的同步视频,为多视角感知与策略学习奠定了坚实基础。其次,数据集覆盖了从物品抓取到递送等多种复杂操作任务,展现了任务层面的多样性。再者,数据以结构化的帧序列与片段组织方式呈现,包含时间戳、任务索引等元数据,便于进行时序建模与任务条件化策略的训练。其Apache-2.0许可也促进了学术研究中的自由使用与分发。
使用方法
数据集可通过Hugging Face的 datasets 库直接加载。用户需指定仓库路径 hanbin5/indory_xlerobot_pick_delivery,并调用 load_dataset 函数即可获取标准化的数据集对象。加载后的数据包含 action、observation.state 以及多视角图像等多种模态。特别地,图像数据(observation.images)以视频帧形式嵌入,可借助LeRobot库提供的实用工具进行高效解码与可视化。用户亦可直接访问Hugging Face Spaces上的专用可视化页面,在浏览器中交互式查看数据片段,快速理解数据内容与任务特点。
背景与挑战
背景概述
indory_xlerobot_pick_delivery数据集由Hanbin5等人于近期创建,依托Hugging Face的LeRobot框架构建,专注于机器人操作领域的模仿学习与行为克隆研究。该数据集旨在解决移动机械臂在复杂动态环境中执行抓取与递送任务的核心问题,通过记录高维传感器数据(包括多视角视觉图像与17自由度运动状态)为机器人学习提供标准化训练资源。作为LeRobot生态中的典型示例,其结构严谨,包含30个任务回合、30287帧时序数据及三种不同的操作任务,为评估多模态感知与运动控制协同算法提供了基础基准,对推动可复现的机器人学习研究具有积极意义。
当前挑战
在领域问题层面,该数据集聚焦于移动机械臂在非结构化场景下的精细操作挑战,需同时协调双机械臂、头部运动与底盘移动共17个自由度,并融合多路视觉流进行实时决策,对模仿学习的泛化能力与鲁棒性提出严峻考验。在构建过程中,挑战主要源于高保真数据采集的复杂性:需要精确同步三个相机(头部与左右腕部)的480p视频流、16维运动状态向量及17维动作指令,确保时间戳对齐与帧率一致性(15 FPS);同时,针对三种不同任务的示教数据需覆盖充分的操作变异性,以避免策略过拟合,而总数据量仅30回合的控制规模进一步限制了模型对复杂任务分布的覆盖能力。
常用场景
经典使用场景
indory_xlerobot_pick_delivery数据集专为移动机械臂的拾取与递送任务而设计,在机器人学习领域具有经典应用价值。该数据集通过双七自由度机械臂、全向移动底盘与多视角视觉系统的协同配置,记录了30个完整回合、涵盖3种不同任务的操作轨迹,动作空间包含17维连续控制信号。研究者可利用该数据集训练模仿学习或强化学习模型,使机器人从视觉观察和状态信息中学习精准的抓取、搬运与放置动作序列,尤其适用于家庭服务或仓储物流中需要灵活移动与双臂协作的复杂场景。
实际应用
在实际应用层面,该数据集直接服务于服务机器人与工业物流场景的智能化升级。基于该数据集训练的模型可部署于餐厅送餐、病房物资运输、仓库订单分拣等环境,使机器人具备在动态空间中自主导航至目标位置、识别物体并完成抓取与递送的能力。数据集包含的头戴相机与左右手腕相机提供了多角度视觉反馈,有利于开发鲁棒的视觉伺服控制策略,从而提升机器人在非结构化环境中作业的可靠性与安全性,降低人工干预成本。
衍生相关工作
该数据集已衍生出多项前沿研究工作。在数据处理方面,基于其高帧率视频与原始运动轨迹,研究者开发了跨视角特征对齐网络,实现了从单目观察泛化到多视角控制的迁移学习方案。在学习算法方面,已有工作利用此数据集探索了基于扩散策略的机器人动作生成,以及结合语言指令的层次化任务分解方法。此外,该数据集的公开推动了LeRobot生态内移动操作基准的建立,催生了针对非完整约束底盘的运动学规划与双臂协调阻抗控制等交叉研究成果,为构建通用移动操作智能体奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务