遇见数据集

SP_Relational_Placement

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,使用LeRobot工具创建,专注于机器人执行物体操作任务,例如“将粉色标记物放置到绿色方块的后方”。数据集包含51个任务片段(episodes),总计40,180帧数据,涵盖9种不同任务。数据以Parquet文件格式存储,总数据量约100 MB,同时包含约200 MB的配套视频文件,视频帧率为30 FPS。数据集结构包括丰富的多模态观测和机器人控制指令:观测部分有机器人状态(6维关节位置,包括肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)、多视角视觉输入(来自腕部、中部、上方、右侧和左侧五个固定摄像头的RGB视频流,每个视频分辨率为480x640)、传感器数据(6维电机电流和速度读数,以及精确时间戳)、深度信息(来自中部摄像头的480x640深度图);动作空间由与观测状态同构的6维关节位置指令构成。此外,数据还包含时间戳、帧索引、片段索引和任务索引等元数据字段。该数据集适用于机器人学习领域的研究,特别是用于模仿学习、强化学习或行为克隆等算法的训练与评估,旨在让机器人学习复杂的多步骤操作技能,所有数据均被划分为训练集。

This dataset is a robot manipulation dataset created using the LeRobot tool, focusing on robot execution of object manipulation tasks, such as placing the pink marker behind the green block. It contains 51 task episodes, totaling 40,180 frames of data, covering 9 different tasks. The data is stored in Parquet format with a total size of approximately 100 MB, along with about 200 MB of accompanying video files at a frame rate of 30 FPS. The dataset structure includes rich multimodal observations and robot control commands: observations consist of robot state (6-dimensional joint positions, including shoulder translation, shoulder lift, elbow bend, wrist bend, wrist rotation, and gripper position), multi-view visual inputs (RGB video streams from five fixed cameras: wrist, middle, top, right, and left, each with a resolution of 480x640), sensor data (6-dimensional motor current and speed readings, along with precise timestamps), and depth information (480x640 depth maps from the middle camera). The action space is composed of 6-dimensional joint position commands isomorphic to the observation state. Additionally, the data includes metadata fields such as timestamps, frame indices, episode indices, and task indices. This dataset is suitable for research in robot learning, particularly for training and evaluating algorithms like imitation learning, reinforcement learning, or behavior cloning, aiming to enable robots to learn complex multi-step manipulation skills, with all data partitioned into a training set.

创建时间:
2026-06-10
原始信息汇总

数据集概述:SP_Relational_Placement

数据集规模与结构

属性
总片段数 51
总帧数 40,180
总任务数 9
分块大小 1,000
数据文件大小 100 MB
视频文件大小 200 MB
帧率(FPS) 30
训练集划分 全部51个片段用于训练

机器人信息

  • 机器人类型: so_follower

数据特征

特征名称 数据类型 形状 说明
action float32 (6,) 6维动作指令:shoulder_pan/shoulder_lift/elbow_flex/wrist_flex/wrist_roll/gripper 位置
observation.state float32 (6,) 机器人6个关节的状态位置,名称与action相同
observation.images.wrist video (480, 640, 3) 腕部摄像头,H264编码,30fps,无深度,无音频
observation.images.middle video (480, 640, 3) 中部摄像头,参数同wrist
observation.images.above video (480, 640, 3) 上方摄像头,参数同wrist
observation.images.right video (480, 640, 3) 右侧摄像头,参数同wrist
observation.images.left video (480, 640, 3) 左侧摄像头,参数同wrist
observation.motor_currents int32 (6,) 6个关节的电机电流
observation.motor_velocities int32 (6,) 6个关节的电机速度
observation.sensor_timestamps float64 (8,) 8个传感器时间戳:电机位置、电流、速度及5个摄像头
observation.depths.middle uint16 (480, 640) 中部深度图(高度×宽度)
timestamp float32 (1,) 时间戳
frame_index int64 (1,) 帧索引
episode_index int64 (1,) 片段索引
index int64 (1,) 全局索引
task_index int64 (1,) 任务索引

数据存储路径

  • 数据文件: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

主页与论文

  • 主页: 暂无信息
  • 论文: 暂无信息
搜集汇总
数据集介绍
SP_Relational_Placement 数据集图片
构建方式
在机器人操作领域,精细化的空间关系理解是具身智能体执行物体放置任务的核心能力。SP_Relational_Placement数据集基于LeRobot框架构建,旨在为机械臂学习空间相对位置操作提供标准化的训练与评估资源。该数据集包含了由so_follower型机械臂在51个演示回合中采集的共计40180帧交互数据,涵盖9种不同的放置任务。数据采集过程中,机械臂通过高帧率(30 FPS)同时记录了六维关节角度、电机电流与速度等状态信息,并辅以五个视角(腕部、中部、上方、左侧、右侧)的640×480分辨率视频流以及中部深度图,形成了多模态的观测序列。数据被划分为1000帧大小的块存储为Parquet格式,视频则采用H.264编码的MP4文件组织,并已全部划分为训练集,便于直接在LeRobot框架中加载使用。
使用方法
该数据集的设计遵循LeRobot生态系统的规范化接口,因此使用方式极为便捷且标准化。用户可通过LeRobot库中提供的load_dataset函数直接加载该数据集,并利用其内置的数据迭代器获取单帧或多帧的批量化观测-动作对。由于数据已按1000帧分块并全部划分至训练集,研究者无需额外进行交叉验证分割即可开始模型训练。在具体操作时,可通过访问'observation.images'下的不同相机键名获取五视角图像,结合'action'字段的6维关节位置指令构成标准的策略学习输入-输出对。LeRobot框架同时提供可视化工具,允许用户直观查看各回合的演示视频与机械臂状态随时间的演变过程,极大降低了数据处理与模型迭代的门槛。
背景与挑战
背景概述
SP_Relational_Placement数据集由研究团队基于LeRobot框架构建,聚焦于机器人操作中基于空间关系的物体放置任务。该数据集于近期创建,包含51个演示轨迹与超过4万帧多视角视觉及触觉传感数据,旨在推动机器人从多模态感知中学习物体间相对位置与放置动作的关联。作为面向关系推理的机器人操控数据集,它为机械臂在非结构化环境中执行精准空间操作提供了标准化训练与评估平台,对发展具备空间理解能力的自主机器人系统具有重要价值。
当前挑战
数据集着力解决的核心领域挑战是机器人对物体间相对空间关系的感知与操作问题,这要求算法能够理解“放置到某物体后方”等抽象空间指令并执行精准抓放。构建过程中面临多重困难:多视角视频与深度数据的同步采集需精密硬件校准;51个有效轨迹样本量较小,难以覆盖更复杂的空间关系变体;数据标注依赖人工演示,单一重复轨迹(如第40段)可能引入偏差;此外,机械臂关节状态与传感信号的异构时序整合也对数据质量提出了严苛要求。
常用场景
经典使用场景
在机器人操作与智能抓取领域,空间关系放置任务的基准数据集长期匮乏,而SP_Relational_Placement数据集恰好填补了这一空白。该数据集记录了51个机器人执行空间关系放置任务的完整轨迹,涵盖9种不同任务,如将粉色标记物放置到绿色积木后方等精细操作。通过采集多视角视觉信息(包括腕部、中部、上方、左右共五个摄像头)以及关节状态、电机电流等底层传感数据,它为模仿学习、行为克隆及强化学习等算法提供了高保真的训练样本。研究者可基于此数据集训练机器人理解“前后左右”等空间语义,实现从视觉输入到精确位姿动作的端到端映射,从而推动机器人对空间关系的认知与执行能力迈上新台阶。
解决学术问题
该数据集直面机器人学习中的两大核心难题:一是如何从高维视觉输入中提取空间关系特征,二是如何实现跨任务的动作泛化。在学术研究中,传统数据集往往聚焦于抓取或放置等孤立动作,忽略了物体间相对位置关系对操作策略的深刻影响。SP_Relational_Placement通过标准化空间关系放置任务,为验证多任务学习、元学习及少样本学习等前沿理论提供了实验平台。其意义在于,它促使学术界从单纯的动作复现转向对操作意图的理解——机器人不仅需要“放置”,更要“懂得”放置于何处。这一转向直接推动了具身智能领域中空间推理与运动规划融合研究的发展,成为连接感知与行动的桥梁。
实际应用
在智能制造与仓储物流场景中,SP_Relational_Placement数据集展现了巨大的应用潜力。例如,在分拣流水线上,机器人需根据订单要求将不同物料精准放置于指定托盘位置,而这恰恰是数据集所定义的空间关系放置任务。通过在此数据集上预训练的模型,机器人能快速适应新工位布局,无需人工重新编程。此外,在家庭服务机器人领域,该技术可赋能机器人执行“将杯子放在盘子右侧”等自然语言指令,极大地提升了人机交互的自然度。工业场景中的精密装配——如将螺丝垫片置于螺母上方——同样能从此数据集中受益,因为它提供了一套可复现的、多视角感知的解决方案,降低了部署成本。
数据集最近研究
最新研究方向
在机器人操作与模仿学习的前沿领域,SP_Relational_Placement数据集聚焦于空间关系理解下的物体放置任务,其通过远程操作(so_follower)采集了51个演示片段,涵盖9种不同任务,并融合了多视角视觉(腕部、中部、上方、左右相机)与关节状态、电机电流等多模态信息。这一数据体系为研究机器人如何理解并执行“将粉红标记物放到绿色积木后方”这类蕴含相对空间语义的操作提供了高保真训练素材。当前,该数据集正被用于推动基于行为克隆或隐式策略的精细操作模型发展,尤其在与大语言模型或视觉语言模型结合以实现开放世界物体重排的热点研究中,其多视角深度图像与六维动作空间的配置成为验证空间推理与操作解耦能力的关键基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务