遇见数据集

pusht-manipulation

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集包含100个在真实Franka Emika Panda机器人上执行Push-T任务的人类遥操作演示。任务内容是将一个橙色T形块推过桌面,直至其与表面标记的粉色T形轮廓对齐。机器人的夹爪夹持一支笔作为单点推杆,夹爪保持闭合状态。数据集以10 Hz的频率录制,总共包含32,131帧,约54分钟的演示。每个episode存储为一个独立的HDF5文件,文件组织方式为按会话文件夹分组(如0826_1637/),每个会话内episode编号从0开始。数据包含观测和动作信息:观测包括场景摄像头图像(256×256 RGB)、腕部摄像头图像(256×256 RGB)、夹爪宽度(米)、末端执行器位置(米,机器人基坐标系)、末端执行器四元数(xyzw顺序,标量在最后)、关节位置(7维);动作为7维向量 [dx, dy, dz, drx, dry, drz, gripper],其中dx, dy, dz是每100 ms步骤的平移增量(米),但drx, dry, drz恒为零,gripper恒为+1(闭合),因此仅前三个通道携带有效信息。99个episode的起始姿态几乎一致,仅有1个episode经过裁剪处理以减小起始偏移。该数据集适用于机器人模仿学习、操作策略训练等任务,特别是需要处理恒定动作通道的归一化场景。

This dataset contains 100 human teleoperation demonstrations of the Push-T task performed on a real Franka Emika Panda robot. The task is to push an orange T-shaped block across the table until it aligns with a pink T-shaped contour marked on the surface. The robots gripper holds a pen as a single-point pusher, and the gripper remains closed. The dataset is recorded at 10 Hz, totaling 32,131 frames (approximately 54 minutes of demonstration). Each episode is stored as an independent HDF5 file, organized by session folders (e.g., 0826_1637/), with episode numbers starting from 0 within each session. The data includes observations and actions: observations consist of scene camera images (256×256 RGB), wrist camera images (256×256 RGB), gripper width (meters), end-effector position (meters in robot base frame), end-effector quaternion (xyzw order, scalar last), and joint positions (7-dimensional); actions are 7-dimensional vectors [dx, dy, dz, drx, dry, drz, gripper], where dx, dy, dz are translation increments per 100 ms step (meters), but drx, dry, drz are always zero, and gripper is always +1 (closed), so only the first three channels carry valid information. The starting poses of 99 episodes are almost identical, with only one episode cropped to reduce initial offset. This dataset is suitable for robot imitation learning, manipulation policy training, and other tasks, especially scenarios requiring normalization of constant action channels.

创建时间:
2026-09-01
原始信息汇总

数据集概述

该数据集为 Push-T 真实机器人操作任务数据集,包含 100 条人类远程操作演示,由 Franka Emika Panda 机械臂执行任务:将橙色 T 形木块推至桌面上粉色 T 形轮廓处对齐。机械爪夹持一支记号笔作为单点推杆,是该任务在真实硬件上的实现。

基本统计信息

会话文件夹 演示条数 帧数 采集日期
0826_1637/ 50 19,392 2026-08-26
0827_1114/ 2 585 2026-08-27
0827_1118/ 33 8,837 2026-08-27
0827_1144/ 15 3,317 2026-08-27
总计 100 32,131
  • 数据以 10 Hz 频率记录,总时长约 54 分钟。
  • 每条演示的长度为 100–767 步(10–77 秒),中位数为 292 步(29 秒)。
  • 文件结构为 <session>/episode_<n>.hdf5,会话名称按采集时间排序(如 0826_1637 表示 8 月 26 日 16:37),episode 编号在会话内重新开始,并非全局唯一。

数据格式

每个 episode 存储为一个 HDF5 文件,记录于 10 Hz,使用 polymetis 笛卡尔阻抗控制和两个 RealSense 摄像头(场景和腕部)采集:

  • obs/agentview_image:场景相机 RGB 图像,形状 (T, 256, 256, 3),uint8。
  • obs/wrist_image:腕部相机 RGB 图像,形状 (T, 256, 256, 3),uint8。
  • obs/gripper_width:夹爪宽度,形状 (T, 1),float32,单位米。
  • obs/robot0_eef_pos:末端执行器位置,形状 (T, 3),float32,单位米(机器人基座坐标系)。
  • obs/robot0_eef_quat:末端执行器姿态四元数,形状 (T, 4),float32,xyzw 顺序(标量在最后)。
  • obs/robot0_joint_pos:关节位置,形状 (T, 7),float32。
  • actions:动作,形状 (T, 7),float32。

动作定义[dx, dy, dz, drx, dry, drz, gripper]

  • dx, dy, dz:末端平移增量,单位米/100 毫秒步长,范围 ±0.018 米。
  • drx, dry, drz:旋转增量。
  • gripper:夹爪开闭命令。

重要提示:7 个动作通道中有 4 个是常数。

  • drx, dry, drz 在所有帧中恒为零(仅控制平移)。
  • gripper 在所有 32,131 帧中恒为 +1(夹爪闭合),对应 obs/gripper_width 恒为 0.0076 米。
  • dx, dy, dz 承载有效信息。在使用未加保护的归一化器(如 (x-min)/(max-min))时可能产生除零错误导致 NaN,建议使用带保护分支的归一化器,或仅归一化前三个通道,或使用 3 维动作空间进行训练。

观测信息

  • 两个相机图像均为 256×256 RGB,未经任何后处理(无旋转、翻转或裁剪)。
  • obs[t] 对应操作者在选择 actions[t] 时看到的观测。
  • 末端执行器范围为 x ∈ [0.395, 0.606] 米,y ∈ [−0.130, 0.312] 米,z ∈ [0.221, 0.389] 米(机器人基座坐标系)。任务并非严格平面运动:z 方向 168 毫米的变化是操作者在两次推动之间抬起笔以重新定位,避免拖动木块。

起始位姿说明

  • 99 条演示从几乎相同的位姿开始:中位起始位姿与全集中位起始位姿偏差 4.8 毫米,p90 为 6.3 毫米,最大偏差 7.1 毫米。
  • 例外0827_1144/episode_13.hdf5。该条演示在录制开始时手臂停在其他位置,操作者花费前 3 秒将手臂移至常规起始区域后才开始推动。这些前导帧(30 帧)已被从发布的文件中裁剪,因此该文件包含 263 帧而非原始 293 帧(文件属性 attrs["trimmed_lead_in_frames"] = 30)。裁剪后其起始位姿偏差从 292 毫米降至 26 毫米(主要为 y 轴 +287 毫米的偏差被消除),但仍比其他 99 条演示的最大偏差(7.1 毫米)大约 3.7 倍,若需严格同质起始分布可考虑剔除该演示。

已移除内容

原始记录还包含 480×640 RGB、480×640 及 256×256 深度图、腕部红外立体对等数据。这些未被包含在数据集中,因为它们约占原始字节的 88%,且在训练流程中完全不被使用。上文列出的通道是训练策略所消费的完整数据集合。

数据加载示例

python import h5py, glob

for path in sorted(glob.glob("/episode_.hdf5")): with h5py.File(path, "r") as f: rgb = f["obs/agentview_image"][:] # (T, 256, 256, 3) uint8 wrist = f["obs/wrist_image"][:] state = f["obs/robot0_eef_pos"][:] # (T, 3) actions = f["actions"][:, :3] # only xyz carries signal

采集说明

数据使用 github.com/sleepmastergx/franka-robot-toolsrecorder/collect.py)记录,通过 3Dconnexion SpaceMouse 进行远程操作。每条演示均从相同的保存主位姿开始,因此会话内的起始帧保持一致。

搜集汇总
数据集介绍
pusht-manipulation 数据集图片
构建方式
该数据集源于对真实Franka Emika Panda机械臂的遥操作采集,操作者借助3Dconnexion SpaceMouse,在笛卡尔阻抗控制模式下执行经典的Push-T任务:将橙色T形块推至与桌面粉色T形轮廓对齐。采集工具为开源框架franka-robot-tools中的recorder/collect.py,并以10 Hz频率记录两个RealSense相机(场景与腕部)的RGB观测及机器人本体状态,最终形成100条演示轨迹,累计32,131帧,约54分钟,存储为按时间戳会话划分的逐回合HDF5文件。
使用方法
加载时按目录遍历HDF5文件,读取obs/agentview_image与obs/wrist_image获取视觉观测,提取actions前三个维度作为有效动作信号,其余通道可置为常量。鉴于恒定通道的存在,训练前必须选用带保护的归一化器(如FastWAM中range < 1e-4分支或扩散策略的等价实现),将零方差维度映射为零并正确反归一化;若使用朴素的min-max归一化将导致除零与NaN,可改为仅归一化前三个通道或直接训练三维动作空间。
背景与挑战
背景概述
在机器人操作学习领域,数据集的物理真实性与任务保真度是决定策略泛化能力的关键因素。Push-T作为经典的平面推动基准任务,长期以仿真环境为主,缺乏真实硬件上的高质量演示数据。pusht-manipulation数据集由研究者于2026年8月基于Franka Emika Panda机械臂构建,采用SpaceMouse遥操作方式采集了100条人类演示轨迹,共计32,131帧。该数据集将仿真中的Push-T任务迁移至真实硬件,以标记笔作为单点推动器,推动橙色T形块与粉色轮廓对齐,为模仿学习与机器人操作研究提供了兼具真实性与标准化的宝贵资源。
当前挑战
所解决的领域问题在于,真实机器人操作中的高维动作空间与视觉观测耦合使得策略学习面临样本效率低、初始状态分布敏感等难题,而现有仿真数据难以完全弥合仿真到现实的差距。构建过程中,数据集面临动作通道冗余的固有挑战:七个动作维度中旋转与夹爪通道恒为零或常数,朴素归一化将引发除零异常并产生NaN,需依赖带保护机制的归一化器或降维处理。此外,100条演示中99条起始位姿高度一致,仅有一条经裁剪后仍偏离约26毫米,初始状态的同质性限制了策略对位姿扰动的鲁棒性,对数据多样性构成显著制约。
常用场景
经典使用场景
在机器人模仿学习与精细操作研究领域,Push-T任务长期被视为评估策略泛化能力的基准问题,而pusht-manipulation数据集则将该任务从仿真环境迁移至真实Franka Emika Panda硬件平台。该数据集的经典使用场景聚焦于单点推动操作的行为克隆训练:研究者利用100条人类遥操作演示,涵盖约54分钟、32,131帧的10 Hz轨迹数据,驱动策略网络学习将橙色T形块推至粉色轮廓的对齐位置。每条演示同步记录场景相机与腕部相机的RGB观测、末端执行器位姿、关节角度及动作指令,为端到端视觉运动策略提供完整的监督信号。相较于仿真版本,该数据集保留了真实硬件的动力学噪声、相机标定偏差与操作者手眼协调的细微差异,因而成为检验模仿学习算法从仿真到现实迁移能力的经典试验场。
解决学术问题
该数据集主要回应了机器人学习中真实世界演示数据稀缺与动作空间冗余两大常见学术难题。一方面,真实硬件上的精细操作演示采集成本高昂,公开可用的Franka平台Push-T数据集长期缺位,该数据集以100条轨迹填补了这一空白,为离线强化学习与行为克隆提供了标准化的真实基准。另一方面,七维动作空间中仅平移三通道携带有效信息,其余四通道恒定为零或常数,这一特性迫使研究者正视归一化策略的鲁棒性问题——朴素的线性归一化会因除零而产生NaN,而带保护的归一化则可正常训练。该问题在学术上揭示了数据预处理对策略稳定性的决定性影响,推动了针对退化动作维度的标准化处理流程的讨论与改进,对离线策略学习的可复现性具有方法论意义。
实际应用
在实际应用层面,pusht-manipulation数据集服务于工业与服务机器人中非抓取式操作的技能习得需求。推动、对齐、归位等动作广泛存在于物流分拣、桌面整理、精密装配等场景,而夹爪闭合的推动模式恰好模拟了以单一接触点操控物体的典型工况。该数据集提供的多视角视觉与本体感知同步记录,可直接用于训练基于扩散策略或Transformer的视觉运动策略,并部署至同构Franka平台执行类似推动任务。此外,数据集中10 Hz的低频控制信号与笛卡尔阻抗控制接口,便于与现有机器人中间件对接,降低了从研究原型到产线验证的迁移门槛。对于需要快速构建推动技能原型的团队而言,该数据集提供了即取即用的真实演示资源。
数据集最近研究
最新研究方向
在机器人模仿学习与精细操作研究的前沿浪潮中,pusht-manipulation凭借真实Franka Emika Panda平台上的百条遥操作演示,为弥合仿真到现实(sim-to-real)鸿沟提供了珍贵的实机数据支撑。该数据集聚焦于经典Push-T推挤任务,以单点笔尖推挤器将橙色T形块对齐至粉色轮廓,契合当前具身智能领域对接触丰富型操作与视觉-动作联合建模的热切探索。其突出价值在于揭示了真实遥操作中动作通道恒定(旋转自由度与夹爪指令全程不变)所引发的归一化陷阱,推动研究者开发如FastWAM中带范围守卫的线性归一化器,以避免训练中NaN发散,这为扩散策略等生成式模型在真实机器人上的稳健训练提供了关键警示。与此同时,仅百条演示、32,131帧、约54分钟的紧凑规模,正呼应了数据高效学习与少样本泛化的研究热点,促使学界审视异构初始状态(如第13条异常回合)对策略泛化边界的影响,进而推动初始状态分布同质化与数据修剪策略的深入探讨,对提升真实场景下操作策略的鲁棒性与可复现性具有切实的推动意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务