遇见数据集

robotwin_extrinsics

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

RoboTwin 2.0 (aloha-agilex) 是一个面向机器人操作的数据集,专注于末端执行器(EE)空间的数据表示。该数据集提供了包含相机外参和夹爪事件时序的版本。数据集的 action 字段(14维)包含每个时间步的左右臂末端执行器增量信息:位置增量(世界坐标系,3维)、旋转增量(本体轴角,3维)和夹爪绝对开合(1维),记作 action.ee_delta。observation.state 字段(16维)包含左右臂的绝对末端位姿:位置(3维)、四元数(xyzw,确保 qw>=0,4维)和夹爪开合(1维),与 RoboTwin 的 get_obs()['endpose'] 一致,是 take_action(action_type='ee') 所使用的位姿。此外,还保留了原始关节空间数据:action.joint_position 和 observation.state.joint_position(14维)。相机外参 observation.extrinsics.cam_* 表示相机位姿(位置3维,四元数xyzw 4维),采用 OpenCV 约定。夹爪时序字段包括 observation.gripper.{left,right}_time_to_{close,open} 和 observation.gripper.{left,right}_time_since_{close,open},分别表示距离下一次/上一次夹爪翻转的秒数,无翻转时填充为 10000。该数据集由 lerobot_policy_framepick 仓库中的脚本 augment_robotwin_extrinsics.py 和 augment_robotwin_ee_space.py 生成。

RoboTwin 2.0 (aloha-agilex) is a dataset for robotic manipulation, focusing on end-effector (EE) space data representation. The dataset provides a version with camera extrinsics and gripper event timestamps. The action field (14-dimensional) contains per-timestep end-effector delta information for the left and right arms: position delta (world frame, 3D), rotation delta (body axis-angle, 3D), and absolute gripper opening (1D), denoted as action.ee_delta. The observation.state field (16-dimensional) contains absolute end-effector poses for the left and right arms: position (3D), quaternion (xyzw, ensuring qw>=0, 4D), and gripper opening (1D), consistent with RoboTwins get_obs()[endpose] and used by take_action(action_type=ee). Additionally, raw joint space data are preserved: action.joint_position and observation.state.joint_position (14-dimensional). Camera extrinsics observation.extrinsics.cam_* represent camera poses (position 3D, quaternion xyzw 4D) following OpenCV conventions. Gripper timestamp fields include observation.gripper.{left,right}_time_to_{close,open} and observation.gripper.{left,right}_time_since_{close,open}, indicating seconds to/since the next/previous gripper toggle, filled with 10000 when no toggle occurs. This dataset is generated by the scripts augment_robotwin_extrinsics.py and augment_robotwin_ee_space.py from the lerobot_policy_framepick repository.

创建时间:
2026-08-06
原始信息汇总

数据集概述:RoboTwin 2.0 (aloha-agilex) 在末端执行器空间,含相机外参和夹爪时序

该数据集是基于 lerobot/robotwin_unified 的增强版本,专注于机器人操控任务,数据以 Parquet 格式存储,遵循 MIT 许可证。

主要特点

  • 坐标空间转换:将动作和观测状态从关节空间转换为末端执行器(EE)空间,符合 RoboTwin 中 take_action(action_type=ee) 的使用约定。
  • 信息扩展:在原始数据基础上,新增了相机外参和夹爪事件时序信息。

数据结构

数据文件位于 data/*/*.parquet,主要字段包括:

  1. 动作 (action):维度为 14,表示每个机械臂的增量末端执行器状态。包含平移增量的世界坐标(3)、旋转增量的机体轴角(3)和夹爪绝对位置(1),左右臂各一组,等同于 action.ee_delta

  2. 观测状态 (observation.state):维度为 16,表示每个机械臂的绝对末端位姿。包含位置坐标(3)、四元数(xyzw,且 w≥0,共4)和夹爪状态(1),左右臂各一组。该状态与 RoboTwin 的 get_obs()[endpose] 输出一致。

  3. 关节空间原始数据action.joint_positionobservation.state.joint_position,维度为 14,保留原始关节空间信息。

  4. 相机外参 (observation.extrinsics.cam_*):表示相机位姿,包含位置(3)和四元数(xyzw,共4),采用 OpenCV 相机约定。

  5. 夹爪时序 (observation.gripper.*):包含左右夹爪到达关闭/打开状态所需时间({left,right}_time_to_{close,open})及自上次夹爪翻转以来的时间({left,right}_time_since_{close,open}),单位为秒。当无相关事件时,使用哨兵值 10000

生成方式

该数据集通过 lerobot_policy_framepick/scripts/augment_robotwin_extrinsics.pylerobot_policy_framepick/scripts/augment_robotwin_ee_space.py 两个脚本依次处理生成。

搜集汇总
数据集介绍
robotwin_extrinsics 数据集图片
构建方式
该数据集源自RoboTwin 2.0仿真平台,针对双臂机器人操作任务,在末端执行器空间内进行了精细重构。构建流程首先通过特定脚本为原始数据补充相机外参和夹爪事件时序信息,随后将动作与状态表示转换为末端执行器增量格式。具体而言,动作数据被规范化为每步的增量位姿与夹爪绝对位置,状态数据则整合为绝对末端位姿的四元数表示,同时保留原始关节空间数据以供对照。这种双层构建策略确保了数据在运动学层面的直观性与完整性。
使用方法
使用时,研究者可直接加载parquet格式的样本,其中动作与状态已按末端执行器空间对齐,适合用于模仿学习或强化学习模型的输入输出。夹爪时间戳字段可辅助实现事件驱动的控制策略,而相机外参则支持将视觉观测投影至操作空间。数据集的模块化设计允许用户灵活选择关节空间或末端空间表示,便于进行跨空间策略的比较与迁移。建议配合LeRobot框架使用,以简化数据加载与预处理流程。
背景与挑战
背景概述
机器人操作学习领域正经历从关节空间控制向末端执行器空间策略的范式转变,这一转变要求数据集提供更精细的位姿与交互时序信息。RoboTwin 2.0 (aloha-agilex) 数据集应运而生,由相关研究团队于近期构建,旨在支撑双臂精准操作任务的研究。该数据集在原始 RoboTwin 统一框架基础上,创新性地引入了相机外参、夹爪开合事件时序,并将动作与状态表示转换至末端执行器空间,从而弥合了仿真环境与真实机器人之间的表征鸿沟。其核心研究问题聚焦于如何利用多模态感知与末端执行器动态信息,提升策略学习的数据效率与操作泛化能力。凭借其独特的设计,该数据集对模仿学习、强化学习及跨具身迁移研究产生了显著影响,为复杂双臂技能学习提供了标准化基准。
当前挑战
该数据集所应对的核心领域挑战在于,传统关节空间动作表示难以直接适用于学习型控制器,其高维且非直观的映射关系阻碍了策略的泛化与迁移。RoboTwin 2.0 通过提供末端执行器增量动作及绝对位姿,简化了动作语义,但引入了相机的精确标定与多视角坐标对齐难题,外参的微小误差可能导致策略执行时的累积偏差。构建过程中,从原始数据中提取夹爪事件时序并确保与连续动作流的同步,需要处理传感器频率差异与事件缺失情形,尤其是哨兵值(如10000)的设计虽缓解了无事件问题,却也考验了模型对时序噪声的鲁棒性。此外,将关节空间原始数据转换至末端执行器空间,须解决奇异点与不连续旋转表示(四元数)的数值稳定性问题,这为数据增强流程的设计增添了额外复杂性。
常用场景
经典使用场景
在机器人学习与操作领域,该数据集作为RoboTwin 2.0在末端执行器(EE)空间下的增强版本,为双臂协同操作任务提供了高精度的状态-动作映射。其经典应用场景聚焦于模仿学习和强化学习策略的训练与评估,研究者可利用其中包含的相机外参、夹爪事件时序以及末端执行器相对位姿增量,构建对双臂系统动态行为的精确建模。数据集中动作空间与观测状态均以EE空间表征,直接契合基于位姿的控制器设计需求,为跨具身平台的策略迁移与泛化研究奠定了坚实的数据基础。
解决学术问题
该数据集有效解决了双臂操作研究中普遍存在的状态表征不统一与传感器信息碎片化问题。通过将关节空间数据转换为统一的末端执行器空间,并引入相机外参与夹爪时序记录,它弥合了感知-控制之间的语义鸿沟,使得研究者能够更清晰地分离视觉反馈与本体感知对策略学习的影响。这一结构化的数据形式促进了可解释性分析,支持了关于位姿误差累积、时序对齐效应以及多模态融合机制的深入探讨,从而推动了机器人操作领域从专用策略向通用、鲁棒策略演进的学术进程。
实际应用
在实际应用层面,该数据集为工业双臂装配、精密抓取以及人机安全交互等场景提供了关键的数据支撑。例如,基于其相机外参信息,可开发出对视角变化具有鲁棒性的视觉伺服系统;而夹爪时序数据则有助于优化抓取动作的节拍与力控策略,提升生产线的柔性与效率。此外,该数据集还可用于校准实际机器人平台,通过将仿真或离线训练的策略部署至真实AgileX双臂平台,实现从数据到物理世界的无缝迁移,加速智能机器人在物流、医疗等领域的落地应用。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作策略的端到端学习,通过将联合空间数据转换至末端执行器(EE)空间并集成相机外参及夹爪时序信息,为双臂精细操作提供了高维状态-动作对齐。当前前沿研究趋于利用此类增强信号强化策略的泛化性与闭环控制精度,尤其在具身智能框架下,结合视觉-运动联合建模与事件驱动决策,推动从仿真到真实世界的零样本迁移。该数据集的意义在于弥合底层感知与高层动作规划间的表征鸿沟,为双臂协作、动态抓取等复杂任务提供可复现的基准,并促进多模态融合策略的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务