遇见数据集

robot-kinematics-dataset

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

该数据集包含多段自我中心(第一人称视角)视频记录,并配以提取的3D手、手腕和手臂运动轨迹。数据专门用于模仿学习、行为克隆、Isaac Sim运动学回放以及强化学习数据集训练流程。数据来源于GoPro或类似自我相机拍摄的视频,通过双管道追踪引擎(YOLO11m-Pose用于手臂追踪,MediaPipe Hands用于3D手部关键点和夹爪距离估计)提取运动学数据。数据集兼容Franka Emika Panda、Universal Robots等机器人及其自定义平行夹爪末端执行器。数据以Apache Parquet、RLDS JSON和二进制TFRecord三种格式提供。每个episode包含一系列帧,每帧具有以下特征:步骤索引、时间戳、归一化的肩部/肘部/腕部2D坐标、归一化的夹爪宽度、腕部相对位移动作、夹爪宽度变化动作、抓取阶段离散状态(OPEN、APPROACHING、GRASPING)以及episode边界标志。数据集可用于机器人运动学分析、模仿学习、行为克隆、模拟环境回放等任务。

This dataset contains multiple egocentric (first-person) video recordings with extracted 3D hand, wrist, and arm motion trajectories. The data is specifically designed for imitation learning, behavior cloning, kinematic replay in Isaac Sim, and reinforcement learning dataset training pipelines. The data originates from GoPro or similar ego-camera videos, with kinematic data extracted via a dual-pipeline tracking engine (YOLO11m-Pose for arm tracking, MediaPipe Hands for 3D hand keypoints and gripper distance estimation). The dataset is compatible with robots such as Franka Emika Panda, Universal Robots, and their custom parallel jaw gripper end-effectors. Data is provided in three formats: Apache Parquet, RLDS JSON, and binary TFRecord. Each episode consists of a sequence of frames, each frame containing the following features: step index, timestamp, normalized 2D coordinates of shoulder/elbow/wrist, normalized gripper width, wrist relative displacement action, gripper width change action, discrete grasp state (OPEN, APPROACHING, GRASPING), and episode boundary flags. The dataset can be used for robot kinematic analysis, imitation learning, behavior cloning, simulation environment replay, etc.

创建时间:
2026-08-11
原始信息汇总

EgoCentric Multi-Episode Kinematics Trajectory Dataset 数据集详情

数据集概述

该数据集包含多集第一人称视角(egocentric)视频录像,并配对了提取的3D手部、手腕和手臂运动学轨迹。数据集专为模仿学习(IL)、行为克隆(BC)、NVIDIA Isaac Sim运动学回放及强化学习数据集(RLDS)训练流程而设计。

基本信息

  • 许可证:MIT License
  • 任务类别:机器人学(robotics)、关键点检测(keypoint-detection)、视频分类(video-classification)
  • 标签:姿态估计、运动学、egograsp、RLDS、Parquet、视频到运动学转换、MediaPipe、YOLO11、Isaac Sim
  • 数据格式:Apache Parquet、RLDS JSON、二进制TFRecord(并发导出)

数据来源与处理

项目 详情
源域 第一人称视角视频流(GoPro / Ego-cam)
提取引擎 双管道追踪:YOLO11m-Pose(手臂追踪)和 MediaPipe Hands(3D手部关键点与夹爪距离估计)
目标机器人兼容性 Franka Emika Panda、Universal Robots、自定义平行夹爪末端执行器

数据模式(Schema)

每个时间步代表视频序列中的一帧,包含以下特征字段:

特征字段名 数据类型 范围/维度 描述
step_index int64 [1, N] 集内帧序列索引
timestamp_sec float64 ≥ 0.0 帧时间戳(秒)
obs_shoulder_xy list[float] [X, Y] ∈ [0.0, 1.0] 归一化2D肩关节坐标
obs_elbow_xy list[float] [X, Y] ∈ [0.0, 1.0] 归一化2D肘关节坐标
obs_wrist_xy list[float] [X, Y] ∈ [0.0, 1.0] 归一化2D腕关节坐标
obs_gripper_width float64 [0.0, 1.0] 归一化夹爪距离(0.0=闭合,1.0=张开)
action_delta_wrist_xy list[float] [ΔX, ΔY] 相对上一帧的腕部位移
action_delta_gripper_width float64 ΔG 相对上一帧的夹爪状态变化
task_grasp_phase string 分类值 离散状态:OPEN、APPROACHING、GRASPING
is_first boolean True/False 指示起始帧的集边界标志
is_last boolean True/False 指示终止帧的集边界标志

数据集结构

my-robot-kinematics-dataset/ ├── README.md ├── videos/ │ ├── episode_001_raw.mp4 # 原始第一人称输入视频(第1集) │ ├── episode_001_kinematics.mp4 # 视觉追踪叠加与骨架可视化(第1集) │ ├── episode_002_raw.mp4 # 原始第一人称输入视频(第2集) │ └── episode_002_kinematics.mp4 # 视觉追踪叠加与骨架可视化(第2集) └── data/ ├── episode_001.parquet # 第1集列式Parquet数据集(PyTorch / LeRobot) ├── episode_001.json # 第1集可读RLDS JSON架构 └── episode_001.tfrecord # 第1集二进制TFRecord格式(Open X-Embodiment)

使用示例

数据集支持通过hf://协议使用Pandas直接流式加载Parquet文件,也支持多集批量聚合用于PyTorch DataLoader,以及通过HTTP请求加载RLDS JSON结构化数据。数据集同时发布在Hugging Face平台上,可通过https://huggingface.co/datasets/shiyixia/robot-kinematics-dataset访问。

联系与引用

  • 联系邮箱:shiyixia2000@gmail.com(可用于定制技能类视频/运动学数据集购买需求或改进建议)
  • 引用:数据集提供BibTeX格式的引用条目,适用于研究、仿真实验(NVIDIA Isaac Sim、MuJoCo、Gazebo)或机器人学习基准测试中的引用。
搜集汇总
数据集介绍
robot-kinematics-dataset 数据集图片
构建方式
该数据集源自第一人称视角视频流,通过双管线追踪引擎(YOLO11m-Pose与MediaPipe Hands)同步提取手臂与手部的三维运动学轨迹,进而构建多情节的机器人操作数据集。每一视频帧被转化为包含时间戳、肩肘腕归一化坐标、夹爪开合度等状态特征,以及相对位移与夹爪变化量的动作标签,并标注了任务抓取阶段与情节边界标记。数据以Apache Parquet、RLDS JSON和二进制TFRecord三种格式并行导出,确保兼容不同训练框架。
使用方法
使用该数据集时,研究者可通过Hugging Face的hf://协议直接以Pandas读取Parquet文件,无缝接入PyTorch或LeRobot数据管线。支持多情节批量聚合,以构建统一的训练集。同时,也提供了RLDS JSON格式的加载示例,便于在开放式具身智能框架(如Open X-Embodiment)中应用。数据集还兼容Isaac Sim、MuJoCo等仿真环境,可用于运动学重放与策略评估,为机器人学习研究提供了一站式的数据支撑。
背景与挑战
背景概述
该数据集于2026年由研究者shiyixia(联系方式:shiyixia2000@gmail.com)创建并发布在Hugging Face平台上,专注于机器人运动学轨迹的建模与分析。其核心研究问题在于如何从第一人称视角的视频流中高效提取人体手臂及手部的三维运动学信息,以支持模仿学习(IL)、行为克隆(BC)、Isaac Sim运动学重放及强化学习数据集(RLDS)等机器人学习任务。数据集通过双管道追踪引擎(YOLO11m-Pose用于手臂追踪,MediaPipe Hands用于手部关键点和夹爪宽度估算)对多集(episodes)的自我中心视频进行运动学解构,提供了包括肩、肘、腕关节的归一化坐标、夹爪开合状态、相对动作增量及任务抓取阶段等精细结构化特征,其多格式(Parquet、RLDS JSON、TFRecord)输出设计兼顾了主流机器人学习框架的兼容性,为机器人技能学习与仿真迁移提供了高质量的数据基础。该数据集的发布填补了自我中心视角机器人运动学轨迹公开数据集的空白,有望推动机器人从人类演示中学习复杂操作技能的研究进展。
当前挑战
该数据集所面临的核心挑战源于机器人操作技能学习中视觉-运动学映射的复杂性。在领域层面,如何从单目自我中心视频中精确且鲁棒地估计三维空间中的肩、肘、腕关节位置及手部精细动作,抵抗遮挡、光影变化和运动模糊等真实环境干扰,是运动学感知的长期难题,且现有方法在泛化至不同机器人末端执行器(如Franka、UR)时仍存在差距。在数据构建层面,挑战包括双管道追踪系统(YOLO11m-Pose与MediaPipe Hands)的同步与融合误差,需要协调两套模型在时间戳和坐标空间上的一致性;此外,标签标注依赖自动提取而非人工校准,可能引入系统性偏差;多集数据的一致性和边界定义(如is_first/is_last标志)也需严格管理,以确保轨迹的连贯性;同时,数据格式的多样性(Parquet、JSON、TFRecord)增加了存储和加载的复杂性,可能影响实时训练的效率。最后,数据集的规模(当前仅展示两集示例)限制了其覆盖多样化抓取姿势和场景的能力,未来需扩展数据量以支持更高泛化性能的模型训练。
常用场景
经典使用场景
该数据集为模仿学习和行为克隆研究提供了精细化的运动学轨迹数据,尤其适用于基于第一人称视角的机器人操作任务。其典型应用场景包括利用观测的肩、肘、腕关节坐标及夹爪宽度,训练策略网络将视觉观察映射至末端执行器的增量动作,完成抓取、放置等精细操作。数据以多 episode 形式组织,配合时间戳和任务相位标签,便于构建时序模型和训练强化学习环境。
解决学术问题
该数据集有力解决了机器人学习领域中真实演示数据匮乏、且难以直接用于训练的策略学习难题。通过提供统一格式的关节坐标和动作增量,它支持了端到端的行为克隆研究,缓解了从高维视频到精确控制信号之间的鸿沟。同时,包含的抓取相位标签和边界标志,为探索任务分解、阶段识别及跨 episode 泛化等学术问题提供了标准化的数据基础。
实际应用
在实际应用中,该数据集可直接用于构建工业机械臂(如 Franka、UR)的视觉伺服控制系统。基于数据训练的策略可部署于仓库分拣、精密装配等场景,实现从人第一视角演示到机器人自主操作的迁移。此外,其兼容 Isaac Sim 等仿真平台,使得在虚拟环境中进行大规模策略验证和参数调优成为可能,显著提升了研发效率。
数据集最近研究
最新研究方向
该数据集聚焦于具身智能领域中基于第一人称视觉的机器人操作技能学习,通过将原始视频流与精细的关节运动学轨迹相耦合,为模仿学习与行为克隆提供了高保真度的训练样本。其前沿性体现在融合了YOLO11m姿态估计与MediaPipe手部追踪的双流水线提取架构,能够同步捕捉手臂与手部的连续运动状态,进而支撑如NVIDIA Isaac Sim中的运动学重放及强化学习数据管道等复杂研究场景。此数据集不仅促进了跨具身平台(如Franka Emika Panda与UR机器人)的策略迁移研究,还通过标准化多格式(Parquet、RLDS、TFRecord)输出,深度契合了Open X-Embodiment等大规模协作基准的发展需求,为构建通用、鲁棒的机器人操作大模型奠定了关键数据基础,对推动端到端技能习得与仿真到现实迁移的研究具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务