遇见数据集

tower-of-hanoi-game_rl_224

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

该数据集是一个用于机器人强化学习的演示数据集,聚焦于双臂机器人完成汉诺塔游戏任务。数据集由 LeRobot 项目创建,旨在为机器人操作学习提供高质量的离线训练数据。数据采集自一个名为 yam的双臂机器人平台。数据集核心内容为机器人在执行汉诺塔搬运任务过程中的多模态交互记录。具体而言,每个数据样本(帧)包含:来自三个固定视角(左腕部摄像头、右腕部摄像头、高位摄像头)的同步 RGB 视频观测,分辨率均为 224x224,帧率为 60 FPS;机器人的完整状态观测,包括左臂和右臂各 7 个关节(共14个)的位置或角度信息;以及机器人执行的动作,对应14个关节的控制命令。此外,数据还包含时间戳、帧索引、回合索引、任务索引、即时奖励和蒙特卡洛回报等元信息。整个数据集规模庞大,包含 1507 个完整任务回合,总计超过 326 万帧数据。数据以分块 Parquet 文件格式组织,并附带对应的视频文件。该数据集适用于机器人模仿学习、离线强化学习、视觉运动策略学习等研究,特别适合用于训练和评估双臂协调操作与堆叠任务的智能体。

This dataset is a demonstration dataset for robot reinforcement learning, focusing on a dual-arm robot completing the Tower of Hanoi game task. Created by the LeRobot project, it aims to provide high-quality offline training data for robot manipulation learning. Data is collected from a dual-arm robot platform named yam. The core content of the dataset consists of multimodal interaction recordings during the robots execution of the Tower of Hanoi搬运 task. Specifically, each data sample (frame) includes: synchronized RGB video observations from three fixed perspectives (left wrist camera, right wrist camera, overhead camera), all with a resolution of 224x224 and a frame rate of 60 FPS; complete state observations of the robot, including position or angle information for 7 joints each in the left and right arms (14 in total); and actions executed by the robot, corresponding to control commands for the 14 joints. Additionally, the data includes metadata such as timestamps, frame index, episode index, task index, immediate rewards, and Monte Carlo returns. The entire dataset is large-scale, containing 1507 complete task episodes, totaling over 3.26 million frames. The data is organized in chunked Parquet file format and comes with corresponding video files. This dataset is suitable for research in robot imitation learning, offline reinforcement learning, visual-motor policy learning, and is particularly well-suited for training and evaluating agents in dual-arm coordinated manipulation and stacking tasks.

创建时间:
2026-06-04
原始信息汇总

数据集概述

  • 数据集名称:tower-of-hanoi-game_rl_224
  • 任务类别:机器人学(robotics)
  • 标签:LeRobot
  • 许可证:Apache-2.0

数据集结构

  • 代码库版本:v3.0
  • 机器人类型:yam
  • 总片段数:1507
  • 总帧数:3264454
  • 总任务数:1
  • 帧率:60 FPS
  • 数据切分:仅包含训练集,共1507个片段
  • 数据存储路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频存储路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

特征信息

特征名称 数据类型 形状 说明
observation.state float32 (14,) 包含左右机械臂的7个关节状态(腰、肩、肘、前臂旋转、腕角度、腕旋转、夹爪),帧率60
observation.commander_state string (1,) 指挥官状态,帧率60
action float32 (14,) 动作指令,包含左右机械臂的7个关节动作,帧率60
observation.images.cam_left_wrist video (224,224,3) 左手腕摄像头画面,H.264编码,帧率60
observation.images.cam_right_wrist video (224,224,3) 右手腕摄像头画面,H.264编码,帧率60
observation.images.cam_high video (224,224,3) 高处摄像头画面,H.264编码,帧率60
timestamp float32 (1,) 时间戳,帧率60
frame_index int64 (1,) 帧索引,帧率60
episode_index int64 (1,) 片段索引,帧率60
index int64 (1,) 索引,帧率60
task_index int64 (1,) 任务索引,帧率60
reward float32 (1,) 奖励值,帧率60
mc_return float32 (1,) 蒙特卡洛回报,帧率60

数据文件大小

  • 数据文件:约100 MB
  • 视频文件:约200 MB

创建工具

该数据集使用 LeRobot 创建。

搜集汇总
数据集介绍
tower-of-hanoi-game_rl_224 数据集图片
构建方式
该数据集基于LeRobot框架构建,聚焦于机器人操作领域中的经典汉诺塔游戏任务。数据采集自名为“yam”的机器人平台,共包含1507个完整回合(episode),总帧数高达3,264,454帧,采样频率为60帧/秒,确保了对机器人精细动作的连续捕捉。数据集以parquet格式存储结构化数据,同时将多视角视频(包括左腕、右腕及俯视相机)以H.264编码的MP4文件另行保存,每个相机画面尺寸统一为224×224像素。所有数据按1000帧为一个chunk进行分块,便于高效加载与管理。训练集与完整数据集一致,未划分验证或测试子集,简化了使用流程。
特点
数据集的核心特征在于其丰富的多模态信息与精细的标注。机器人状态(observation.state)与动作(action)均包含14维浮点向量,细致描述了左右两侧各6个关节角度及夹爪开合状态,为模仿学习提供了完整的状态-动作对。此外,还记录了字符串类型的操作者指令状态(commander_state),为理解人类远程操控意图提供了语义线索。三路224×224的RGB视频流提供了从不同视角观察任务执行的环境信息,尤其适用于视觉-运动策略的训练。每个时间步还附带了奖励值(reward)与蒙特卡洛回报(mc_return),支持强化学习算法的直接应用。
使用方法
数据集特别适用于机器人模仿学习与基于视觉的强化学习研究。用户可借助LeRobot库轻松加载parquet数据与关联视频,无需手动处理复杂的文件结构。具体使用时,14维的observation.state和action向量可直接作为状态输入与动作输出训练策略网络,而三路图像观测(cam_left_wrist, cam_right_wrist, cam_high)则提供了视觉表征。reward和mc_return字段可用于值函数估计或回报计算。数据集已预设为单任务场景(汉诺塔游戏),且全部数据用于训练,用户仅需指定train split即可开始模型训练,评估时可自行划分微批样本。
背景与挑战
背景概述
该数据集由研究者jellyho于近期创建,依托HuggingFace LeRobot框架,专注于机器人操作任务中的强化学习研究。核心问题在于通过模仿学习或强化学习方法,使双机械臂系统能够自主完成经典智力游戏——汉诺塔的搬运与堆叠操作。数据集采集自YAM机器人平台,包含1507个完整回合、超过320万帧高帧率(60 FPS)多视角视觉与关节状态数据,为机器人精细操作技能学习提供了高质量基准。作为首个针对汉诺塔游戏场景的大规模机器人操作数据集,其公开化将有力推动机器人精细操作、任务规划与多臂协同控制等领域的算法发展。
当前挑战
该数据集针对的核心领域挑战是:如何在复杂结构化任务(如汉诺塔的递推规则)中实现机器人自主决策与精确操作,尤其是解决传统强化学习在长时序、稀疏奖励任务中样本效率低、探索困难的问题。构建过程中面临的工程挑战包括:双机械臂14维动作空间的高精度同步控制、多视角视频流(224×224分辨率)与状态数据的实时对齐、以及确保1507个回合的采集无碰撞且符合游戏规则。此外,数据特征中‘commander_states’的字符串数据类型暗示了人类遥操作示范的介入,如何有效利用此类混合数据(人类演示与自主探索)以加速策略学习,也是当前算法研究的重要课题。
常用场景
经典使用场景
在机器人学习与具身智能领域,经典的‘汉诺塔’游戏因其严谨的递推逻辑与精准的物理操作需求,成为衡量灵巧操作能力的理想基准任务。该数据集以yum自主设计的YAM双臂机器人作为载体,采集了多达1507个成功执行汉诺塔游戏的操作轨迹,每段轨迹均包含14维关节状态、指令信号、多视角视觉观测(左右手腕及高位相机)以及高精度动作序列。研究者可借助这些数据训练模仿学习或强化学习模型,使机器人学会从初始状态逐步移动圆盘至目标柱的完整流程,从而掌握多步骤规划与精细抓取、放置动作的精准耦合。高时空一致性的60帧每秒采样频率,为长时序依赖下的策略学习提供了坚实的数据基础。
实际应用
在真实应用层面,该数据集所蕴含的通用技能可直接迁移至工业精密装配、医疗手术辅助与家庭服务机器人等场景。例如,在电子产品的微小零件堆放任务中,机器人可借鉴汉诺塔中‘暂存与置换’的规划逻辑,实现多步骤、高精度的物态重组;家庭场景下,机器人执行餐具整理或药物分类工作时,同样需要类似的操作分解与协调能力。基于该数据训练的模型,可有效提升机器人对非结构化环境的适应能力,助力自主系统在复杂、动态且需要序列决策的实际任务中发挥关键作用,推动机器人从‘示教重复’向‘智能规划’演进。
衍生相关工作
该数据集问世后,直接催生了多项围绕双臂协调与灵巧操作的后续研究。研究者基于其标准化格式构建了多种基线模型,如将扩散策略、基于Transformer的动作分块模型与条件隐变量模型在该任务上进行系统对比,揭示了不同架构在长序列操作中的各自优势。部分工作则进一步引入虚拟现实遥操作数据来增强演示多样性,探讨了数据集规模与模型泛化能力的非线性关系。此外,该数据集所强调的高时间分辨率视觉-运动协同建模思路,启发了后续在‘少样本模仿学习’与‘层级逆强化学习’框架中的创新,成为双臂机器人操作领域进行公平算法性能评估的重要参照平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务