遇见数据集

RobotisAI/evButtonPush-260429-02-hdf5

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

evButtonPush 是一个用于机器人电梯按钮按压任务的多摄像头RGB演示数据集。该数据集使用ROBOTIS OMY 6-DoF机械臂在Isaac Sim 5.1 + Isaac Lab环境中通过脚本化教师(DLS-IK + 力反馈)自动收集。核心特点是每个演示强制使用100种电梯USD变体中的一种,确保50个演示对应50种独特的电梯(无重复)。数据集包含高分辨率图像(1920 × 1200),来自三个摄像头(手腕、顶部和底部摄像头),以及各种状态观测和动作数据。数据以HDF5格式存储,每个演示文件约1 GB。数据集包含50个演示(实际上传49个,因1个写入失败被排除),所有演示均成功完成按钮按压、LED点亮、门打开和返回初始位置的任务。数据采集频率为30 Hz,每演示包含约650至740帧。数据集还包含详细的观测和动作维度信息,如关节位置、末端执行器位置、按钮位置等。

evButtonPush is a multi-camera RGB demonstration dataset for a robotic elevator button pressing task. The dataset was collected using the ROBOTIS OMY 6-DoF manipulator in the Isaac Sim 5.1 + Isaac Lab environment with a scripted teacher (DLS-IK + force-feedback). The key feature is that each demonstration uses a distinct elevator USD variant from a pool of 100, ensuring 50 demonstrations correspond to 50 unique elevators (no duplicates). The dataset includes high-resolution images (1920 × 1200) from three cameras (wrist, top, and belly cameras), along with various state observations and action data. The data is stored in HDF5 format, with each demo file approximately 1 GB in size. The dataset contains 50 demonstrations (49 actually uploaded, as one was excluded due to bad write), all of which successfully completed the tasks of button pressing, LED lighting, door opening, and returning to the home position. The data collection frequency is 30 Hz, with each demo containing approximately 650 to 740 frames. The dataset also includes detailed observation and action dimensions, such as joint positions, end-effector positions, button positions, etc.

提供机构:
RobotisAI
搜集汇总
数据集介绍
RobotisAI/evButtonPush-260429-02-hdf5 数据集图片
构建方式
本数据集聚焦于机器人在电梯呼叫按钮按压任务中的模仿学习场景,基于Isaac Sim 5.1与Isaac Lab仿真环境构建。采用脚本化的教师策略(DLS-IK结合力反馈)自动采集ROBOTIS OMY 6自由度机械臂的示范数据。为确保场景多样性,从100种独特的电梯USD模型中,通过随机抽样的方式为每个示范强制分配一个不重复的变体,最终形成50个示范(实际可用49个),每个示范对应独一无二的电梯外观与布局。数据以HDF5格式存储,每段示范包含约650至740帧时序信息,控制与观测频率为30 Hz,使用三台分辨率1920×1200的摄像头(腕部、顶部、腹部)同步记录视觉数据。
特点
该数据集的核心特点在于其严格的唯一性设计,即每段示范均对应一个独特的电梯变体,彻底消除了场景重复,从而有效提升模仿学习策略的泛化能力。所有50个示范均经过成功验证,满足按钮按压、LED亮起、电梯门开启及机械臂归位四重判定标准。标注信息极为丰富,包含7维动作指令(6关节位置与1夹爪状态)、10维关节状态、末端执行器位姿、呼叫按钮三维位置与像素坐标、以及是否被按亮的二元标签。特别地,呼叫按钮亮起状态从0到1的精确转换时刻,可作为监督学习的强信号。
使用方法
该数据集适用于基于动作分块变换器(Action Chunking Transformer)等行为克隆方法的模仿学习训练。用户可直接加载HDF5文件,通过'data/demo_<seed>/actions'获取动作序列,'obs/'路径下获取三目摄像头图像及本体感知状态。建议将连续帧序列分割为固定长度的时间窗口作为模型输入,并利用'call_button_lit'通道的真值转换时刻进行关键事件对齐。由于数据采集自静态仿真场景,可直接用于离线策略学习,无需额外的环境交互。鉴于每个示范均为成功范例,训练时可统一视为正样本,适用于期望最大化或最大似然估计的损失函数设计。
背景与挑战
背景概述
evButtonPush-260429-02-hdf5数据集是一套专注于机器人模仿学习的高质量演示数据集,由研究团队在Isaac Sim 5.1和Isaac Lab仿真环境中,利用ROBOTIS OMY 6自由度机械臂和脚本化教师策略(DLS-IK结合力反馈)自动采集而成。该数据集创建于2025年,核心研究问题聚焦于如何通过视觉和关节状态信息,使机器人学会精准按压电梯呼叫按钮这一细粒度操作任务。与先前版本不同,本数据集强制要求50个演示各对应一种独特的电梯USD模型,确保了场景多样性和策略泛化性的严格评估。数据集包含三台1920×1200分辨率相机提供的高帧率RGB图像、七维动作空间及丰富的状态观测,为模仿学习(如Action Chunking Transformer)提供了坚实的数据基础,在机器人操作技能迁移与仿真到现实的研究中具有重要影响力。
当前挑战
该数据集旨在解决模仿学习领域中,机器人从仿真演示中学习精准接触式操作任务时面临的泛化性不足和状态感知不精确等挑战。具体而言,电梯按钮按压要求机械臂在力反馈和视觉引导下实现微米级的接触动作,而传统数据集常因场景重复或力觉信息缺失导致策略过拟合。在数据集构建过程中,技术挑战包括:在100种电梯变体中,通过随机采样的方式确保每个演示的唯一性以避免分布偏差;在仿真中为按钮运行时注入真实碰撞体并模拟LED和门体状态切换,以克服以往使用虚假脉冲信号的局限;同时,需在高频30Hz控制下处理三路大分辨率图像流的同步存储与大型HDF5文件的可靠性写入,最终去除一个损坏示范后形成49个有效演示。
常用场景
经典使用场景
evButtonPush-260429-02-hdf5数据集专为模仿学习(Imitation Learning)中的视觉运动策略训练而设计,尤其聚焦于机器人操作任务中的精细按钮按压动作。该数据集提供了50个独特电梯型号的演示,每个演示均包含机器人从初始位置接近、按压按钮至成功触发电梯门开启的完整过程。其独特之处在于,每个演示对应一个完全不同的电梯模型USD变体,确保了数据在视觉外观和几何结构上的高度多样性。研究者可利用该数据集训练如Action Chunking Transformer等高级策略网络,学习从多视角摄像头观测(腕部、顶部、腹部三台摄像头,分辨率1920×1200)到7维动作(6个关节位置+1个夹爪开合)的映射关系。30Hz的观测控制频率为捕捉精细动作时序提供了足够的时间分辨率。
实际应用
该数据集直接服务于工业和服务机器人的实际部署场景,特别是电梯操作这一日常生活高频任务。基于该数据集训练的模型可迁移至真实机器人系统,使其能够自主操作不同品牌、不同新旧程度的电梯呼叫按钮。数据集中的多视角摄像设置(腕部、顶部、腹部)模拟了实际机器人平台上常见的相机配置,便于模型在真实环境中利用相似传感器布局。30Hz的控制频率与工业机器人控制循环匹配,而静态环境中的位置随机化(初始末端执行器位置在±5cm范围内变动)和光照随机化(DomeLight每演示不同)增强了模型对环境变化的鲁棒性。此外,数据集中的像素坐标信息(button_pixel_uv)可直接用于视觉伺服控制策略,实现从视觉观看到精确位置控制的端到端部署。
衍生相关工作
该数据集的设计理念与代表性工作Action Chunking Transformer高度契合,后者是提升机器人模仿学习动作时序一致性的经典架构。数据集的多样电梯变体特性支持了模仿学习中的领域随机化研究,相关框架如PlasticNet和Domain Randomization for Sim2Real Transfer可直接利用此数据进行泛化性能评估。数据集明确标注的按钮按压状态(call_button_lit)为研究状态监督(State Supervision)提供了天然标签,类似的工作如One-Shot Imitation Learning和Temporal Difference Learning可基于此信号设计奖励函数。硬接触力的仿真机制呼应了Force-based Imitation Learning系列研究的核心需求,而多视角观测的设置则使其成为视觉-运动耦合研究的理想测试平台,相关基准工作包括RoboTurk和RLBench中关于多视角策略泛化的扩展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务