遇见数据集

2cam_top_wst_tab_white_15hz_100ep

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,使用LeRobot工具创建,采用Apache-2.0许可证,属于LeRobot生态系统的一部分,专门用于机器人技术研究。数据集包含100个完整的情节,总计23,093帧数据,涵盖1个任务。数据以分块形式组织,每个数据块约1000帧,原始数据文件总大小约100 MB,对应的视频文件总大小约200 MB。数据采集自isaac_piper机器人平台。核心内容包括:8维浮点向量的机器人动作指令(对应joint1至joint8的8个关节控制量)和机器人状态观测(对应joint1至joint8的8个关节实时状态),以及来自顶部摄像头和腕部摄像头的视觉观测(两个摄像头均提供分辨率为640x480、帧率15 FPS的RGB彩色视频流,视频采用AV1编解码器编码)。此外,数据还包含时间戳、帧索引、情节索引、全局索引和任务索引等元数据,用于时间对齐和数据检索。所有数据被划分为训练集,涵盖全部100个情节。该数据集适用于机器人模仿学习、强化学习、视觉-动作策略学习以及多模态感知与控制等任务。

This dataset is a robotic manipulation dataset created using the LeRobot toolkit, licensed under Apache-2.0, and is part of the LeRobot ecosystem specifically for robotics research. It contains 100 complete episodes, totaling 23,093 frames, covering a single task. The data is organized in chunks, with each chunk containing approximately 1,000 frames. The total size of the raw data files is around 100 MB, while the corresponding video files total approximately 200 MB. The data was collected on the isaac_piper robotic platform. The core content includes: 8-dimensional floating-point vector robot action commands (corresponding to 8 joint control values for joint 1 to joint 8) and robot state observations (corresponding to real-time states of the 8 joints from joint 1 to joint 8), as well as visual observations from the top camera and the wrist camera. Both cameras deliver RGB color video streams with a resolution of 640×480 and a frame rate of 15 FPS, and the videos are encoded with the AV1 codec. In addition, the dataset includes metadata such as timestamps, frame indices, episode indices, global indices, and task indices for time alignment and data retrieval. All data is split into the training set, covering all 100 episodes. This dataset is applicable to tasks such as robotic imitation learning, reinforcement learning, vision-action policy learning, and multimodal perception and control.

创建时间:
2026-06-03
原始信息汇总

数据集概述

该数据集是一个用于机器人操控的仿真数据集,由 LeRobot 框架创建,采用 Apache-2.0 许可证。

核心信息

  • 机器人类型: isaac_piper
  • 总片段数 (Episodes): 100
  • 总帧数 (Frames): 23,093
  • 总任务数 (Tasks): 1
  • 帧率 (FPS): 15
  • 数据集大小 (数据文件): 约 100 MB
  • 视频文件大小: 约 200 MB
  • 数据集分割: 训练集 (train) 包含全部 100 个片段 (0:100)。

数据结构

数据以 Parquet 文件和 MP4 视频文件的形式组织。

特征 (Features)

特征名称 数据类型 形状 (Shape) 描述
action float32 (8,) 8 个关节的动作指令。
observation.state float32 (8,) 8 个关节的观测状态。
observation.images.top video (480, 640, 3) 顶部摄像头图像,分辨率 480x640,3 通道 (RGB),AV1 编码,15 FPS。
observation.images.wrist video (480, 640, 3) 腕部摄像头图像,分辨率 480x640,3 通道 (RGB),AV1 编码,15 FPS。
timestamp float32 (1,) 时间戳。
frame_index int64 (1,) 帧索引。
episode_index int64 (1,) 片段索引。
index int64 (1,) 全局索引。
task_index int64 (1,) 任务索引。

可视化

您可以通过以下链接在 LeRobot 可视化空间中预览此数据集: https://huggingface.co/spaces/lerobot/visualize_dataset?path=shenj/2cam_top_wst_tab_white_15hz_100ep

搜集汇总
数据集介绍
2cam_top_wst_tab_white_15hz_100ep 数据集图片
构建方式
该数据集名为2cam_top_wst_tab_white_15hz_100ep,由LeRobot框架生成,专为机器人领域的研究设计。数据集基于isaac_piper机器人平台采集,总计包含100个演示片段(episodes),共23093帧数据,采样频率为15赫兹。数据以Parquet格式存储,图像通过AV1编码的视频文件管理,并按照chunk和file索引进行分块组织,便于高效加载与访问。数据文件与视频文件分别存储,总大小约300MB,其中视频数据占200MB。整个数据集被划分为单一训练集,覆盖0至100个片段的完整范围。
特点
此数据集的核心特点在于其双视角视觉系统设计,同时集成了顶部摄像头(observation.images.top)和腕部摄像头(observation.images.wrist),两者均为480×640像素、三通道彩色图像,以15帧/秒的帧率录制,为机器人操作任务提供了丰富的空间与细节信息。动作和状态空间均包含8个关节变量(joint1至joint8),格式为浮点数。此外,每条数据记录均包含时间戳、帧索引、片段索引和任务索引等元信息,支持精细的时间序列分析与任务复现,数据规模适中,适合用于模仿学习与运动规划等研究。
使用方法
使用时,用户可通过LeRobot库中的可视化工具在HuggingFace Spaces上直接预览数据集内容。数据加载推荐采用Parquet文件读取接口,结合视频文件解码获取完整观测序列。由于数据集已预先定义特征结构(actions、observation.state、observation.images等),研究者可便捷地将其用于训练机器人策略模型。训练过程中,状态和图像数据可作为输入,动作作为输出。数据集无预设验证集或测试集,用户可根据研究需求自行划分,并利用chunks_size=1000的分块机制进行批量处理,提升训练效率。
背景与挑战
背景概述
在机器人学习领域,基于视觉的模仿学习与强化学习正逐步成为智能体获取复杂技能的核心范式。此类方法高度依赖大规模、高保真的机器人操作数据集,以支撑模型在真实场景中的泛化能力与鲁棒性。由研究人员shenj构建的2cam_top_wst_tab_white_15hz_100ep数据集,于近期基于LeRobot框架创建并发布,机器人平台采用isaac_piper,旨在为桌面级精细操作任务提供标准化训练样本。该数据集包含100个完整操作回合,总计超过23000帧视觉与状态序列,通过顶部与腕部双摄像头以15帧/秒的频率同步采集640×480分辨率的RGB视频。数据集中动作空间与观测状态均涵盖8个关节维度,并以Apache-2.0许可证开放,为机器人灵巧操作研究提供了结构化的多模态训练资源。
当前挑战
该数据集所解决的领域核心挑战在于桌面级机器人操作任务中视觉-运动耦合的精准建模问题。传统仿真数据难以迁移至真实环境,而真实样本的采集又受限于示教者技能水平与硬件成本,导致模型对动态场景与物体变形的适应力不足。在构建过程中,挑战体现在多模态数据同步与标注质量保障上:顶部摄像头与腕部摄像头的视角差异、15Hz低帧率下的运动模糊、以及100回合有限样本量对数据多样性的制约,均可能影响策略学习的效率与泛化能力。此外,动作与状态空间均为8维连续变量,需要精密的力矩与位置校准,以避免关节耦合误差导致的任务失败。
常用场景
经典使用场景
该数据集专为机器人模仿学习研究而设计,是训练和评估机器人操作技能的核心数据资源。其经典使用场景在于利用双摄像头(顶部视角与腕部视角)的同步视觉输入,结合八维关节空间的动作与状态序列,构建从观察到动作的端到端映射模型。研究者可通过100个演示片段、总计超两万帧的精细数据,驱动策略网络学习如物体抓取、放置等精密操作,并在Isaac Piper仿真平台上进行高效验证。数据的15Hz采集频率与AV1视频编码在保证时序平滑性的同时兼顾了存储与计算效率。
衍生相关工作
基于此类数据集的涌现工作涉及动作分块变换器、扩散策略以及掩码式视觉逆强化学习等前沿方法。动作分块变换器借助该数据的时间序列结构将长程操作解耦为可预测的子轨迹,提升了机器人响应的实时性;扩散策略则通过逐步去噪学习演示中的随机性与多峰行为分布,从而生成更加柔顺的多样化动作。此外,多任务逆强化学习框架常以此类数据为奖励建模基础,利用其中的成功片段推断隐藏奖励函数,进而扩展至新物体或新任务场景下的零样本推理研究。
数据集最近研究
最新研究方向
该数据集聚焦于机器人灵巧操作与模仿学习的前沿探索,通过双视角视觉输入(顶部与腕部相机)记录高保真关节状态与动作序列,为多模态感知驱动的策略学习提供了高质量基准。其15Hz的采样频率与100个完整回合的设计,契合了当前机器人领域对动态环境适应性与数据效率的迫切需求,尤其支持端到端策略在精密装配、医疗辅助等任务中的泛化能力研究。结合LeRobot框架的开源生态,该数据集推动了可复现的具身智能实验范式发展,为机器人在非结构化场景下的闭环控制与迁移学习注入了关键数据动力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务