遇见数据集

robot-test-peg-sart

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

该数据集是一个用于机器人学习研究的模拟数据集,使用 LeRobot 框架创建。数据采集于 Isaac Sim 仿真环境,机器人型号为 Franka FR3,采用操作空间控制(OSC)模式,执行立方体堆叠任务。数据集包含 44 个演示片段(episode),共计 4600 帧,任务数量为 1。数据以 Parquet 格式存储状态和动作,以 MP4 视频格式存储视觉观测。视觉观测包含三个摄像头视角:两个第三人称视角(third_person_0 和 third_person_1)和一个手腕视角(wrist),分辨率均为 180×320,帧率 10fps,视频编码为 AV1。状态观测为 23 维浮点向量,包括 9 个关节位置、7 个末端执行器位姿(位置和姿态)以及 7 个先前动作。动作空间为 7 维浮点向量,表示 OSC 控制信号。此外,数据集还包含视觉 profile_id、时间戳、帧索引、episode 索引和任务索引等元数据。该数据集适用于模仿学习、行为克隆、机器人控制策略训练等任务。许可证为 Apache-2.0。

This dataset is a simulated dataset for robot learning research, created using the LeRobot framework. The data is collected in the Isaac Sim simulation environment, with the robot model Franka FR3, using Operational Space Control (OSC) mode to perform a cube stacking task. The dataset contains 44 demonstration episodes, totaling 4600 frames, with one task. Data is stored in Parquet format for states and actions, and MP4 video format for visual observations. Visual observations include three camera views: two third-person views (third_person_0 and third_person_1) and one wrist view (wrist), all with a resolution of 180×320, frame rate of 10fps, and video encoding in AV1. The state observation is a 23-dimensional floating-point vector, including 9 joint positions, 7 end-effector poses (position and orientation), and 7 previous actions. The action space is a 7-dimensional floating-point vector representing OSC control signals. Additionally, the dataset includes metadata such as visual profile_id, timestamps, frame indices, episode indices, and task indices. This dataset is suitable for tasks such as imitation learning, behavior cloning, and robot control policy training. The license is Apache-2.0.

创建时间:
2026-08-24
原始信息汇总

数据集概述

基本信息

  • 数据集名称: robot-test-peg-sart
  • 许可证: Apache-2.0
  • 任务类别: 机器人学(Robotics)
  • 标签: LeRobot, Robotics, Franka, FR3, Cube-Stacking, Isaac-Sim, Synthetic
  • 创建工具: 使用LeRobot框架创建

数据规模

  • 回合数(Episodes): 44
  • 总帧数(Frames): 4,600
  • 任务数: 1
  • 数据文件大小: 约100 MB
  • 视频文件大小: 约200 MB
  • 帧率(FPS): 10

数据划分

  • 训练集: 0:44(全部数据用于训练)
  • 验证集/测试集: 未提供

机器人配置

  • 机器人类型: Franka FR3(基于OSC控制)
  • 代码库版本: v3.0
  • 块大小(Chunk Size): 1,000

数据特征

视觉观测

特征名称 类型 分辨率 编码
observation.images.third_person_0(第三人称视角0) 视频 180×320×3 AV1, yuv420p
observation.images.third_person_1(第三人称视角1) 视频 180×320×3 AV1, yuv420p
observation.images.wrist(腕部相机) 视频 180×320×3 AV1, yuv420p

状态与动作

  • observation.state: float32类型,维度23,包含9个关节位置、7个末端执行器位姿及7个先前动作
  • action: float32类型,维度7,为OSC(操作空间控制)动作指令

其他特征

  • visual.profile_id: 视觉配置文件标识(int64)
  • timestamp: 时间戳(float32)
  • frame_index: 帧索引(int64)
  • episode_index: 回合索引(int64)
  • index: 索引(int64)
  • task_index: 任务索引(int64)

数据格式

  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet(Parquet格式)
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4(MP4格式)

其他说明

  • 数据集基于合成环境(Isaac-Sim)生成,适用于机器人操作任务(如立方体堆叠)
  • 可通过LeRobot的可视化工具在线预览数据集内容
搜集汇总
数据集介绍
robot-test-peg-sart 数据集图片
构建方式
该数据集基于LeRobot框架构建,针对Franka FR3机器人操作系统,通过Isaac Sim仿真环境合成,专注于立方体堆叠任务。数据采集包括44个回合,共计4600帧,以10帧/秒的频率记录,涵盖三视角视觉图像(两个第三方视角及一个腕部视角)和机器人状态信息。每条轨迹以parquet格式存储,并附有对应的MP4视频文件,确保数据完整性与可复现性。
特点
数据集内含丰富的高维观测数据,包括23维状态向量(关节位置、末端执行器姿态及先前动作)和7维操作动作(OSC控制信号),并标注了任务索引与时间戳。所有图像采用AV1编码,分辨率为180x320,既保证了视觉细节又兼顾了存储效率。数据规模紧凑,总量约100MB,视频数据约200MB,适合快速加载与模型训练。
使用方法
使用时,可通过LeRobot库直接加载该数据集,其划分明确,所有44个回合均用于训练。标准接口允许用户便捷地提取图像序列、状态和动作,用于模仿学习或强化学习算法的开发与评估。此外,HuggingFace提供的可视化工具支持在线预览,便于快速检视数据质量与任务特点。
背景与挑战
背景概述
机器人学习领域正经历从仿真到现实迁移的范式转变,而高质量数据集的匮乏成为制约具身智能发展的关键瓶颈。在此背景下,robot-test-peg-sart数据集于近期由Mayfull团队基于Hugging Face LeRobot框架创建,旨在为Franka FR3机械臂的轴孔装配(peg-in-hole)任务提供标准化训练基准。该数据集依托Isaac Sim仿真环境生成,涵盖44个演示片段、4600帧视觉-状态-动作序列,融合了多视角视觉输入(第三视角双相机与腕部相机)与23维状态信息,为模仿学习和强化学习算法提供了密集、对齐的多模态监督信号。其发布顺应了机器人学习社区对可复现、可扩展数据资产的需求,尤其为操作技能从仿真到实体部署的迁移研究奠定了数据基础,对推动数据驱动的机器人操作范式具有积极意义。
当前挑战
该数据集所应对的领域挑战在于轴孔插入这一精密操作任务,其涉及毫米级空间对齐、接触状态突变及力位耦合控制等难题,对感知精度和控制鲁棒性提出极高要求,如何从有限示教中泛化至不同初始条件和环境扰动仍具挑战性。在数据构建层面,采用纯仿真数据不可避免地引入Sim-to-Real差距,虽借助Isaac Sim提升了采集效率,但物理引擎的真实性限制和领域随机化策略的不足可能降低策略迁移成功率。此外,当前规模(44个片段)相对有限,难以覆盖复杂任务的全状态空间,且单一任务设定限制了多任务学习与组合泛化能力,整合高维视觉特征与低频控制信号亦需精细的数据处理与特征对齐。
常用场景
经典使用场景
该数据集专为机器人操作技能学习的研究而构建,聚焦于Franka FR3机械臂在Isaac Sim仿真环境中的薄板插槽任务(peg-in-slot)。其经典使用场景在于训练和评估模仿学习算法,特别是基于视觉的端到端策略。数据集包含44个演示回合,采集了第三人称视角、腕部相机等多视角视觉信息,以及完整的机器人状态和动作序列,为学习精细操作中的视觉-运动控制映射提供了高质量的训练样本。研究者常利用该数据集开展行为克隆、扩散策略等方法的基准测试,以验证算法在仿真到真实迁移中的鲁棒性。
解决学术问题
该数据集解决了机器人学习领域中数据稀缺与仿真环境验证不足的学术难题。通过提供合成环境下的大规模、多模态演示数据,它支持了有关模仿学习泛化能力、多视角融合策略以及动态动作生成的研究。数据集中的状态特征包含了关节位置、末端执行器位姿和先前动作,为构建因果模型或状态表征学习提供了丰富信息。其公开可复现的特性促进了无模型控制方法的可比较性,推动了从仿真到现实(sim-to-real)转移的研究,具有重要的学术参考价值。
衍生相关工作
该数据集衍生了一系列相关研究工作,包括开发新型的模仿学习框架,如基于Transformer的动作分块方法,以及探索视觉预训练模型在低样本场景下的微调策略。同时,它也促进了仿真环境与真实机器人之间一致性评估的研究,例如提出域随机化技术以提升策略的迁移性能。在LeRobot社区中,该数据集常被用作评测基准,衍生出多种改进的机器人学习管线,如结合强化学习的混合方法等,进一步丰富了机器人操作技能学习的理论体系与实践工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务