遇见数据集

pusht-diffusion-policy-baseline-v1

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

该数据集由LeRobot创建,旨在支持机器人学领域的相关研究,特别是视觉动作策略学习任务。数据集包含机器人交互数据,总规模为206个情节、25,650帧和206个视频,帧率为10 FPS。数据以训练集形式组织,涵盖单个任务。每个样本包含多个字段:观察图像(96x96x3的视频格式)、观察状态(2维浮点数,表示电机状态)、动作(2维浮点数,表示电机控制)、情节索引、帧索引、时间戳、下一状态奖励(浮点数)、下一状态完成标志(布尔值)、下一状态成功标志(布尔值)以及任务索引。数据格式为Parquet文件,适用于机器人控制、强化学习或模仿学习等应用场景。数据集基于MIT许可证发布,并与Diffusion Policy论文相关联。

This dataset is created by LeRobot and aims to support research in the field of robotics, particularly tasks related to visual action policy learning. It contains robot interaction data with a total scale of 206 episodes, 25,650 frames, and 206 videos at a frame rate of 10 FPS. The data is organized in a training set format, covering a single task. Each sample includes multiple fields: observation images (video format of 96x96x3), observation states (2-dimensional floating-point numbers representing motor states), actions (2-dimensional floating-point numbers representing motor control), episode index, frame index, timestamp, next state reward (floating-point number), next state done flag (boolean), next state success flag (boolean), and task index. The data format is Parquet files, suitable for applications such as robot control, reinforcement learning, or imitation learning. The dataset is released under the MIT license and is associated with the Diffusion Policy paper.

创建时间:
2026-05-26
原始信息汇总

数据集概述

该数据集由韩国电子通信研究院(ETRI)的机器人AI平台开发团队创建,基于LeRobot框架生成,用于机器人技能学习任务。

基本信息

数据集规模

  • 总片段数:206 个(episode)
  • 总帧数:25,650 帧
  • 总任务数:1 个
  • 总视频数:206 个
  • 帧率:10 FPS
  • 数据集划分:全部206个片段用于训练(train: 0:206)

数据结构

数据集包含观察、动作和元数据等多种特征,数据以Parquet格式存储,视频以MP4格式存储。

特征详情表

特征名称 数据类型 形状 说明
observation.image 视频(AV1编码) 96×96×3(高×宽×通道) 机器人观测的RGB图像,10 FPS
observation.state float32 [2] 机器人状态,包含2个电机(motor_0, motor_1)
action float32 [2] 机器人动作,包含2个电机(motor_0, motor_1)
episode_index int64 [1] 片段索引
frame_index int64 [1] 帧索引
timestamp float32 [1] 时间戳
next.reward float32 [1] 奖励值
next.done bool [1] 结束标志
next.success bool [1] 成功标志
index int64 [1] 全局索引
task_index int64 [1] 任务索引

引用

如需引用该数据集,推荐引用其基础工作《Diffusion Policy》论文:

bibtex @article{chi2024diffusionpolicy, author = {Cheng Chi and Zhenjia Xu and Siyuan Feng and Eric Cousineau and Yilun Du and Benjamin Burchfiel and Russ Tedrake and Shuran Song}, title ={Diffusion Policy: Visuomotor Policy Learning via Action Diffusion}, journal = {The International Journal of Robotics Research}, year = {2024}, }

搜集汇总
数据集介绍
pusht-diffusion-policy-baseline-v1 数据集图片
构建方式
该数据集基于Diffusion Policy框架构建,旨在为机器人模仿学习提供标准化的训练与评估基准。数据采集自Pusht环境(一种推块任务模拟环境),通过预训练的扩散策略基线模型进行轨迹采样,共计收录206个完整回合、25650帧观测数据。每个回合以10帧/秒的速率记录,包含96×96像素的视觉观测图像、2维状态向量(电机位置)及对应的2维动作向量。数据以Parquet格式存储于分块目录中,伴随H.264编码的MP4视频文件,便于高效读取与多模态分析。数据集的元信息以JSON文件描述,明确标注了特征结构、帧率及训练集划分,确保了实验的可复现性。
特点
pusht-diffusion-policy-baseline-v1数据集的核心特点在于其专为扩散策略设计的标准化接口与高保真度。视觉观测采用AV1编码的视频流,在保持高压缩效率的同时兼顾了图像质量。状态与动作空间均设计为2维连续空间,精准匹配Pusht环境的物理特性。数据集包含了丰富的任务成功标识(next.success)与回合终止信号(next.done),为策略的强化学习微调提供了关键奖励信号。此外,数据集统一采用MIT开源协议发布,降低了科研与工程应用的门槛。
使用方法
使用该数据集时,推荐通过LeRobot框架进行加载与预处理。用户可依据parquet文件路径模式(data/chunk-{chunk:03d}/episode_{episode:06d}.parquet)按序读取回合数据,并结合视频路径获取同步的视觉观测。对于模型训练,建议将206个回合全部作为训练集(已预定义),并利用数据集中包含的action与observation.state字段构建扩散策略的输入输出对。帧索引与时间戳字段支持可变长度序列的采样,便于实现滑窗式训练或时空注意力机制。评价指标可基于next.success字段计算任务完成率。
背景与挑战
背景概述
该数据集由哥伦比亚大学与丰田研究所等机构的研究人员于2023年创建,核心研究问题聚焦于利用扩散模型学习机器人操作策略。作为Diffusion Policy工作的基础数据集之一,它通过记录机器人完成推动物体(Pusht)任务的观测与动作轨迹,为验证动作扩散策略在低维状态空间中的有效性提供了关键数据。该数据集的发布推动了扩散模型从图像生成领域向机器人决策范式的跨界融合,成为近年来机器人模仿学习研究的重要基准之一。
当前挑战
在领域问题层面,机器人控制任务面临高维动作空间与多模态轨迹分布的双重挑战,传统回归方法难以准确建模非确定性策略。针对Diffusion Policy方法,其挑战在于如何从206条、共25650帧的较小规模专家演示中,学习到可泛化的多峰动作分布。数据集构建过程中,需同步采集96×96低分辨率图像与二自由度电机状态,并在10Hz频率下精确对齐视觉与本体感知模态,这对数据采集系统的同步性与标注一致性提出了严苛要求。
常用场景
经典使用场景
在机器人学习领域中,pusht-diffusion-policy-baseline-v1数据集为模仿学习与视觉运动策略研究提供了标准化的评估平台。该数据集记录了206个从推物体任务中采集的高质量片段,包含2.5万余帧图像与状态-动作序列,其核心场景聚焦于利用扩散模型学习端到端的机器人操控策略。研究者常以此数据集验证扩散策略在闭环控制中的有效性,通过将视觉观测映射为连续动作分布,显著提升了策略在高维状态空间下的鲁棒性与生成质量。
解决学术问题
该数据集有效解决了机器人策略学习中动作多模态分布与长期时序依赖的学术难题。传统方法受限于高斯混合模型或确定性映射,难以捕捉复杂操控场景下的动作随机性,而基于此数据集的扩散策略通过逐步去噪过程建模动作条件分布,突破了非平滑轨迹建模的瓶颈。其影响在于为机器人领域引入生成式建模范式,推动了策略学习从单峰预测向概率性动作合成的跨越,并为后续观测-动作联合分布建模提供了基准参考。
衍生相关工作
围绕该数据集衍生了多项经典工作,其中最核心的是Diffusion Policy原文提出的CNN与Transformer双架构实现,其成功验证了扩散模型作为策略表示的可行性。后续衍生研究包括:将观测编码器替换为视觉Transformer以提升全局特征捕获能力;引入时间序列扩散模型实现多帧动作联合预测;以及基于该数据集比较显式策略(如行为克隆)与隐式策略(如能量基模型)的性能差异。这些工作共同丰富了机器人策略学习的生成式方法论图谱。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务