遇见数据集

pusht

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

该数据集基于Diffusion Policy论文(Chi et al., 2024)创建,使用LeRobot框架进行数据收集与处理,采用MIT协议开源。数据集包含206个示范片段(episodes),共25650帧,帧率为10fps,所有片段属于同一任务。数据以parquet和mp4格式存储,其中视频分辨率为96x96像素,采用AV1编码。特征字段包括:视觉观测(observation.image,视频模态)、机器人状态(observation.state,包含两个电机的位置/状态)、动作(action,两个电机的控制指令)、时间戳、帧索引、完成标志、奖励、成功标志等。该数据集适用于机器人模仿学习、行为克隆、扩散策略等任务,特别是基于视觉和状态输入的机器人控制策略训练。

This dataset is created based on the Diffusion Policy paper (Chi et al., 2024), using the LeRobot framework for data collection and processing, open-sourced under the MIT license. It contains 206 demonstration episodes, totaling 25650 frames at 10fps, all belonging to the same task. Data is stored in parquet and mp4 formats, with video resolution of 96x96 pixels using AV1 codec. Feature fields include visual observation (observation.image, video modality), robot state (observation.state, containing positions/states of two motors), action (action, control commands for two motors), timestamps, frame indices, completion flags, rewards, success flags, etc. The dataset is suitable for robot imitation learning, behavior cloning, diffusion policy, and other tasks, especially for robot control policy training based on visual and state inputs.

创建时间:
2026-08-14
原始信息汇总

数据集概述:live9080/pusht

  • 数据集名称:pusht
  • 许可证:MIT
  • 任务类别:机器人学(robotics)
  • 标签:LeRobot
  • 首页:https://diffusion-policy.cs.columbia.edu/
  • 论文:https://arxiv.org/abs/2303.04137v5

数据集结构

  • 总片段数:206
  • 总帧数:25,650
  • 总任务数:1
  • 总视频数:206
  • 总块数:1(每块包含1000个片段)
  • 帧率:10 FPS
  • 划分:仅包含训练集(片段0至205)

数据特征

  • observation.image:视频类型,形状为96×96×3(高度×宽度×通道),编码为AV1,像素格式yuv420p,无音频
  • observation.state:浮点型,形状为[2],对应两个电机(motor_0、motor_1)
  • action:浮点型,形状为[2],对应两个电机(motor_0、motor_1)
  • episode_indexframe_indextimestampindextask_index:整型或浮点型,形状均为[1]
  • next.rewardnext.donenext.success:分别表示奖励(浮点型)、完成状态(布尔型)和成功状态(布尔型)

数据路径

  • 数据文件data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet
  • 视频文件videos/chunk-{episode_chunk:03d}/{video_key}/episode_{episode_index:06d}.mp4

引用

该数据集基于 Diffusion Policy 论文,引用格式如下:

bibtex @article{chi2024diffusionpolicy, author = {Cheng Chi and Zhenjia Xu and Siyuan Feng and Eric Cousineau and Yilun Du and Benjamin Burchfiel and Russ Tedrake and Shuran Song}, title = {Diffusion Policy: Visuomotor Policy Learning via Action Diffusion}, journal = {The International Journal of Robotics Research}, year = {2024}, }

搜集汇总
数据集介绍
pusht 数据集图片
构建方式
pusht数据集是基于LeRobot框架构建的机器人操作任务数据集,源自哥伦比亚大学发布的Diffusion Policy项目。该数据集包含206个演示片段,共计25,650帧,以10Hz的频率采样,记录了机器人在推挤任务中的状态与动作信息。数据集的观测数据包括96x96像素的RGB图像和二维电机状态向量,动作数据同样为二维向量,对应两个电机的控制指令。所有数据以Parquet格式存储,并伴随MP4格式的视频记录,便于多模态学习与验证。
使用方法
使用pusht数据集时,研究者可借助LeRobot库的API加载数据,并通过数据集提供的split划分训练集和验证集。该数据集可直接用于训练视觉运动策略,如Diffusion Policy,通过在观测图像和状态上学习动作分布,实现从像素到控制的端到端映射。同时,数据集中的成功标志(success)和奖励信号(reward)可用于评估策略性能或进行回报预测。建议结合官方代码库中的示例脚本,快速复现实验或进行算法改进。
背景与挑战
背景概述
Pusht数据集由哥伦比亚大学和丰田研究院的研究人员于2023年创建,作为扩散策略(Diffusion Policy)研究的核心基准,该策略通过动作扩散模型学习视觉运动策略,论文发表于《The International Journal of Robotics Research》。该数据集聚焦于机器人推杆操作任务,包含206个演示片段,共25,650帧,记录了两自由度的推杆动作,任务目标是将物体推至指定位置。Pusht在机器人学习领域具有重要影响力,为评估和比较不同动作生成方法提供了标准化的测试平台,推动了视觉运动策略的发展。
当前挑战
该数据集面临的挑战包括:一,领域问题层面,在机器人操作中,动作生成需应对高维连续空间和动态不确定性,传统方法难以准确预测未来动作序列;二,构建过程中,数据采集面临演示质量与多样性的平衡,需确保覆盖各种初始状态和路径,同时保持任务目标的一致性;此外,数据集仅含单一任务和少量演示,对策略的泛化能力构成挑战,需借助扩散模型等先进方法来有效利用有限数据,并处理视觉观测中的噪音和状态估计误差。
常用场景
经典使用场景
Pusht数据集源自哥伦比亚大学扩散策略项目,专注于机器人操作任务中的推挤操作(pushing)。该数据集包含206个专家演示片段,每个片段以10Hz频率记录96x96像素的视觉观测、双电机状态及对应的控制指令,为模仿学习和强化学习社区提供了标准化的基准环境。其经典应用在于评估视觉运动策略的泛化性能,尤其是在非结构化接触任务中,如将物体推至目标位置,这要求策略能够从高维图像输入中提取关键状态特征并生成平滑的动作序列。
解决学术问题
该数据集解决了视觉运动策略学习中动作生成的多模态分布建模难题。传统行为克隆方法常因动作分布的不确定性而失效,而Pusht数据集凭借其精确的状态注释和多样化的演示轨迹,为验证扩散概率模型在策略学习中的有效性提供了基准。它推动了从确定性回归到生成式策略的范式转变,使研究者能够系统研究动作序列的生成质量、时序一致性和多峰分布的拟合能力,从而显著提升了策略在实时控制中的鲁棒性和适应性。
实际应用
在实际应用中,Pusht数据集被广泛用于机器人操作系统的原型验证和算法调试。由于其模拟环境轻量且可重复,研究者和工程师可快速迭代策略模型,并通过统一的数据格式(如LeRobot标准)无缝迁移至实体机器人。该数据集已成为评估端到端学习框架(如扩散策略及其变体)的首选测试平台,推动了从仿真到现实迁移的研究,尤其在需要精细接触力控制的工业装配、物流分拣等场景中产生了深远影响。
数据集最近研究
最新研究方向
在具身智能与机器人操作学习的前沿领域,pusht数据集作为扩散策略(Diffusion Policy)研究的基准,正引领着从传统模仿学习向生成式动作建模的范式转变。该数据集通过高频采集的二维推杆控制任务,为多模态感知与动作序列的联合分布学习提供了高保真训练样本。当前研究热点聚焦于利用扩散模型强大的分布建模能力,实现复杂接触操作的鲁棒策略学习,并探索其在零样本泛化、多任务迁移及实时控制中的潜力。随着LeRobot等开源框架的普及,pusht数据集正成为评估新一代视觉-运动策略(如基于Transformer的动作生成、能量模型及世界模型)的标准测试平台,其对推动机器人操作的精确性、安全性与适应性研究具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务