遇见数据集

ant0nh/pnp_banana_25_20260529_034842

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人数据集,使用LeRobot创建,包含25个episodes,总计18700帧,帧率为30fps。数据特征包括动作(6个关节位置:肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观测状态(与动作相同的6个关节位置)、两个摄像头图像观测(手腕和前端摄像头,均为480x640分辨率、3通道的RGB视频,编码为av1,无音频),以及时间戳、帧索引、episode索引、索引和任务索引等元数据。机器人类型为so_follower,数据以parquet文件和mp4视频格式存储,总大小约300MB(数据文件100MB,视频文件200MB),用于训练任务。

This dataset is a robotics dataset created using LeRobot, containing 25 episodes with a total of 18,700 frames at 30 fps. Features include actions (6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), observation states (same 6 joint positions as actions), two camera image observations (wrist and front cameras, both 480x640 resolution, 3-channel RGB videos encoded in av1, without audio), and metadata such as timestamp, frame index, episode index, index, and task index. The robot type is so_follower, and data is stored in parquet files and mp4 videos, with a total size of approximately 300MB (100MB for data files and 200MB for video files), intended for training tasks.

提供机构:
ant0nh
搜集汇总
数据集介绍
ant0nh/pnp_banana_25_20260529_034842 数据集图片
构建方式
该数据集名为pnp_banana_25_20260529_034842,是面向机器人操作任务的高质量数据集,基于LeRobot框架构建。数据集包含25个演示片段,共计18700帧,采集频率为30帧每秒,单次任务聚焦于机器人抓取与放置香蕉的操作。数据通过控制so_follower型机器人,记录其6维关节动作(包括肩部、肘部、腕部及夹爪位置)及对应观测状态,同时采集腕部与前方两个视角的640×480分辨率彩色视频流,使用AV1编码压缩,既保留了丰富的视觉信息又兼顾了存储效率。
特点
本数据集最显著的特点在于其多模态融合设计:包含高精度动作序列、本体感知状态及双视角视觉观察,为模仿学习与行为克隆研究提供了同步且结构化的数据。所有特征均以float32或int64格式存储,便于直接用于深度学习模型的训练与评估。此外,数据集已按80%训练比例预划分,免去用户重新分割的繁琐。其简洁的任务设定与较小的数据规模(约300MB)降低了验证机器人学习算法的门槛,适合快速迭代与原型测试。
使用方法
用户可通过HuggingFace的datasets库或LeRobot工具包直接加载该数据集。推荐使用LeRobot内置的可视化界面在线浏览视频与动作轨迹,亦可离线将parquet文件与视频文件按chunk索引路径读取,构建PyTorch或TensorFlow的DataLoader。训练时,利用'observation.state'和'observation.images'作为输入,以'action'为预测目标,即可开展策略学习。由于数据集遵循Apache-2.0协议,使用者可自由修改、复制与分发,极大便利了学术研究与工业复现。
背景与挑战
背景概述
在机器人学习领域,模仿学习因其能够从人类演示中高效获取复杂技能而备受关注。基于LeRobot框架构建的pnp_banana_25_20260529_034842数据集诞生于近年,由Hugging Face社区的研究人员主导开发,旨在为机器人抓取与放置任务提供标准化训练资源。该数据集聚焦于So-Follower机械臂对香蕉的拾取与放置操作,共收录25个演示片段,总计18700帧视频,包含腕部与前方双视角RGB图像(640×480分辨率,30 FPS)以及6维关节空间状态与动作信号。作为开源平台上的机器人数据集,它推动了模仿学习算法的可复现性研究,为动态抓取策略的验证提供了基准,尤其在物体非刚性变形场景下具有重要参考价值。
当前挑战
该数据集所应对的核心领域挑战在于解决机器人对软体物体(如香蕉)的精细操作问题,这类物体在抓取过程中易发生形变,传统刚性抓取策略难以适应,需算法具备视觉-运动协调的鲁棒性。构建过程中面临的挑战包括:数据采集需依赖遥操作或示教器精确记录人类演示动作,以高帧率同步多视角图像与关节状态,确保运动轨迹的平滑性;同时,数据集限制了单任务(抓取香蕉)且首尾位姿固定,使得模型泛化至不同摆放位置、光照条件或替代物体时面临分布外迁移瓶颈。此外,仅25个演示片段的数据规模对算法样本效率提出了严苛考验,易引发过拟合,削弱其在真实场景中的适用性。
常用场景
经典使用场景
在机器人操作与模仿学习领域,pnp_banana_25_20260529_034842数据集专为抓取与放置任务设计,收录了25个完整操作片段,包含18700帧高精度运动轨迹与同步视觉观测。其经典使用场景聚焦于学习从视觉输入到关节控制的端到端映射,研究人员借助腕部与前部双视角图像序列,结合六自由度机械臂的联合状态数据,训练策略网络完成香蕉的自主拾取与定点放置。该数据集以30帧每秒的采样频率捕捉动态操作过程,为行为克隆、逆强化学习等方法提供了高保真的示范素材,是验证机器人技能泛化能力的基准资源。
解决学术问题
该数据集着力破解机器人领域中长期存在的少样本模仿学习与跨实例迁移难题。通过提供结构化的动作-状态-图像三元组,它使学者能够探究视觉运动策略在有限示范条件下的表征效率与鲁棒性。具体而言,研究者可基于此数据集分析行为克隆中常见的分布偏移现象,或测试逆动力学模型在未见初始位姿下的补偿能力。其意义在于,通过标准化可重复的实验配置,推动了将实验室级的抓取范式向真实生产场景迁移的理论进展,为构建零样本适应的通用操作框架奠定了数据基石。
衍生相关工作
围绕该数据集衍生的经典工作主要集中于多模态融合策略与数据高效学习算法。研究者以此为基础开发了结合空间注意力机制的动作预测器,通过在腕部与全局视角间建立动态权重分配,显著提升了复杂背景下的目标定位精度。另有一系列工作引入时序对比学习框架,利用数据集的连续帧序列提取无监督的运动原语表征,进而减少对密集标注的依赖。此外,基于该数据压缩格式(如AV1编码与Parquet存储)的高效加载方案被提出,使得大规模离线强化学习在消费级硬件上成为可能,推动了开放协作式机器人研究的生态建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务