遇见数据集

so101_pick_and_place_overhead_high

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

本数据集使用LeRobot工具创建,是一个面向机器人技术领域的演示数据集,核心内容为机器人执行拾取和放置任务的交互数据。数据集包含50个完整的episodes,总计16,622个时间步(帧),对应1个任务。数据以分块形式存储,总数据文件约100 MB,关联的视频文件约200 MB,视频帧率为30 fps。数据集仅包含训练集。每个数据样本包含多个结构化字段:动作(action)是一个5维浮点向量,表示机器人五个关节(肩部平移、肩部抬升、肘部弯曲、腕部弯曲、夹爪)的目标位置;观测(observation)包含两部分:状态(state)也是一个5维浮点向量,表示上述五个关节的当前实际位置;图像(images)包含两个固定视角的视频流:顶部(top)视角和侧面(side)视角,每个视频的分辨率均为640x480(宽x高),3通道(RGB),编码格式为AV1。此外,每个样本还包含时间戳(timestamp)、帧索引(frame_index)、episode索引(episode_index)、全局索引(index)和任务索引(task_index)。该数据集适用于机器人模仿学习、行为克隆、视觉运动策略学习等任务的研究与开发。

This dataset is created using the LeRobot tool and is a demonstration dataset for the field of robotics, focusing on interaction data for robot pick-and-place tasks. It contains 50 complete episodes, totaling 16,622 time steps (frames), corresponding to 1 task. The data is stored in chunks, with a total data file size of approximately 100 MB and associated video files of about 200 MB, with a video frame rate of 30 fps. The dataset only includes a training set. Each data sample includes multiple structured fields: action is a 5-dimensional floating-point vector representing the target positions of five robot joints (shoulder translation, shoulder lift, elbow bend, wrist bend, gripper); observation consists of two parts: state is also a 5-dimensional floating-point vector representing the current actual positions of the five joints; images include two fixed-view video streams: top view and side view, each with a resolution of 640x480 (width x height), 3 channels (RGB), encoded in AV1 format. Additionally, each sample contains a timestamp, frame index, episode index, global index, and task index. This dataset is suitable for research and development in tasks such as robot imitation learning, behavior cloning, and visual-motor policy learning.

创建时间:
2026-07-02
原始信息汇总

数据集概述

  • 数据集名称: so101_pick_and_place_overhead_high
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (robotics)
  • 标签: LeRobot

数据集结构

  • 总片段数: 50
  • 总帧数: 16622
  • 总任务数: 1
  • 帧率: 30 FPS
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB
  • 数据路径格式: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径格式: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 训练/测试划分: 所有50个片段用于训练

特征描述

  • 动作 (action): 包含5个自由度(肩部旋转、肩部升降、肘部弯曲、腕部弯曲、夹爪位置),数据类型为float32,形状为[5]
  • 观察状态 (observation.state): 与动作维度一致,包含同样的5个自由度,数据类型为float32,形状为[5]
  • 观察图像 (observation.images.top 和 side): 两个摄像头视角(顶部和侧面),分辨率均为480×640像素,3通道RGB,使用AV1编码,30 FPS,数据类型为视频
  • 时间戳 (timestamp): float32类型,形状[1]
  • 帧索引 (frame_index): int64类型,形状[1]
  • 片段索引 (episode_index): int64类型,形状[1]
  • 全局索引 (index): int64类型,形状[1]
  • 任务索引 (task_index): int64类型,形状[1]

机器人信息

  • 机器人类型: so_follower

引用

  • BibTeX: 暂无具体引用信息
搜集汇总
数据集介绍
so101_pick_and_place_overhead_high 数据集图片
构建方式
so101_pick_and_place_overhead_high数据集基于LeRobot框架构建,专为机器人抓取与放置任务设计。数据通过so_follower型机器人采集,共包含50个完整示教回合(episodes),总计16622帧图像与动作序列。数据以Parquet格式存储于分块文件中,每个分块容量为1000帧,同时配有对应的高清视频文件(AV1编码,30帧/秒),涵盖顶部与侧面两个摄像头视角,图像分辨率为480×640像素。所有样本均标注了5维动作指令(包括肩部旋转、臂部升降、肘部屈伸、腕部弯曲及夹爪开合)以及对应的机器人状态观测值,确保了行为克隆或模仿学习任务的训练需求。
特点
该数据集最显著的特征在于其多模态融合与标准化设计。首先,视觉信息与运动控制信号高度同步,顶部和侧面双摄像头视角提供了丰富的空间感知信息,便于算法学习三维环境中的抓取策略。其次,动作空间与状态空间均采用统一的5维笛卡尔坐标命名体系(如shoulder_pan.pos),结构简洁清晰,便于直接嵌入各种机器人学习框架。此外,数据按回合与时间戳严格索引,并附带帧索引与任务索引,支持灵活的轨迹分割与回放分析。全部数据均遵循Apache-2.0开源协议,确保了学术与工业场景下的可复现性与扩展性。
使用方法
使用本数据集时,推荐通过LeRobot库进行加载与预处理。用户可调用LeRobot的dataset API直接读取Parquet文件与关联视频,自动对齐视觉观测和动作标签。数据集已预定义训练集(0至49号回合),支持一键划分为训练与验证子集。对于机器人学习研究,可将5维动作向量作为策略网络输出,以顶部与侧面图像拼接或独立输入作为观测状态,构建端到端的抓取策略模型。同时,数据中的时间戳信息可用于时序建模,例如结合Transformer或LSTM网络捕捉长程动作依赖。可视化工具也集成在HuggingFace Spaces中,方便研究人员快速预览示例轨迹。
背景与挑战
背景概述
so101_pick_and_place_overhead_high数据集由研究者RICK-Y-KCIR基于LeRobot框架创建,专为机器人操作任务设计,聚焦于“高位置抓取与放置”这一子任务。该数据集包含50个演示片段,共计16622帧,通过模拟环境采集,以5维动作空间(肩关节、肘关节、腕关节及夹爪)和两个视角的视觉观测(顶部与侧方,640×480分辨率,30帧/秒)构成。作为机器人学习领域的数据基础,它旨在推动模仿学习与策略泛化研究,尤其在精细化操作场景中提供标准化的训练与评估平台。尽管尚未发布相关论文,但其结构化设计(如parquet格式与视频存储)已为开源社区提供便捷接口,有望促进低成本机器人操作技能的研究与应用。
当前挑战
该数据集所应对的领域挑战集中于高精度物体抓取与放置操作中的空间感知与运动规划问题,尤其需解决在有限观测信息下(双视角图像)处理遮挡、物体尺寸变化及夹爪定位误差等难题。在构建过程中,核心挑战包括:1)数据采集的效率与一致性,单任务50个演示可能不足以覆盖复杂场景的多样性;2)动作空间与状态空间的冗余设计(均为5维),可能引入噪声或导致策略学习过拟合;3)视频编码采用AV1格式,虽压缩率高但解码复杂度大,可能增加后续训练与推理的计算开销。此外,缺乏多任务配置与迁移学习支撑,限制了模型在同类操作任务中的泛化能力。
常用场景
经典使用场景
在机器人操作领域,so101_pick_and_place_overhead_high数据集为从视觉观测到动作执行的端到端学习提供了标准化基准。该数据集聚焦于机械臂在俯视高位视角下的抓取与放置任务,包含50个演示片段、逾1.6万帧时序数据,同步记录了五自由度关节动作指令与高位、侧位双视角彩色视频。研究者可借此训练模仿学习模型,使机器人通过观察人类遥操作演示,习得从图像输入到精确动作映射的策略。其结构化的parquet格式与视频数据便于与LeRobot框架无缝集成,成为验证行为克隆、扩散策略等经典模仿学习算法的理想平台。
实际应用
在工业自动化与仓储物流场景中,该数据集模拟了高位排列物料的自动分拣与码垛操作。其采集的演示数据可直接用于训练机器人执行工厂流水线上从传送带抓取工件并放置在指定货架的标准化流程。由于数据集包含实时的关节角度反馈与多视角监控图像,它使得机器人能够适应光照变化、工件位姿偏移及部分遮挡等真实环境扰动。诸如电子元件装配、药品分装以及轻型零部件搬运等场景,均可借助该数据集训练的模型提升作业效率与定位精度,同时降低对固定编程的依赖,实现柔性生产线的快速部署。
衍生相关工作
该数据集衍生了一系列探索视听融合与多任务学习的开创性工作。基于其双视角图像与动作序列的对应关系,研究者发展了时空注意力机制下的视觉运动预测模型,并在LeRobot框架中贡献了多项扩展预训练技术。例如,将扩散策略在高位俯视场景中的失败案例迁移至侧视数据以构建鲁棒的闭环控制器,或通过数据增强生成对抗样本以提升策略对背景干扰的抵抗能力。此外,该数据集为评估不同机器人硬件平台上策略迁移的零样本泛化能力提供了参照基线,催生了跨本体动作表征学习的系列研究成果,推动了机器人基础模型的构建进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务