遇见数据集

zixinyenu/so100-pick-and-place-60_20260527_214159

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,专门用于拾取和放置任务,包含20个完整的情节(episodes),总计9892帧数据。数据通过LeRobot平台创建,使用so_follower类型机器人收集。数据集包括动作数据(如关节位置:肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观察状态(与动作相同的关节位置)以及来自三个摄像头的图像观察(每个摄像头分辨率为480x640,3通道彩色视频,帧率30fps,使用AV1编解码器)。数据以parquet格式存储,总数据文件大小为100MB,视频文件大小为200MB。数据集结构支持训练分割(所有20个情节用于训练),适用于机器人学习和控制研究。

This dataset is a robotics manipulation dataset specifically for pick-and-place tasks, containing 20 complete episodes with a total of 9892 frames. It was created using the LeRobot platform with a so_follower type robot. The dataset includes action data (e.g., joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper position), observation states (same joint positions as actions), and image observations from three cameras (each with 480x640 resolution, 3-channel color video, 30fps frame rate, using AV1 codec). Data is stored in parquet format, with a total data file size of 100MB and video file size of 200MB. The dataset structure supports a training split (all 20 episodes for training), making it suitable for robotics learning and control research.

提供机构:
zixinyenu
搜集汇总
数据集介绍
zixinyenu/so100-pick-and-place-60_20260527_214159 数据集图片
构建方式
在机器人学习领域,高质量的数据集是推动技能习得与泛化的基石。so100-pick-and-place-60_20260527_214159数据集依托LeRobot框架构建而成,专注于一个经典的机器人操作任务——拾取与放置。该数据集通过远程操控SO100机器人的从动臂收集了20个演示回合,共计9892帧时序数据,涵盖了机器人从初始状态到完成物体搬运的完整动作序列。每一帧均记录了包含6个自由度的关节位置指令作为动作标签,并同步保存了对应时刻的机器人状态信息,为模仿学习提供了精准的“状态-动作”配对样本。
特点
该数据集最显著的特征在于其多模态的精细感知与结构化组织。除了高精度的机器人关节状态序列,它还集成了来自三个不同视角的摄像头图像流,每个摄像头以640x480像素分辨率、每秒30帧的速率录制,并采用高效的AV1编码压缩。这种多视角视觉输入为算法理解三维空间操作提供了丰富冗余信息。数据以标准的Parquet格式存储,并按照episode和chunk进行索引化分割,便于检索与流式加载。此外,所有20个演示均被统一分配至训练集,确保模型能够充分学习单一任务下的操作策略。
使用方法
研究者可借助LeRobot生态库轻松加载此数据集进行模型训练。通过指定数据集路径并调用LeRobot的API,能够直接将Parquet文件中的动作、状态及索引字段映射为PyTorch或TensorFlow兼容的tensor对象。压缩后的视频文件会在迭代时实时解码为图像数组,与状态数据保持帧级同步。建议将全部20个episode用于监督学习或离线强化学习中的策略优化,例如训练一个基于视觉的逆动力学模型。完成训练后,模型可直接在SO100机器人硬件上进行零样本部署测试,或利用LeRobot的评估基准进行性能比较。
背景与挑战
背景概述
so100-pick-and-place-60_20260527_214159数据集由Hugging Face团队基于LeRobot框架于2026年5月创建,聚焦于机器人抓取与放置任务。该数据集通过SO-100型号从动臂记录20个演示片段,包含9892帧多视角视觉信息与6维关节动作序列,旨在为模仿学习提供标准化的训练样本。作为开源机器人数据集代表性案例,其多模态数据结构和Apache-2.0许可协议降低了研究门槛,推动了机器人操作技能从实验室环境向真实场景的迁移学习发展。
当前挑战
数据集面临的核心挑战在于解决机器人精密操作任务中动作复现的准确性问题。具体而言,抓取放置任务要求模型理解物体形状、摩擦系数与空间约束,而当前数据仅涵盖单一任务类型,泛化能力有限。构建过程中需协调三个摄像头在不同光照下的画面同步,并确保30帧率下6自由度关节状态数据与视觉流的时间对齐,20个演示片段在100MB数据量级下难以覆盖复杂物体干扰与夹具磨损等实际工况,这对数据增强策略和仿真迁移技术提出更高要求。
常用场景
经典使用场景
在机器人学习与模仿学习领域,数据集so100-pick-and-place-60_20260527_214159专为抓取与放置任务设计,记录了单自由度机器人so_follower在60组演示中,通过六维关节空间动作(肩部、肘部、腕部等)完成目标抓取的完整轨迹。每帧数据同步采集三路640×480分辨率的视觉观测图像,形成多模态时间序列,为端到端策略学习提供了理想的训练基准。该数据集最典型的用法是作为行为克隆(Behavioral Cloning)的示范库,研究者可直接利用其高帧率(30fps)的action-state配对信息,训练基于视觉输入的机器人控制策略,使模型学会从原始图像和关节状态映射到精确的执行动作。
解决学术问题
该数据集精准解决了机器人模仿学习中数据稀缺与多模态融合的学术难题。传统机器人演示数据往往仅包含单一视角或稀疏采样,而本数据集通过三视角视频覆盖与高频(30fps)动作记录,攻克了视觉-运动耦合的细粒度建模问题。研究者可借此深入探讨跨模态对齐——如何使模型从不同角度的视觉特征中提取稳定几何线索,并关联至连续动作空间中的冗余解耦。此外,20个完整episodes的标准化分割支持了少样本泛化能力的量化评估,推动领域从固定场景抓取向动态环境适应性的理论突破,其Apache-2.0许可更降低了学术复现的门槛。
衍生相关工作
基于so100-pick-and-place数据集,学术界已衍生出多项里程碑式工作。其一,利用其高精度动作标签,研究者开发了基于潜在扩散模型的策略生成架构,能够从单帧图像解码完整运动序列。其二,该数据集被用于验证视觉-语言模型在机器人任务中的可迁移性,通过将三视角观察输入多模态大模型,实现了零样本抓取指令理解。此外,其标准化的episode结构促进了动作表征学习的研究——通过对比学习(Contrastive Learning)提取关节空间与视觉特征间的共享隐变量,显著提升了跨场景泛化能力。这些衍生工作不仅验证了数据集的信效度,更推动了机器人基础模型(Robot Foundation Models)的范式革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务