遇见数据集

Lieutenantpangolin/so101_pick_white_box

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人任务的数据集,具体针对SO Follower类型的机器人。数据集包含2个完整的情节(episodes),总计1796帧数据,涵盖1个任务。数据以Parquet文件格式存储,总数据文件大小为100MB,视频文件大小为200MB,帧率为30fps。数据集的特征包括机器人的动作(如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观测状态(与动作相同的关节位置)、来自前置摄像头的图像观测(分辨率为480x640,3通道彩色视频)、时间戳、帧索引、情节索引、索引和任务索引。该数据集适用于机器人控制、强化学习或计算机视觉任务的研究和开发。

This dataset is designed for robotics tasks, specifically for the SO Follower robot type. It contains 2 complete episodes with a total of 1796 frames, covering 1 task. The data is stored in Parquet format, with a total data file size of 100MB and video file size of 200MB, at a frame rate of 30fps. The dataset features include robot actions (such as shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), observation states (same joint positions as actions), image observations from a front camera (resolution 480x640, 3-channel color video), timestamps, frame indices, episode indices, indices, and task indices. It is suitable for research and development in robot control, reinforcement learning, or computer vision tasks.

提供机构:
Lieutenantpangolin
搜集汇总
数据集介绍
Lieutenantpangolin/so101_pick_white_box 数据集图片
构建方式
so101_pick_white_box数据集基于LeRobot框架构建,专为机器人操控任务设计。数据集通过真实机器人平台进行采集,记录了机械臂执行“拾取白色盒子”这一单一任务的完整过程。数据包含2个有效演示片段,共计1796帧,采集帧率为30帧/秒。每个片段均以parquet格式存储序列化的动作指令与观测状态,同时以AV1编码的视频文件记录前置摄像头视角下的视觉信息,确保原始数据的高保真度。所有数据按固定大小分块存储,便于高效加载与索引。
特点
该数据集具备鲜明的机器人操控研究特色。动作空间与观测状态空间维度一致,均为6维浮点向量,分别对应肩部回转、肩部升降、肘部屈伸、腕部屈伸、腕部旋转及夹爪位置,精准刻画了机械臂的运动学特性。视觉观测采用480x640分辨率的彩色图像,帧率与动作数据同步,为模仿学习与行为克隆算法提供了时空对齐的多模态输入。数据集虽规模精巧,但结构完整,涵盖时间戳、帧序号、片段索引等元信息,便于研究者进行序列建模与策略评估。
使用方法
本数据集适配LeRobot生态,可通过其提供的API轻松加载与可视化。用户仅需调用LeRobot库中的`load_dataset`函数,指定数据集路径与配置名称即可获取训练数据。数据集已默认划分训练集,包含全部2个演示片段。利用其提供的`features`定义,研究者可直接提取动作(action)、状态(observation.state)及图像(observation.images.front)作为模型输入。配合Hugging Face Spaces上的在线可视化工具,用户无需本地部署即可预览数据样本,显著降低了机器人学习研究的入门门槛。
背景与挑战
背景概述
在机器人操作领域,精细抓取与操纵任务始终是研究的核心挑战之一,尤其是在非结构化环境中对特定目标物的自主识别与抓取。so101_pick_white_box数据集由Lieutenantpangolin团队基于LeRobot框架创建,旨在为单任务机器人抓取提供标准化训练资源。该数据集聚焦于“拾取白色盒子”这一具体操作,记录了2个完整演示片段,共计1796帧,并提供了包含六自由度关节位置与夹爪状态的动作及观测数据。借助30Hz的高采样频率和前视摄像头(480×640分辨率)捕获的视觉信息,数据集为模仿学习与行为克隆算法提供了高质量的多模态输入。其发布顺应了机器人学习中数据驱动范式的潮流,为验证抓取策略在真实物理环境中的泛化能力奠定了基础。
当前挑战
该数据集所解决的领域挑战在于机器人从演示中学习精准抓取的高维控制难题,包括面对目标物位置变化、光照干扰及机械臂运动学冗余时,如何从有限的示教数据中提取鲁棒的动作映射关系。构建过程中则面临显著的技术障碍:首先,仅凭2个片段(100MB非视频数据与200MB视频数据)的规模难以覆盖环境的多样性,易导致过拟合;其次,数据采集依赖Lerobot框架的实时同步,需确保多种传感器(如关节编码器与摄像头)在30帧率下的精确对齐;最后,高质量演示的人工遥操作本身耗时费力,且不同操作者的示教风格差异可能引入噪声,影响策略的可复现性。
常用场景
经典使用场景
在机器人操作领域,so101_pick_white_box数据集专为模仿学习与行为克隆任务而设计,其核心使用场景聚焦于让机械臂学习从环境中拾取特定目标物体(白色盒子)的精细操作技能。借助LeRobot框架,该数据集提供了完整的示教轨迹,包含6自由度关节动作序列(如肩部、肘部、腕部等关节位置)以及前置摄像头采集的高清视觉观测(640×480分辨率,30帧/秒)。研究者可基于此构建端到端的神经网络模型,将原始视觉输入映射到连续动作空间,尤其在少样本学习设定下,通过2条完整示教轨迹(共计1796帧)验证模型对拾取任务的泛化能力与鲁棒性。
解决学术问题
该数据集精准回应了机器人领域长期存在的“数据稀缺与可复现性困境”。在学术研究中,许多操控任务依赖大规模人工示教数据,而so101_pick_white_box以轻量级形式(总数据量约100MB,视频200MB)提供了标准化基准,解决了不同实验室间由于硬件差异(如机械臂型号、传感器配置)导致的结果难以横向对比的问题。其意义在于推动了模仿学习在低数据预算下的可行性探索——通过仅2个回合的演示,研究者得以严谨地测试模型在小样本条件下的泛化能力,并为“如何从少量人类示教中提炼通用操作策略”这一核心学术命题提供了可复现的验证平台。
衍生相关工作
围绕so101_pick_white_box数据集,学术界衍生出若干重要研究方向与代表性工作。在数据增强方面,相关工作提出了基于扩散模型的轨迹插值方法,利用原始2条示教数据生成多样化拾取轨迹,有效缓解了小样本学习中动作分布覆盖不足的问题。在算法创新上,结合视觉-语言提示机制的模仿学习框架被提出,将“pick white box”这类自然语言指令与视觉特征融合,赋予机器人跨语义理解能力。此外,该数据集还催生了多任务联合训练基准,研究者将其与so101系列中其他拾取目标(如不同颜色、形状的物体)的数据组合,测试模型在物体属性泛化时的迁移表现,从而推动了通用操作策略库的构建与发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务