遇见数据集

aShunSasaki/so101_pp_stationery_5obj_color_select_v2

收藏
Hugging Face2026-05-01 更新2026-05-03 收录
官方服务:

资源简介:

该数据集由LeRobot创建,主要用于机器人领域。数据集包含356个episodes,274615帧,5个任务。数据文件大小为100MB,视频文件大小为200MB,帧率为30fps。数据集包含动作、观测状态、图像等特征,其中动作和观测状态包括肩部、肘部、腕部和夹持器的位置信息,图像特征为720x1280分辨率的腕部摄像头视频。

This dataset was created using LeRobot and is primarily used in the robotics domain. The dataset contains 356 episodes, 274615 frames, and 5 tasks. The data file size is 100MB, the video file size is 200MB, and the frame rate is 30fps. The dataset includes features such as actions, observation states, and images, where actions and observation states include position information for the shoulder, elbow, wrist, and gripper, and image features are wrist camera videos with a resolution of 720x1280.

提供机构:
aShunSasaki
搜集汇总
数据集介绍
aShunSasaki/so101_pp_stationery_5obj_color_select_v2 数据集图片
构建方式
该数据集名为so101_pp_stationery_5obj_color_select_v2,专为机器人操作任务设计,利用LeRobot框架构建而成。数据采集自so_follower型机器人,在涉及五种文具对象的颜色选择场景中,通过遥操作方式记录机器人的动作序列与视觉观测。数据集包含356个完整回合(episode),共计274,615帧,以30帧/秒的采样率捕获。每个回合均保存了6维动作指令(涵盖肩部、肘部、腕部及夹爪的关节位置)与对应的机器人状态,同时通过腕部摄像头采集720×1280分辨率的高清视频流,编码为AV1格式。所有数据按1000帧为单位分块存储,其中动作与状态数据以Parquet格式组织,视频则以MP4格式独立保存,确保数据读取的高效性与可扩展性。
特点
本数据集的核心特色在于其聚焦于精细化的颜色选择操作任务,涵盖五种文具对象,为机器人视觉与运动控制的联合学习提供了高针对性的训练材料。数据规模适中,356个回合的重复演示为模仿学习或强化学习算法提供了充足的多样性。数据结构采用标准化格式,包含动作、状态、多模态视觉观测(腕部摄像头)及时间戳等关键字段,便于研究者直接接入LeRobot生态进行模型训练与评估。此外,数据集已预先划分为训练集(全部356个回合),无需额外分割,降低了使用门槛。视频与表格数据的分离存储策略,在保证高帧率图像质量的同时,优化了存储与加载效率,特别适用于需要处理长时间序列的机器人学习任务。
使用方法
使用此数据集时,研究者可借助LeRobot库及其配套工具链进行高效加载与预处理。首先,通过HuggingFace数据集加载接口直接读取Parquet文件与视频目录,自动对齐动作、状态与图像帧的时间序列。数据集支持按回合索引或任务类别筛选子集,便于针对特定颜色选择任务进行模型微调。在模型训练环节,可利用LeRobot提供的DataLoader将多模态数据(关节位置与视觉帧)打包为批次,输入至基于Transformer或CNN的策略网络(如ACT、Diffusion Policy等)。此外,数据集兼容常见的离线模仿学习与离线强化学习框架,使用者仅需标准化输入输出接口,即可评估策略在真实机器人上的泛化性能。可视化工具支持在线预览回合演示,辅助数据质量审查与任务理解。
背景与挑战
背景概述
在机器人学习领域,模仿学习已成为推动智能体从人类示范中获取复杂技能的重要手段。so101_pp_stationery_5obj_color_select_v2数据集由研究者在LeRobot框架下创建,旨在为机器人操作任务提供精细化的训练数据。该数据集聚焦于桌面文具的抓取与颜色选择任务,涵盖5种不同物品的356条演示轨迹,总帧数达274,615帧,以30帧/秒的高采样率记录。数据通过so_follower机器人采集,包含6维关节动作及状态信息,并配备1280×720分辨率的手腕摄像头视频,为多模态模仿学习提供了丰富资源。该数据集的出现填补了特定场景下精细操作数据稀缺的空白,对推动机器人从示范中学习物体识别与精准操控的研究具有重要意义。
当前挑战
当前数据集的挑战主要体现在两个方面:一是领域任务层面,机器人需在有限样本中学习颜色选择与物品分类的泛化能力,不同光照和背景下的视觉鲁棒性仍是难题,且动作空间的高维连续性要求模型具备精细控制能力。二是构建过程中,数据由单一机械臂在固定设置下采集,环境变化、抓取失败的轨迹可能未被充分包含,导致模型在部署时对未见过场景的适应性不足。此外,尽管包含多模态信息,但视频与状态数据的同步精度、以及人为操作的不一致性(如演示风格差异)都可能影响学习效果的稳定性,如何从有限的356条示范中提取通用策略仍是核心挑战。
常用场景
经典使用场景
so101_pp_stationery_5obj_color_select_v2数据集专为机器人精细操控与物品分拣任务而设计。在机器人学领域,该数据集收录了356个示范轨迹,涵盖五种不同颜色的文具对象,通过SO_Follower机械臂在30帧每秒的高频采样下,记录了完整的关节角度序列与腕部视觉图像。其经典应用场景在于训练模仿学习模型,使得机器人能够从人类演示中习得精准抓取与颜色筛选策略。数据集的结构化设计——包含动作、状态与第一人称视频的多模态对齐——为行为克隆、逆强化学习等算法的评估提供了标准化基准,尤其适合验证算法在多对象、多颜色场景下的泛化能力。
衍生相关工作
该数据集催生了一系列重要的交叉研究工作。基于其多任务特性,研究者构建了基于条件变分自编码器的多模态融合框架,在单一网络上实现针对不同颜色物品的灵活策略切换。另有工作利用该数据集测试数据高效的仿生学习算法(如隐式Q学习),探讨当示范数量减少时模型性能的保持程度。同时,数据集中腕部影像的周期性高清记录(720p@30fps)启发了动态场景理解的研究,相关团队以此为基准开发了轻量化视觉编码器,能够在保持推理速度的同时降低图像分辨率波动带来的策略抖动。这些衍生工作共同推动了从“任务特定编程”向“数据驱动自主操控”的范式转变。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操控领域中的精细化物体选择性抓取任务,通过so_follower机器人采集了356个回合、涵盖5种文具物体的颜色辨识与选择操作。在模仿学习与行为克隆的前沿研究中,该数据集为机器人提供了一种基于视觉反馈的多模态操控基准,尤其在高维动作空间(6自由度关节控制)与实时图像输入(1280x720高清腕部摄像头)的联合学习方面,促进了端到端机器人策略的泛化能力。当前,机器人灵巧操控与物体辨识的交叉研究备受关注,该数据集通过细化颜色维度下的目标选择任务,为探索环境自适应与抗干扰策略提供了关键支撑,对推动工业分拣与家庭服务机器人的技术落地具有直接意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务