遇见数据集

nikodembartnik/so101_pencil_holder_20260528_134851

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot工具创建。它包含来自机器人(类型为so_follower)的动作和观测数据,具体特征包括6维浮点型动作向量(对应肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、6维浮点型观测状态向量(与动作相同维度)、来自顶部和手腕摄像头的图像视频观测(分辨率480x640,3通道,30帧/秒),以及时间戳、帧索引、episode索引等元数据。数据集总共有50个episodes,17323帧,分块存储为Parquet格式,视频存储为MP4格式,适用于机器人学习和控制任务。

This dataset is a robotics control dataset created using the LeRobot tool. It contains action and observation data from a robot (type so_follower), with features including a 6-dimensional float32 action vector (for shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), a 6-dimensional float32 observation state vector (same dimensions as action), image video observations from top and wrist cameras (resolution 480x640, 3 channels, 30 fps), and metadata such as timestamp, frame index, episode index, etc. The dataset has a total of 50 episodes, 17323 frames, stored in chunks as Parquet files and videos as MP4 files, suitable for robotics learning and control tasks.

提供机构:
nikodembartnik
搜集汇总
数据集介绍
nikodembartnik/so101_pencil_holder_20260528_134851 数据集图片
构建方式
该数据集采用LeRobot框架构建,通过一台so_follower型机器人执行铅笔夹持任务,以30帧每秒的采样率同步记录机器人关节状态、动作指令及多视角视觉信息。数据采集过程中,机器人肩部、肘部、腕部及夹爪的6维空间位姿被精确保存为浮点型数值序列,同时顶部与腕部摄像头分别采集640×480像素的彩色视频流,经AV1编码压缩后以MP4格式存储。累计50段演示片段,包含17323帧有效数据,总数据量与视频体积分别约100MB和200MB,所有样本均被划分为训练集。
特点
该数据集的核心特色在于其多模态融合的精细结构,同时囊括了机器人6维连续动作空间与关节状态观测值,以及两个固定视角的实时视觉反馈。数据以标准化Parquet表格与压缩视频协同存储,支持高效索引与按需加载。50个完整演示片段构成单一任务场景,便于聚焦于铅笔夹持操作的轨迹学习与策略泛化研究。此外,数据集遵循Apache-2.0开源协议,并内置可视化工具,降低了机器人学习研究的复现门槛。
使用方法
用户可通过LeRobot库直接加载该数据集,利用其预定义的默认配置自动解析Parquet文件与视频流。数据结构包含'action'、'observation.state'、'observation.images.top'和'observation.images.wrist'等关键字段,支持以帧或片段为单位进行迭代。适用于模仿学习、行为克隆及端到端机器人控制策略的训练与评估。建议用户结合LeRobot提供的可视化功能预览演示片段,并依据'episode_index'和'frame_index'灵活切片数据,以适应不同模型框架的输入要求。
背景与挑战
背景概述
该数据集由研究者nikodembartnik于2026年5月28日创建,依托LeRobot框架构建,聚焦于机器人操作任务中的精细物体抓取与放置。其核心研究问题在于利用视觉-动作联合表征,使机械臂能够从单一视角的视觉观测中学习并执行高精度任务。数据集记录了50个操作片段,总帧数达17323帧,包含来自顶部与腕部两个视角的640×480分辨率视频流,以及机器人六个自由度的关节状态与动作信息。作为基于so_follower机器人的专用数据集,它填补了在桌面级精细操作场景下标准化训练数据的空白,为模仿学习与强化学习提供了可复现的基准,尤其推动了对小型物体(如笔筒)操作技能的研究进展。
当前挑战
本数据集所解决的领域挑战在于,机器人操作中的精细物体抓取(如从桌面拾取笔筒)要求模型同时处理高维视觉输入与连续动作空间,克服传统视觉伺服方法中因视角遮挡或物体形状不规则导致的失败。构建过程中,需同步记录多视角视频与关节状态,确保每帧时间戳严格对齐,这要求采集硬件与软件系统的高度协同。此外,仅有50个episodes的小规模数据对数据高效学习算法构成严峻考验,模型需在有限示范中提取泛化策略。视频编码采用AV1格式以平衡质量与存储,但高压缩比可能引入伪影,增大视觉特征提取的难度。数据集的单一任务设定也限制了其对多场景适应性的验证。
常用场景
经典使用场景
在机器人操作学习领域,so101_pencil_holder_20260528_134851数据集专为模仿学习与行为克隆研究而设计。该数据集记录了SO-100系列机械臂在执行铅笔放置任务时的完整运动轨迹,包含五十个示范回合、一万七千余帧高保真时序数据。通过同时采集肩部、肘部、腕部及夹爪的六维关节角度状态与俯视、腕部双视角视频流,为机器人学习精准抓取与放置动作提供了理想的多模态训练素材。研究者可基于此数据集训练端到端策略网络,使机械臂从人类示教中习得精细的操控技能。
解决学术问题
该数据集着力解决了机器人领域长期面临的精细操作技能迁移与泛化难题。传统的机器人编程依赖手工设计控制器,难以应对铅笔支架这类柔顺物体的夹持与定位任务。此数据集通过提供标准化、可复现的示教数据,使得研究者得以系统性地探索视觉-运动联合表征学习、时序动作分块生成等前沿议题。其公开的示范轨迹有力推动了基于模型的无模型强化学习与运动基元理论的交叉验证,为构建通用操作智能奠定了实证基础,并在数据驱动方法范式转换中扮演了关键角色。
衍生相关工作
围绕此数据集的公开属性,学界已衍生出一批具有典范意义的创新工作。基于LeRobot框架的开发者社区,利用其标准化的指标格式与视频流,陆续发布了多篇将扩散策略应用于细粒度操控的实证研究。其中,将Transformer架构与基于能量的生成模型相结合的工作,在该数据上验证了逆动力学模型在低维关节空间中的预测优势。同时,数据集的双视角影像也催生了跨模态特征对齐方法的研究,推动了视觉语言模型在感知-动作闭环系统中的深度融合探索,进一步拓展了机器人基础模型的训练范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务