遇见数据集

IsaacSinn/makermods_lid_intocup

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot工具创建。数据集针对so101_follower机器人类型,包含10个完整的情节(episodes),总计3000帧数据,覆盖1个任务。数据以30fps的帧率采集,包括训练集分割。数据集特征包括:动作数据(action),包含6个关节位置(如肩部平移、肩部升降、肘部弯曲等);观测状态(observation.state),同样包含6个关节位置;观测图像(observation.images.hand_cam),为手部相机视频,分辨率480x640,3通道RGB格式;以及时间戳、帧索引、情节索引等元数据。数据以parquet文件格式存储,视频以mp4格式存储,总数据文件大小为100MB,视频文件大小为500MB。

This dataset is a robotics control dataset created using the LeRobot tool. It targets the so101_follower robot type, containing 10 complete episodes with a total of 3000 frames, covering 1 task. Data is collected at 30fps and includes a training split. Dataset features include: action data with 6 joint positions (e.g., shoulder pan, shoulder lift, elbow flex, etc.); observation state with the same 6 joint positions; observation images from a hand camera with 480x640 resolution and 3 RGB channels; and metadata such as timestamp, frame index, and episode index. Data is stored in parquet format, videos in mp4 format, with total data file size of 100MB and video file size of 500MB.

提供机构:
IsaacSinn
搜集汇总
数据集介绍
IsaacSinn/makermods_lid_intocup 数据集图片
构建方式
该数据集借助LeRobot框架构建,专注于机器人操作领域。数据采集源自so101_follower机械臂,通过遥操作或预设程序记录10个完整的操作回合(episodes),总计3000帧有效数据,涵盖唯一一项操作任务。数据以分块形式存储,每块容纳1000帧,分别以Parquet格式保存关节角度、时间戳等结构化信息,并以AV1编码的MP4视频记录手部摄像头视角的480×640像素图像序列,完整复现了机械臂肩部、肘部、腕部及夹爪的六维运动轨迹。
特点
数据集结构紧凑且经过精心组织,总容量约600MB,其中视频数据占据500MB,保障了视觉信息的丰富度。全部3000帧数据被统一划分为训练集,无验证或测试分割,简化了使用流程。除30帧/秒的同步视频外,关键特征包括六维动作指令与对应观测状态,均以32位浮点数精确描述,而帧索引、任务标签等辅助字段为数据筛选提供了便利。这种设计使模型能够直接学习从视觉观测到关节级动作的映射关系。
使用方法
推荐通过LeRobot库加载该数据集,其内置接口可自动解析Parquet与视频文件的关联。用户可按批次提取图像帧与对应的状态-动作对,用于训练模仿学习或强化学习策略。数据已按1000帧为单元进行分块,便于流式读取以降低内存压力。六维动作空间贴合主流机械臂控制范式,可直接作为策略网络的输出目标,配合时间戳字段,还可支持时序建模或轨迹预测任务。Apache-2.0许可也为学术与商业应用提供了便利。
背景与挑战
背景概述
随着机器人学习领域的迅猛发展,从人类演示中学习复杂操作技能已成为研究热点,而高质量数据集的稀缺是制约该领域进步的关键瓶颈。makermods_lid_intocup数据集由LeRobot社区基于Apache-2.0许可创建,专为机器人操作任务设计,旨在提供从原始传感器数据到执行动作的端到端学习样例。该数据集围绕一个核心任务——将盖子放入杯子中,采集自一台so101_follower机器人,包含10个完整回合、共计3000帧的演示数据,涵盖6维动作空间(关节位置)及手部摄像头的高清视频流。通过公开标准化的数据格式与元信息,该数据集为机器人模仿学习、行为克隆及多模态融合研究提供了可复现的基准,推动了机器人技能习得从理论向实际应用的过渡。
当前挑战
该数据集所应对的核心领域挑战在于,机器人操作任务的高维连续动作空间与视觉-运动耦合的复杂性使得模型泛化困难。具体而言,单任务(盖入杯)的10个采集回合规模极小,难以覆盖操作中的姿态变化、物体位置偏移及环境光照差异;同时,状态与动作空间中关节角度的定义缺乏语义关联,限制了策略向新构型机器人的迁移。构建过程中,数据采集依赖遥操作或示教,而手部摄像头视角的局限性易产生遮挡与观测噪声,且视频与状态数据的时间同步误差需严格控制,这些因素共同构成了从原始演示到可用训练样本间的挑战。
常用场景
经典使用场景
在机器人操作技能学习的前沿领域,makermods_lid_intocup数据集为模仿学习与行为克隆等核心技术提供了理想的数据基石。该数据集包含10个完整轨迹、3000帧连续观察数据,以30FPS的高帧率记录了SO101型跟随机器人完成单类任务的完整过程。每个轨迹同步采集了6维关节位置动作指令与对应状态向量,并辅以480×640分辨率的手部视角视频流,为研究从视觉输入到动作输出的端到端策略训练提供了丰富的多模态对齐数据。研究人员可直接利用该数据集训练机器人通过像素输入精准复制示范动作,适用于离散控制与连续控制策略的对比验证。
解决学术问题
该数据集系统性地回应了机器人学习领域数据稀缺与分布偏移两大核心挑战。凭借其标准化的数据结构与Apache-2.0开放许可,它解决了科研社区中缺乏高质量、可复现的机器人精细操作基准数据的问题。基于30Hz的精确时间戳与分块存储设计,学者可深入探索时序依赖策略的泛化边界,研究状态空间与动作空间的耦合关系。数据集中手部相机的视觉模态与关节状态的多维信息,为验证多模态融合策略在真实物理环境中的鲁棒性提供了标准测试平台,有力推动了从仿真到真实场景迁移学习这一关键学术命题的突破。
衍生相关工作
围绕makermods_lid_intocup数据集衍生的工作主要集中于数据驱动策略的优化与评测。经典研究方向包括利用时序注意力机制的动作片段分割算法,该数据集提供的精确帧索引和动作序列为其验证提供坚实基础。此外,基于该数据集开发的环境感知模块能够从手部摄像机视频中提取空间特征,进而与LeRobot生态系统的预训练模型进行微调对齐,形成可迁移的操作策略库。在跨任务泛化研究中,研究人员通过该数据集的标准特征结构(包括关节位置、图像与时间戳)构建了多任务伪数据集,推动了机器人少样本学习与元学习领域的实证进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务