遇见数据集

HyeonseokE/SO101-cap_sort_RGBblock_to_matchingplate_10fps_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人数据集,专门用于机器人任务。数据集包含80个完整的情节(episodes),总计69,725帧,帧率为10fps。数据集中只有一个任务,涉及机器人操作。数据集的结构包括观测状态(如关节位置和末端执行器位置)、动作(关节控制命令)、图像观测(来自顶部和左手腕摄像头的视频,分辨率为480x640,RGB格式)、技能信息(自然语言描述、验证问题、类型、进度和目标位置)以及子任务信息(自然语言描述、对象名称和目标位置)。此外,还包括时间戳、帧索引、情节索引等元数据。数据集以Parquet格式存储,总数据文件大小为100MB,视频文件大小为200MB。机器人类型为so101_follower,适用于机器人学习和控制研究。

This dataset is a robotics dataset created using LeRobot, specifically designed for robotic tasks. It contains 80 complete episodes, totaling 69,725 frames at a frame rate of 10fps. The dataset includes only one task related to robot manipulation. The dataset structure comprises observation states (such as joint positions and end-effector positions), actions (joint control commands), image observations (videos from top and left wrist cameras with a resolution of 480x640 in RGB format), skill information (natural language descriptions, verification questions, types, progress, and goal positions), and subtask information (natural language descriptions, object names, and target positions). Additionally, it includes metadata such as timestamps, frame indices, and episode indices. The dataset is stored in Parquet format, with a total data file size of 100MB and video file size of 200MB. The robot type is so101_follower, suitable for robotics learning and control research.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_sort_RGBblock_to_matchingplate_10fps_80epi 数据集图片
构建方式
该数据集依托LeRobot框架构建,聚焦于机器人操作任务,涉及将RGB彩色方块分类并放置于匹配的基板之上。数据采集采用so101_follower型机器人,以10帧/秒的采样频率记录,共包含80个完整轨迹片段(episode),总计69725帧图像与状态信息。数据以Parquet格式存储结构化信息,并辅以H.264编码的视频文件记录双视角视觉观测(顶部与左腕摄像头),确保动作与视觉数据的高度同步。
特点
数据集具有多模态、高密度的特征维度。其观测空间涵盖6维关节状态、6维末端执行器位姿(xyzrpy)及二值化夹爪状态,动作空间同样对应6个自由度。尤为突出的是,每条记录均包含丰富的语义标签,如自然语言描述的任务与子任务指令、验证性问题、技能类型及进度,以及目标关节位置和笛卡尔空间坐标,为模仿学习与语言条件策略提供了精细的监督信号。
使用方法
该数据集可直接通过LeRobot库加载与可视化。使用者可依据‘observation.state’、‘action’等键名提取机器人状态与动作序列,并利用‘observation.images.top’与‘observation.images.left_wrist’获取对应时刻的RGB图像。此外,借助‘skill.natural_language’、‘subtask.natural_language’等字段,研究人员可设计语言引导的机器人操控模型,或利用‘skill.goal_position’系列特征进行目标条件策略的端到端训练。
背景与挑战
背景概述
该数据集由HyeonseokE等人于2024年基于LeRobot框架创建,专注于机器人操作领域中的精细分拣任务,具体涉及在So100系列机器人平台上,通过视觉引导实现彩色积木块至对应匹配板的准确放置。其核心研究问题在于如何利用多模态感知信息(包括关节状态、末端执行器位姿与多视角视觉图像)训练机器人完成高精度、高鲁棒性的物体操作。作为一款包含80个演示片段、近7万帧高质量数据及自然语言标注的开放资源,该数据集为模仿学习与技能泛化研究提供了标准化基准,在工业自动化与家庭服务机器人任务中具有重要参考价值。
当前挑战
该数据集所解决的领域挑战在于,机器人分拣任务需同时应对物体姿态变化、视觉遮挡与实时控制的协同问题。具体而言,如何从多视角视频流中精准解析彩色积木的空间位置与朝向,并映射为六自由度机械臂的连续动作序列,是模仿学习中的核心难点。构建过程中则面临数据采集效率与标注一致性的矛盾:需要确保机械臂末端执行器在不同光照与背景条件下稳定跟踪目标,同时为80个演示片段赋予精确的关节角度、自然语言描述与子任务验证信息,这对设备校准与人工标注流程提出了严苛要求。
常用场景
经典使用场景
在机器人操作领域,该数据集专为基于视觉与状态的零部件分拣与装配任务设计,尤其聚焦于将彩色积木准确抓取并匹配至对应底板的精细操作。其经典使用场景涵盖模仿学习中的行为克隆方法,研究人员可利用多视角视觉观测(顶部与腕部摄像头)与六维关节状态序列,训练机器人从演示中习得复杂的抓取、搬运与精确对齐策略。数据以10帧每秒的采样频率记录了80个完整回合,每回合包含连续的机器人状态、动作及技能元信息,为端到端策略学习提供了高保真、带结构化标注的训练样本。
实际应用
在实际工业场景中,该数据集所蕴含的演示数据可直接赋能柔性制造与仓储物流中的自动化分拣与精密装配环节。通过训练出的模型能使机械臂快速适应不同规格、颜色的零件差异,显著降低对传统硬编码程序或复杂视觉标定系统的依赖。此外,其包含的自然语言技能描述与验证问题字段,为人机协作场景中的指令理解与任务监控提供了底层数据支撑,有助于实现操作过程的自检与异常预警,提升生产线作业的灵活性与容错率。
衍生相关工作
基于此数据集的特性,已衍生出多项颇具影响力的前沿工作。研究者利用其多视角视频与关节序列数据,开发出结合扩散模型的视觉运动策略(Diffusion Policy),显著提升了操作轨迹的平滑性与多峰动作分布的拟合能力。另一方向则是围绕“技能进度”与“子目标位置”的无缝衔接,催生了基于语言条件的实时轨迹重规划方法,如RT-2架构在该类型精细操作数据上的微调尝试。此外,该数据集的开放格式与LeRobot平台的兼容性,也为后续构建跨机器人平台的通用操作基座(Foundation Model)提供了标准化的训练样本生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务