遇见数据集

MT_Size_Recognition

收藏
Hugging Face2026-06-15 更新2026-06-16 收录
官方服务:

资源简介:

该数据集是一个用于机器人学习任务的数据集,基于LeRobot框架创建。它记录了机器人执行任务的过程,包含多模态的观测数据和对应的动作指令。数据集包含50个完整的任务执行序列(episodes),总计46075帧数据,覆盖6种不同的任务,以30 FPS的帧率采集。数据内容主要包括:1) 动作数据:包含机器人六个关节(肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪)的目标位置。2) 观测数据:包含机器人的关节状态(与动作相同的六个关节位置)、来自五个不同视角(腕部、中部、上部、右侧、左侧)的RGB视频观测(分辨率480x640)、六个关节的电机电流和速度读数、各传感器的时间戳、以及来自中部视角的深度图(分辨率480x640)。3) 元数据:包括时间戳、帧索引、episode索引和任务索引。数据集仅提供训练集,数据以分块的Parquet文件格式存储,视频文件以MP4格式单独存储。适用于机器人模仿学习、强化学习、视觉运动控制等研究领域。

This dataset is intended for robotic learning tasks and was created based on the LeRobot framework. It records the process of robots performing tasks, and contains multimodal observation data and corresponding action instructions. The dataset includes 50 complete task execution sequences (episodes), totaling 46,075 frames of data, covering 6 distinct tasks, and was collected at a frame rate of 30 FPS. The data content mainly includes: 1) Action data: Contains the target positions of the robot's six joints (shoulder translation, shoulder lift, elbow flexion, wrist flexion, wrist rotation, and gripper). 2) Observation data: Includes the robot's joint states (the same six joint positions as the action data), RGB video observations from five different perspectives (wrist, middle, upper, right, left) with a resolution of 480×640, motor current and speed readings of the six joints, timestamps of each sensor, and depth maps from the middle perspective with a resolution of 480×640. 3) Metadata: Includes timestamps, frame indices, episode indices, and task indices. The dataset only provides a training set. The data is stored in chunked Parquet file format, while video files are stored separately in MP4 format. It is applicable to research fields such as robotic imitation learning, reinforcement learning, and visual-motor control.

创建时间:
2026-06-12
原始信息汇总

数据集概述:MT_Size_Recognition

  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 标签: LeRobot

数据集详情

  • 机器人类型: SO_Follower
  • 总采集轮数 (Episodes): 50
  • 总帧数 (Frames): 46,075
  • 任务数 (Tasks): 6
  • 帧率 (FPS): 30
  • 数据大小:
    • Parquet 数据文件: 约 100 MB
    • 视频文件: 约 200 MB

数据划分

  • 训练集 (Train): 50 轮(占全部数据的 0~50)

特征结构

动作 (Action)

  • 数据类型: float32
  • 维度: 6
  • 名称: 肩关节旋转、肩关节升降、肘关节弯曲、腕关节弯曲、腕关节旋转、夹爪位置

观测状态 (Observation.State)

  • 数据类型: float32
  • 维度: 6
  • 名称: 与动作相同,表示当前关节位置

观测图像 (Observation.Images)

共提供 5 个相机视角,每个视角均为视频数据:

  • wrist (腕部相机)
  • middle (中部相机)
  • above (上方相机)
  • right (右侧相机)
  • left (左侧相机)

每个图像特征:

  • 分辨率: 480×640 像素
  • 通道数: 3 (RGB)
  • 编码格式: H.264, YUV420P
  • 帧率: 30 FPS
  • 非深度图

其他观测

  • motor_currents (电机电流): int32, 6 维
  • motor_velocities (电机速度): int32, 6 维
  • sensor_timestamps (传感器时间戳): float64, 8 维
  • depths.middle (中部深度图): uint16, 480×640

元数据字段

  • timestamp: float32, 1 维
  • frame_index: int64, 1 维
  • episode_index: int64, 1 维
  • index: int64, 1 维
  • task_index: int64, 1 维

数据格式与路径

  • 代码版本: v3.0
  • 数据文件: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 数据块大小: 每块 1000 帧

引用信息

  • 主页: 暂无
  • 论文: 暂无
  • BibTeX: 暂无
搜集汇总
数据集介绍
MT_Size_Recognition 数据集图片
构建方式
MT_Size_Recognition数据集专为机器人操作中的尺寸识别任务而构建,遵循LeRobot框架标准。该数据集通过SO-Follower机器人平台采集,涵盖了50个演示回合,共计46075帧数据,涉及6种不同的操作任务。为便于存储与高效加载,数据被分割为1000帧大小的块,并以Parquet格式保存,同时辅以H.264编码的MP4视频文件。采集过程中,机器人配备了多视角摄像头(腕部、中部、上方、左右侧),同步记录关节角度、电机电流、速度及深度图等丰富模态信息,确保了数据的一致性与完整性。
特点
该数据集最显著的特征在于其多模态与多视角的融合。它同时提供了6维关节动作和状态信息、5个机载摄像头视角的RGB视频流(分辨率480×640@30fps)、中间视角的深度图,以及电机电流和速度等动力学数据。这种全面的感知与执行信息为研究视觉运动策略、模仿学习及尺寸推理任务提供了丰富的素材。数据集已按6个任务索引分类,且所有50个回合均划归训练集,便于直接用于模型训练与评估。
使用方法
数据集采用LeRobot标准格式,用户可通过LeRobot库的API轻松加载。数据以Parquet表格文件存储结构化信息(如动作、状态、时间戳),而视频则以独立MP4文件按块组织。使用时可调用lerobot.Dataset类,根据配置文件中的data_path和video_path自动关联元数据与视觉数据。建议研究人员在训练视觉运动策略时,将多视角图像作为观测输入,并结合6维关节动作进行行为克隆或强化学习。此外,由于提供了帧索引、回合索引等字段,用户可灵活构建时间序列批次,适用于序列建模或动态环境下的尺寸识别任务。
背景与挑战
背景概述
MT_Size_Recognition数据集由研究者justintiensmith基于LeRobot框架创建,旨在为机器人操作领域提供多视角视觉与运动感知的联合学习资源。该数据集聚焦于物体尺寸识别任务,通过50个演示片段、46075帧高帧率(30FPS)数据,融合了肩部、肘部、腕部等6自由度关节动作信息以及五台摄像机(腕部、中部、上方、左侧、右侧)的同步视觉流,并额外包含深度图像与电机电流、速度等物理状态量。其发布顺应了具身智能与模仿学习对多模态细粒度数据集日益增长的需求,为研究机器人从人类演示中学习尺寸感知与精细操作行为提供了标准化基准,对推动操作技能泛化、人机协作等领域具有重要奠基意义。
当前挑战
该数据集的构建与研究面临多重挑战。在领域问题层面,机器人对物体尺寸的准确识别是实现精密装配、自适应抓取等任务的核心瓶颈,传统视觉模型难以应对光照变化、遮挡及非刚性变形,而多模态数据的异构融合更增加了特征对齐与决策的复杂度。在数据构建层面,高精度同步采集六类传感器(五视角视频、深度图、十余种运动参数)需要严格的硬件标定与时间戳对齐,50个演示片段覆盖的6个子任务需确保物体尺寸分布的多样性与代表性,同时维持100MB结构数据与200MB视频数据在训练集中的均衡采样。此外,如何从46075帧连续动作中解耦尺寸特征与运动轨迹的耦合关系,仍是利用该数据集实现鲁棒尺寸识别的核心方法论挑战。
常用场景
经典使用场景
在机器人操作与感知领域,MT_Size_Recognition数据集为研究物体尺寸的精准识别与抓取提供了关键资源。该数据集包含50个演示片段,共计46075帧,涵盖6种任务,通过多视角摄像头(腕部、中部、上方、左右两侧)采集的视觉数据与六自由度机械臂的状态信息,共同构成了一个用于研究和训练机器人基于视觉的尺寸感知模型的标准基准。其经典应用在于利用模仿学习或强化学习框架,让机器人从演示中学习如何根据物体的尺寸变化调整抓取策略与操作姿态。
衍生相关工作
围绕MT_Size_Recognition数据集,研究者已发展出多项具有代表性的工作。例如,基于该数据集的模仿学习算法(如行为克隆与扩散策略)被用于验证尺寸自适应策略的泛化能力。此外,多模态融合网络的设计依托其同步记录的视觉、深度与力矩信息,探索了特征级融合对尺寸预测精度的提升。在元学习领域中,该数据集的任务多样性促使了跨尺寸快速适应方法的提出。这些衍生工作不仅深化了对机器人操作中尺寸变化挑战的理解,还推动了LeRobot生态下开源硬件与数据驱动研究范式的标准化进程。
数据集最近研究
最新研究方向
在机器人操作与感知的交叉领域,MT_Size_Recognition数据集聚焦于多视角视觉与关节状态融合的尺寸识别任务,引领了基于模仿学习的精细操作研究前沿。该数据集通过SO_Follower机器人采集了50个回合、超过4.6万帧的多模态数据,涵盖六自由度关节运动与五视角视觉影像,为物体尺寸的实时辨识与自适应抓取提供了高保真训练基准。结合HuggingFace LeRobot生态,该资源正推动机器人从预设程序向数据驱动的智能泛化演进,其多源信息对齐框架为研究无模型尺寸估计、人机协同装配等热点方向奠定了关键基础,对工业柔性生产与家庭助老场景中的物体操纵具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务