遇见数据集

RedTriangleIntoBox

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

该数据集是使用LeRobot平台创建的机器人操作数据集,采用Apache-2.0许可证发布,专为机器人学任务设计。数据集包含来自so101_follower机器人的多模态演示数据,规模为120个完整任务片段(episodes),总计67,522帧数据,涵盖2种不同任务。数据以parquet文件格式存储,总数据文件大小为100MB,视频文件大小为200MB。核心特征字段包括:1) 动作空间(action):6维浮点数组,控制机器人肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置;2) 状态观测(observation.state):与动作空间对应的6维关节位置状态;3) 视觉观测(observation.images):包含顶部(top)和前方(front)两个视角的RGB视频流,分辨率480×640,帧率30fps,采用AV1编码;4) 时序索引:时间戳(timestamp)、帧索引(frame_index)、片段索引(episode_index)、全局索引(index)和任务索引(task_index)。所有数据已划分为训练集(0-120 episodes),适用于机器人模仿学习、行为克隆、强化学习等任务的研究与开发。

This dataset is a robot manipulation dataset created using the LeRobot platform and released under the Apache-2.0 license. It is designed for robotics tasks and contains multimodal demonstration data from the so101_follower robot. The dataset consists of 120 complete task episodes, totaling 67,522 frames, covering 2 different tasks. Data is stored in parquet format, with a total data file size of 100MB and video file size of 200MB. Core feature fields include: 1) Action space (action): a 6-dimensional floating-point array controlling robot shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, and gripper position; 2) State observation (observation.state): 6-dimensional joint position states corresponding to the action space; 3) Visual observation (observation.images): RGB video streams from top and front perspectives, with a resolution of 480×640, frame rate of 30fps, and AV1 encoding; 4) Temporal indices: timestamp, frame_index, episode_index, index, and task_index. All data is divided into a training set (0-120 episodes) and is suitable for research and development in robot imitation learning, behavior cloning, reinforcement learning, and related tasks.

创建时间:
2026-06-04
原始信息汇总

数据集概述:RedTriangleIntoBox

  • 许可证:Apache-2.0
  • 任务类别:机器人学(Robotics)
  • 标签:LeRobot
  • 创建工具:该数据集使用 LeRobot 创建。

数据集结构

  • 机器人类型:so101_follower
  • 总片段数:120
  • 总帧数:67,522
  • 总任务数:2
  • 数据分块大小:1,000
  • 数据文件大小:约 100 MB
  • 视频文件大小:约 200 MB
  • 帧率:30 FPS
  • 数据分割:仅包含训练集("train": "0:120"),涵盖全部120个片段。
  • 数据存储路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频存储路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

特征说明

  • 动作(action):浮点32位,形状 [6],包含6个关节位置(shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos)。
  • 观测状态(observation.state):浮点32位,形状 [6],与动作相同,包含6个关节位置信息。
  • 观测图像 - 顶部摄像头(observation.images.top):视频类型,分辨率 480×640,3通道,采用 AV1 编码,YUV420P 像素格式,30 FPS,无音频,非深度图。
  • 观测图像 - 前方摄像头(observation.images.front):视频类型,分辨率 480×640,3通道,采用 AV1 编码,YUV420P 像素格式,30 FPS,无音频,非深度图。
  • 时间戳(timestamp):浮点32位,形状 [1]。
  • 帧索引(frame_index):64位整数,形状 [1]。
  • 片段索引(episode_index):64位整数,形状 [1]。
  • 索引(index):64位整数,形状 [1]。
  • 任务索引(task_index):64位整数,形状 [1]。
搜集汇总
数据集介绍
RedTriangleIntoBox 数据集图片
构建方式
RedTriangleIntoBox数据集是基于LeRobot框架构建的机器人操作数据集,专为模仿学习与机器人控制研究设计。数据采集自so101_follower型机器人,通过遥操作或预设策略执行任务,记录120个完整交互回合,共计67,522帧时序数据。数据以Parquet格式存储动作与状态信息,同时以AV1编码视频保存机器人顶部与前方两个视角的480p图像流。该数据集覆盖两项任务,所有回合均被划分为训练集,并按每1000帧分块组织,便于高效加载与处理。
使用方法
使用RedTriangleIntoBox数据集时,推荐借助LeRobot库的Dataset类加载Parquet文件与关联视频,自动对齐状态、动作与图像序列。研究可通过模仿学习算法(如行为克隆或扩散策略)训练策略网络,以6维关节指令为输出,历史观测为输入。数据集已预先划分好训练分块,索引与回合结构清晰,便于分批次迭代或按回合提取完整轨迹,适用于单任务策略学习或作为多任务数据集的一部分进行联合训练。
背景与挑战
背景概述
RedTriangleIntoBox数据集是机器人学习领域中的一个重要资源,由LeRobot社区于近期构建并发布。该数据集专注于机械臂操作任务,旨在解决如何通过模仿学习实现精确的物体操控这一核心研究问题。数据集包含了120个演示回合,共计67522帧高保真时序数据,涵盖了两类操作任务,由SO-101型从动机器臂在受控环境下采集,每帧记录了六维关节空间的动作指令与状态信息,以及来自顶部和前方两个视角的640×480分辨率视频流。该数据集以其规范化的结构、对低层级运动控制任务的覆盖以及开源Apache-2.0许可,为机器人操作领域的模仿学习与行为克隆研究提供了标准化的基准平台,推动了从感知到动作映射算法的可复现性研究。
当前挑战
RedTriangleIntoBox数据集所应对的领域挑战在于,机器人操作任务中从视觉感知到精确动作生成的映射关系高度非线性且受环境噪声影响,传统方法难以在有限演示下泛化至未见过情境。构建过程中的挑战则体现在:首先,需要保证动作与状态序列在30帧每秒的高采样速率下精确同步,以捕捉微小的手眼协调细节;其次,两个视角的视频数据与关节空间记录的联合标定要求严格的时空对齐,任何帧偏差都会引入错误的模仿信号;此外,数据集仅含120个回合、两大类型任务,在有限样本条件下如何设计能够有效抑制过拟合的模仿学习算法,仍是一个亟待攻克的难题。
常用场景
经典使用场景
在机器人操作学习领域,RedTriangleIntoBox数据集专为研究基于视觉的机械臂操控任务而设计。该数据集收录了120个示范片段,涵盖将红色三角块放入指定盒子等精细操作场景。借助LeRobot框架采集的高保真数据,研究者可利用多视角图像(顶部与前方摄像头)和六维关节状态信息,训练模仿学习或强化学习算法,使机器人习得从感知到动作的精准映射。其标准化配置便于开展跨方法比较与复现实验。
解决学术问题
该数据集直击机器人学习中的样本效率低下与泛化能力不足两大核心难题。通过提供低维关节位置和高维视觉观测的联合标注数据,促进了视觉运动策略的研究进展,使算法能从有限示范中捕捉重复性操作模式。它为验证一种模型在多任务(如放置与对齐)间的迁移能力提供了基准,推动了轻量化策略网络的设计,对减轻对真实环境大量试错依赖具里程碑意义。
实际应用
在实际工业与生活场景中,该数据集驱动的模型可用于自动化生产线上的零部件拾取与装配,例如机器人基于顶部相机定位红色工件完成精准投放。此外,其多模态融合特性使其在家庭服务机器人中释放潜力,诸如自主整理桌面上杂乱的物件。通过模拟仿真的训练范式,该数据集降低了真实机器人调试成本,加速了从实验室到车间的技术落地进程。
数据集最近研究
最新研究方向
RedTriangleIntoBox数据集聚焦于基于视觉与状态反馈的机器人精细操作任务,尤其关注多视角图像与关节状态序列的深度融合。在具身智能与模仿学习前沿,该数据集通过120个演示片段、6自由度动作空间及双摄像头视觉输入,为研究少样本泛化下的灵巧抓取与放置策略提供了宝贵资源。其结构化的parquet与视频存储方案兼容LeRobot框架,有力推动机器人学习领域在高效数据复用与实时动作映射上的技术突破,对实现可迁移的智能操作技能具有基础性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务