遇见数据集

Task-one-twobag

收藏
Hugging Face2026-06-10 更新2026-06-11 收录
官方服务:

资源简介:

该数据集使用LeRobot框架创建,是一个专门针对so100_wowskin型机器人的控制数据集。它包含62个episodes,总计42960帧数据,覆盖1个任务,数据组织为训练集(包含所有episodes)。数据以Parquet文件格式存储,总数据量约100MB,关联的视频文件总大小约200MB,视频帧率为30 FPS。数据集的核心是多模态时间序列数据,每个数据点(帧)包含:1) 机器人动作指令:一个6维浮点向量,对应肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪的位置控制;2) 机器人状态观测:一个6维浮点向量,记录与动作指令相同的6个关节的当前位置;3) WoW皮肤传感器观测:一个15维浮点向量,可能代表触觉或皮肤传感器数据;4) 视觉观测:来自基座摄像头和腕部摄像头的两路RGB视频流,分辨率均为640x480,3通道,以AV1编码的MP4视频文件存储;5) 元数据:包括时间戳、帧索引、episode索引、全局索引和任务索引。该数据集适用于机器人模仿学习、强化学习、多模态感知与控制策略训练等任务。

This dataset is developed using the LeRobot framework, and is a specialized control dataset tailored for the so100_wowskin robot. It comprises 62 episodes, totaling 42,960 frames of data, covering 1 task, with the data organized as a training set containing all episodes. The data is stored in Parquet file format, with a total data volume of approximately 100 MB. The associated video files have a total size of around 200 MB, and the video frame rate is 30 FPS. The core of this dataset is multimodal time-series data, where each data point (frame) contains: 1) Robot action command: a 6-dimensional floating-point vector corresponding to the position controls of shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, and gripper; 2) Robot state observation: a 6-dimensional floating-point vector recording the current positions of the same 6 joints as those in the action command; 3) WoW skin sensor observation: a 15-dimensional floating-point vector that may represent tactile or skin sensor data; 4) Visual observation: two RGB video streams from the base camera and wrist camera, both with a resolution of 640×480 and 3 channels, stored as AV1-encoded MP4 video files; 5) Metadata: including timestamp, frame index, episode index, global index, and task index. This dataset is suitable for tasks such as robot imitation learning, reinforcement learning, multimodal perception and control strategy training.

创建时间:
2026-06-08
原始信息汇总

数据集概述

  • 数据集名称:Task-one-twobag
  • 许可协议:Apache-2.0
  • 任务类别:机器人学(Robotics)
  • 创建工具:使用 LeRobot 创建

数据集规模与结构

指标 数值
总片段数(Episodes) 63
总帧数(Frames) 43816
总任务数(Tasks) 1
数据块大小(Chunks Size) 1000
数据文件大小 100 MB
视频文件大小 200 MB
帧率(FPS) 30
机器人类型 so100_wowskin

数据划分

  • 训练集:全部63个片段(索引0至62)

数据特征(Features)

  • action:6维浮点数组,对应机器人关节位置(shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll、gripper)
  • observation.state:6维浮点数组,与 action 维度含义相同
  • observation.wowskin:15维浮点数组,代表触觉传感器数据
  • observation.images.base:视频数据,分辨率480×640,RGB三通道,AV1编码,帧率30fps
  • observation.images.wrist:视频数据,分辨率480×640,RGB三通道,AV1编码,帧率30fps
  • timestamp:时间戳(1维浮点)
  • frame_index:帧索引(1维整数)
  • episode_index:片段索引(1维整数)
  • index:全局索引(1维整数)
  • task_index:任务索引(1维整数)

数据文件路径

  • 数据文件data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

其他信息

  • 代码库版本:v3.0
  • 引用信息:待补充
搜集汇总
数据集介绍
Task-one-twobag 数据集图片
构建方式
Task-one-twobag数据集依托于LeRobot框架构建,专为机器人操作任务而设计。数据采集基于so100_wowskin机器人平台,包含63个轨迹片段,总计43816帧,以30帧/秒的采样频率记录。数据存储结构清晰,采用分块parquet文件组织于data目录下,视频文件则存放于videos文件夹中,每个视频片段以av1编码压缩,分辨率为480×640像素。数据集内所有样本均用于训练,未划分验证或测试集,确保数据一致性与可用性。
特点
该数据集的核心特点在于其多模态感知与动作表征的深度融合。动作空间涵盖6个自由度(包括肩部俯仰、肘部弯曲、腕部动作及夹爪位置),观测状态同步记录相同维度的关节位置,形成闭环控制基准。尤为独特的是,数据引入了一种称为“wowskin”的15维传感信息,可能表征触觉或力觉反馈,极大丰富了机器人环境交互的感知维度。同时,底座与腕部双视角视频流提供视觉线索,支持模仿学习与视觉伺服等高级算法研究。
使用方法
使用该数据集时,可通过LeRobot库的API直接加载,指定config名为'default'即可自动解析元数据与文件路径。数据以字典形式访问,包含动作、观测状态、图像序列、时间戳及索引字段。推荐利用'action'与'observation.state'序列训练逆动力学模型,或联合'observation.images.base'及'wrist'视觉流进行端到端策略学习。注意视频帧需按时间戳对齐,且所有数值特征为float32类型,便于直接输入深度学习框架。
背景与挑战
背景概述
Task-one-twobag数据集是面向机器人操作学习领域的重要资源,由LeRobot框架创建并托管于Hugging Face平台。该数据集采集自so100_wowskin型机器人,专注于单一任务的操作轨迹记录,包含63个完整episode、总计43816帧的高频(30 FPS)数据。其设计初衷在于为机器人模仿学习与行为克隆提供高质量、多模态的训练样本,涵盖六维关节动作指令、15维触觉传感信号(wowskin)以及来自基座与腕部的双视角视觉流。作为LeRobot生态中的组成部分,该数据集推动了低成本柔性机械臂在精细操作任务上的研究进程,为验证算法在真实机器人数据上的泛化能力提供了标准化基准。
当前挑战
该数据集面临的挑战主要体现在两个方面。在领域问题层面,如何从单一任务、有限样本(63个episode)中提取可迁移的操作策略是核心难题,现有模仿学习方法常因数据多样性不足而难以应对环境扰动或物体位姿变化。在构建过程中,多模态数据(6维动作、15维触觉、480p视频)的精确同步与高效压缩(采用AV1编码)增加了预处理和存储的复杂度;此外,机器人真实操作中固有的延迟、抖动与传感器噪声也对数据标注的准确性构成考验,要求后续算法具备鲁棒性以克服这些工程性的不完美因素。
常用场景
经典使用场景
在机器人学习与操控领域,Task-one-twobag数据集以其丰富的多模态传感数据脱颖而出。该数据集记录了SO-100型机器人执行单一任务时的高精度运动轨迹,包含6维关节动作与状态信息、15维触觉传感器信号以及双视角视觉影像(基座与腕部摄像头,分辨率480×640,帧率30fps)。其典型应用场景是作为模仿学习与行为克隆算法的训练基准,研究者可利用同步观测的动作-状态序列与视觉反馈,训练机器人从演示中习得精细操控策略。数据集包含63个完整回合、逾43000帧数据,为端到端学习模型的泛化能力评估提供了充足样本。
解决学术问题
该数据集系统性地解决了机器人领域长期存在的稀缺标注数据与异质性对齐难题。通过提供标准化的6自由度关节控制信号、触觉感知数据与双视角视频流,它使得研究者能够探究多模态信息融合对技能习得效率的影响,尤其是触觉反馈在精密操作中如何弥补视觉盲区。此外,数据集统一的参数格式(Parquet存储、AV1视频编码)和明确的训练验证划分,为复现与对比不同模仿学习算法(如行为克隆、逆强化学习)提供了客观基准,推动了机器人从示教中自主学习的理论深化。
衍生相关工作
该数据集的发布催生了一系列开放科学与算法研究贡献。首先,它作为LeRobot生态系统的核心组成部分,推动了开源机器人学习框架的标准化进程,衍生出如跨任务迁移学习、触觉-视觉联合编码等前沿探讨。其次,数据集的结构化多模态特性激发了针对时序动作分割与闭环控制强化学习的改进工作,例如利用触觉信号设计奖励函数以提升策略鲁棒性。此外,依托其高帧率视频与关节角度数据,研究者发展了基于扩散模型的轨迹生成方法,进一步拓展了从演示数据中合成新动作的能力边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务