遇见数据集

Task-one-combine

收藏
Hugging Face2026-06-14 更新2026-06-15 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,使用LeRobot工具创建,旨在为机器人学习研究提供数据支持。数据集采集自型号为so100_wowskin的机器人平台,包含机器人在执行单一任务过程中的多模态记录。数据集规模庞大,总计包含504条完整操作序列(episodes),对应394,472个数据帧。数据以分块(chunk)形式存储于Parquet文件中,总数据量约为100 MB,并附带有约200 MB的视频文件。数据集结构清晰,主要包含三大类特征:1) 动作指令:一个6维浮点向量,分别控制肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪的位置。2) 观测数据:包括机器人本体状态(一个与动作指令维度相同的6维浮点向量)、一个未详细说明的15维wowskin传感器数据,以及来自两个摄像头的视觉信息。视觉观测包含基座摄像头和腕部摄像头拍摄的彩色视频流,分辨率均为640x480,帧率为30 FPS。3) 丰富的元数据:如时间戳、帧索引、episode索引和任务索引,便于数据对齐与分析。该数据集适用于机器人模仿学习、行为克隆、强化学习以及多模态(状态+视觉)机器人控制策略的训练与评估。数据已预先划分为训练集。

This dataset is a robot operation dataset created using the LeRobot tool, designed to provide data support for robot learning research. It is collected from a robot platform model so100_wowskin and includes multimodal recordings of the robot performing a single task. The dataset is large-scale, containing a total of 504 complete operation sequences (episodes) corresponding to 394,472 data frames. The data is stored in chunked Parquet files with a total data volume of approximately 100 MB, accompanied by about 200 MB of video files. The dataset structure is clear, mainly comprising three categories of features: 1) Action commands: a 6-dimensional floating-point vector controlling shoulder translation, shoulder elevation, elbow bending, wrist bending, wrist rotation, and gripper position. 2) Observation data: including robot state (a 6-dimensional floating-point vector with the same dimensions as the action commands), an unspecified 15-dimensional wowskin sensor data, and visual information from two cameras. Visual observations include color video streams from a base camera and a wrist camera, both with a resolution of 640x480 and a frame rate of 30 FPS. 3) Rich metadata: such as timestamps, frame indices, episode indices, and task indices, facilitating data alignment and analysis. This dataset is suitable for robot imitation learning, behavior cloning, reinforcement learning, and training and evaluation of multimodal (state+vision) robot control strategies. The data has been pre-divided into a training set.

创建时间:
2026-06-13
原始信息汇总

数据集概述

  • 数据集名称:Task-one-combine
  • 许可证:Apache-2.0
  • 任务类别:机器人技术(robotics)
  • 标签:LeRobot
  • 创建工具:使用 LeRobot (https://github.com/huggingface/lerobot) 创建

数据集规模

  • 总片段数:504
  • 总帧数:394,472
  • 总任务数:1
  • 块大小:1,000
  • 数据文件大小:100 MB
  • 视频文件大小:200 MB
  • 帧率(FPS):30

数据划分

  • 训练集:0 到 504(全部数据用于训练)

机器人类型

  • 机器人型号:so100_wowskin

数据特征

动作(Action)

  • 数据类型:float32
  • 维度:6
  • 名称:shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos

观测状态(Observation State)

  • 数据类型:float32
  • 维度:6
  • 名称:shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos

观测 wowskin

  • 数据类型:float32
  • 形状:[15]

观测图像 - base

  • 数据类型:视频
  • 分辨率:480×640(高×宽),3通道(RGB)
  • 视频编码:AV1
  • 色彩格式:yuv420p
  • 帧率:30 FPS
  • 是否为深度图:否

观测图像 - wrist

  • 数据类型:视频
  • 分辨率:480×640(高×宽),3通道(RGB)
  • 视频编码:AV1
  • 色彩格式:yuv420p
  • 帧率:30 FPS
  • 是否为深度图:否

时间戳(Timestamp)

  • 数据类型:float32
  • 形状:[1]

帧索引(Frame Index)

  • 数据类型:int64
  • 形状:[1]

片段索引(Episode Index)

  • 数据类型:int64
  • 形状:[1]

索引(Index)

  • 数据类型:int64
  • 形状:[1]

任务索引(Task Index)

  • 数据类型:int64
  • 形状:[1]

数据文件结构

  • 数据路径格式:data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径格式:videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
搜集汇总
数据集介绍
Task-one-combine 数据集图片
构建方式
该数据集依托LeRobot框架构建,专为机器人学习任务设计。数据源自so100_wowskin型机器人,共采集504个完整演示回合,涵盖394,472帧时序信息,聚焦于单一操作任务。数据以parquet格式分块存储,每个数据块容量为1000帧,同时配套MP4格式的影像记录,包括基座与腕部两个视角,分辨率统一为480x640像素,帧率30fps。数据划分为完整训练集,按回合索引0至504划定,便于端到端模型训练与评估。
特点
数据集具有典型的机器人操作学习特征,在动作与状态空间中均包含6维关节信息,涵盖肩部、肘部、腕部及夹爪的位姿控制。额外引入15维wowskin信号,为接触力或表面传感数据,增强了感知模态的丰富性。影像模态采用AV1编码,平衡了压缩效率与画质,基座与腕部双视角组合提供了全局与局部信息,适用于模仿学习与强化学习算法对多模态输入的依赖。整体数据结构规整,包含时间戳、帧索引、回合索引等元数据,便于序列化建模。
使用方法
用户可通过LeRobot库直接加载该数据集,使用HuggingFace的datasets模块指定default配置即可读取parquet文件与视频流。训练时,可将action字段作为模型输出目标,observation.state与observation.wowskin以及双视角图像序列作为输入特征。数据集预设了单任务索引,适合用于行为克隆或逆动力学模型训练。借助chunks_size分块机制与元数据中的帧数统计,用户可灵活构建滑动窗口或回合级样本,适配Transformer或LSTM等序列学习架构。
背景与挑战
背景概述
在机器人学习领域,模仿学习已成为一种极具潜力的范式,它通过从示范数据中学习策略,使机器人能够执行复杂的操作任务。Task-one-combine数据集正是在这一背景下诞生的,由LeRobot社区于近期创建,聚焦于单任务、多模态的机器人操作数据采集。该数据集基于so100_wowskin机器人平台,包含504条示范轨迹,总计超过39万帧,涵盖了从关节角度、触觉传感(wowskin)到双视角视觉(base与wrist摄像头)的丰富观测信息。其核心研究问题在于如何利用高频率(30 fps)、多模态的示范数据,训练出能够稳定复现单一任务(如抓取或装配)的端到端策略。该数据集以Apache-2.0许可开源,为机器人模仿学习领域提供了标准化、可复现的基准,尤其推动了低成本机器人平台上的数据驱动方法研究。
当前挑战
当前,Task-one-combine数据集面临多重挑战。在领域问题层面,所解决的模仿学习任务高度依赖精准的动作映射与状态理解,但数据仅包含单一任务,泛化能力受限,难以应对环境变化(如光照、物体位置偏移)或任务变体。构建过程中的挑战尤为突出:首先,数据采集依赖人工遥操作,504条轨迹的标注成本较高,且操作一致性难以保证;其次,触觉传感器wowskin的15维信号与视觉数据的时间同步易引入误差;此外,长序列(394472帧)的parquet与视频存储格式对数据加载效率提出考验,大容量文件(100 MB数据+200 MB视频)在分布式训练场景下可能成为瓶颈。
常用场景
经典使用场景
在机器人学习领域,Task-one-combine数据集凭借其精细的运动轨迹记录与多模态感知信息,成为模仿学习与行为克隆任务中不可或缺的优质资源。该数据集涵盖了SO-100腕部灵巧操作臂在单一任务上超过500条完整演示轨迹,每条轨迹以30帧/秒的高频率捕捉了关节角度、腕部触觉传感阵列以及双视角视觉影像。研究者常利用该数据集训练端到端的机器人操控策略,通过联合建模视觉观测与本体感知状态,使机器人能够复现复杂的抓取与装配动作,从而验证算法在连续控制任务中的泛化能力与精确性。
实际应用
在实际工业与生活场景中,Task-one-combine数据集所支撑的技能学习方案具备广泛的应用前景,尤其适应于柔性制造、精密装配以及个性化服务等对灵巧操作有高要求的领域。例如,在电子产品组装线上,通过训练基于此数据集的策略模型,机械臂能够精准完成微小元件的安装与贴合任务。养老护理场景中,触觉敏感型机器人可借鉴该数据集的训练方法,实现安全抓握易碎物品或协助老人进行日常动作。这些实际应用不仅提升了自动化系统的适应能力,也降低了传统编程控制带来的高昂部署成本。
衍生相关工作
基于Task-one-combine数据集的结构特点,机器人学习社区衍生出多项重要研究工作。在算法层面,该数据集被广泛用于验证基于Transformer的决策模型以及隐式行为克隆架构在触觉-视觉融合下的表现,例如开发跨任务共享的预训练表示。在系统层面,该数据集促进了任务序列化与动作分块(Action Chunking)技术的研究,研究者利用其1000帧的分块结构探索长时域行为预测方法。此外,该数据集在触觉传感器编码与降噪网络的设计实验中扮演基准角色,有效推动了更高效灵巧操作框架的诞生,并成为LeRobot生态下验证算法复现性的关键工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务