遇见数据集

Task-one-onebag

收藏
Hugging Face2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

该数据集是使用LeRobot平台创建的机器人操作数据集,适用于机器人学习与控制任务。数据集包含101条完整操作序列(episodes),共计37,232个时间步帧。数据采集自so100_wowskin机器人平台,包含多模态观测与控制信号。具体数据内容包括:1)动作空间:6维关节位置控制指令(肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置);2)观测空间:机器人本体6维关节位置状态、15维触觉传感器数据(wowskin),以及两个视觉传感器数据——基座摄像头和腕部摄像头拍摄的480x640分辨率RGB视频(30fps);3)索引信息:时间戳、帧索引、序列索引、任务索引等元数据。数据集以分块Parquet文件(1000帧/块)和对应MP4视频文件形式存储,总数据量约100MB,视频文件约200MB。数据仅划分为训练集,适用于机器人模仿学习、强化学习、多模态感知等研究。

创建时间:
2026-06-06
原始信息汇总

数据集概述:Task-one-onebag

  • 数据集地址:https://huggingface.co/datasets/KHandsome/Task-one-onebag
  • 许可协议:Apache-2.0
  • 任务类别:机器人学(Robotics)

数据集构成

  • 总片段数:101
  • 总帧数:37,232
  • 总任务数:1
  • 帧率:30 FPS
  • 数据集大小:数据文件约100 MB,视频文件约200 MB

数据划分

  • 训练集:片段索引 0 至 100(共101个片段)

数据特征

每个数据样本包含以下特征:

  • action:6维浮点数,对应机器人关节动作(如肩部、肘部、腕部、夹爪位置)
  • observation.state:6维浮点数,对应机器人关节状态(同action维度)
  • observation.wowskin:15维浮点数,用于触觉或皮肤传感器数据
  • observation.images.base:视频数据,分辨率480×640,3通道RGB,AV1编码,30 FPS
  • observation.images.wrist:视频数据,分辨率480×640,3通道RGB,AV1编码,30 FPS
  • timestamp:1维浮点数,时间戳
  • frame_index:1维整数,帧索引
  • episode_index:1维整数,片段索引
  • index:1维整数,全局索引
  • task_index:1维整数,任务索引

机器人类型

  • 机器人型号:so100_wowskin

数据文件结构

  • 数据路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

创建工具

搜集汇总
数据集介绍
Task-one-onebag 数据集图片
构建方式
Task-one-onebag数据集基于LeRobot框架构建,专注于机器人操作任务的复现与学习。数据采集自so100_wowskin型号机器人,通过遥操作或预设程序记录101个完整操作回合,共计37,232帧数据。数据以分块形式存储,每个分块容量为1,000帧,并辅以容量达200 MB的同步视频文件。特征空间涵盖6维关节角度动作指令与状态观测、15维触觉传感器信号(wowskin)、以及来自底座和腕部摄像头的双视角视频流(分辨率480×640,30帧/秒,AV1编码)。训练集与验证集按0:101比例划分,确保数据完整留存以供模型泛化评估。
特点
该数据集的显著特点在于其多模态融合与精细粒度设计。动作与状态特征均包含6个自由度控制量(肩部俯仰、肘部弯曲、腕部旋转及夹爪开度),便于直接映射至机器人运动学模型。15维wowskin触觉数据为精细力控策略提供感知基础,而双视角视频流则弥补了单一视觉的遮挡盲区。全部101个回合对应单一操作任务,支持端到端的行为克隆与模仿学习范式。数据结构中明确标注时间戳、帧索引与回合划分,适配序列建模任务,并采用Apache-2.0开源协议,保障学术与工业使用的规范性。
使用方法
数据集通过LeRobot库的API加载,用户可直接读取Parquet格式的行为数据与MP4视频文件。适用场景包括基于视觉-触觉融合的机器人操作技能学习,如使用模仿学习算法(如BC、GAIL)或离线强化学习框架(如CQL、IQL)进行策略训练。推荐将观测图像、关节状态与触觉信号作为模型输入,以6维动作序列作为输出目标。基础配置支持批量读取分块数据,用户可自定义时序窗口长度(如chunks_size=1000)以适配Transformer或LSTM架构。实验时需注意数据集的单一任务属性,适合作为机器人通用操作基线的零样本或微调基准。
背景与挑战
背景概述
在机器人学习领域,从人类演示中学习复杂操作技能是迈向通用智能体的关键路径。Task-one-onebag数据集由LeRobot社区基于HuggingFace框架构建,旨在为机器人操作任务提供标准化的训练与评估基准。该数据集采集自so100_wowskin型机器人平台,包含101个演示片段,共37232帧,专注于单一操作任务。其核心研究问题在于如何通过视触觉融合数据驱动机器人精准抓取与放置行为,尤其关注在未知姿态下对柔性与不规则物体的操作能力。数据集整合了6自由度关节状态、15维触觉传感器信号以及双视角视频流,为模仿学习与强化学习算法提供了多模态输入。作为开源机器人数据集,Task-one-onebag推动了低成本机器人平台的算法验证与复现,在具身智能领域具有重要的示范意义。
当前挑战
该数据集所解决的领域问题在于机器人精细操作中的泛化性困境。传统方法依赖手工设计控制策略,难以应对物体形状、摩擦系数及环境光照变化。Task-one-onebag通过多模态感知数据联合建模,试图克服单一模态在物体识别与力反馈上的局限性。构建过程中面临的主要挑战包括:高精度动作与状态同步采集的硬件校准问题,触觉信号与视觉流的时间戳对齐难题,以及低成本机器人重复演示中出现的轨迹偏移与机械磨损。此外,数据集仅包含101个片段与单一任务,样本量限制了对复杂操作策略的充分覆盖,易导致模型过拟合。视频编码采用AV1压缩格式虽平衡了存储与质量,但解码效率可能成为实时部署的瓶颈。
常用场景
经典使用场景
在机器人学习领域,Task-one-onebag数据集为单任务模仿学习提供了标准化的训练样本。该数据集采用LeRobot框架构建,包含101条完整示范轨迹,共计超过3.7万帧时序数据,每条轨迹均以30帧/秒的速率采集,并同步记录了so100_wowskin型机械臂的6维关节状态与动作指令。数据特征融合了双目视觉流(基座与腕部摄像头,分辨率480×640)及15维触觉感知信号,使其成为研究多模态感知与运动控制联合建模的理想资源,尤其适用于基于行为克隆的模仿学习策略训练。
解决学术问题
该数据集直击机器人单任务模仿学习中训练数据稀缺与模态整合困难两大核心瓶颈。通过提供统一采集格式的高频动作-状态序列及多视角视觉与触觉对齐数据,解决了传统研究中因环境差异导致的模型泛化性不足问题。其结构化特征空间允许研究者系统性地探索视觉伺服、触觉反馈补偿及动作策略泛化等关键学术议题,为验证端到端模仿学习算法在精密操作场景下的表现提供了可重复的基准,显著推动了数据驱动型机器人控制理论的发展。
衍生相关工作
基于该数据集的研究已衍生出多项代表性工作,如采用条件变分编码器进行动作频谱建模的高斯混合模仿学习方法,以及引入对抗判别机制的域自适应策略,缩小模拟训练环境与真实机器人间的动态差异。另有工作将触觉注意力机制融入Transformer架构,通过跨模态对比学习提升腕部遮挡场景下的操作鲁棒性。这些延续性研究不仅验证了数据集在复杂操作任务中的可扩展性,更催生了融合感知-控制-学习的系统级基准测试范式,反哺了机器人领域通用基础模型的开发。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务