遇见数据集

Task-one-2nd-onebag

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

该数据集使用LeRobot工具创建,是一个机器人操作数据集,适用于机器人学习任务。数据集包含一个名为so100_wowskin的机器人平台收集的演示数据,数据规模为100个完整episodes,总计18,161帧,对应1个任务。数据以分块形式存储,包含约100MB的parquet格式数据文件和200MB的MP4视频文件。数据集提供30FPS的多模态观测和动作记录。主要特征包括:1) 动作空间:6维浮点数组,控制机器人的肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置;2) 观测状态:6维浮点数组,记录上述关节的位置状态;3) 观测wowskin:15维浮点数组;4) 图像观测:包含基座摄像头和腕部摄像头两个视角的RGB视频流,分辨率均为480x640,3通道,编码格式为AV1;5) 元数据:时间戳、帧索引、episode索引、数据索引和任务索引。数据集仅包含训练集,所有episodes均用于训练。

This dataset was created using the LeRobot toolkit and is a robotic manipulation dataset tailored for robot learning tasks. It contains demonstration data collected by the so100_wowskin robotic platform, with a scale of 100 full episodes totaling 18,161 frames, corresponding to one single task. The dataset is stored in chunked format, including approximately 100 MB of parquet-formatted data files and 200 MB of MP4 video files. It provides 30 FPS multimodal observation and action recordings. The main features are as follows: 1. Action space: A 6-dimensional floating-point array that controls the robot's shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, and gripper position; 2. Observation state: A 6-dimensional floating-point array that records the position states of the aforementioned joints; 3. Wowskin observation: A 15-dimensional floating-point array; 4. Image observations: RGB video streams from two perspectives, namely the base camera and the wrist camera, both with a resolution of 480×640 and 3 color channels, encoded in the AV1 format; 5. Metadata: Timestamps, frame indices, episode indices, data indices, and task indices. The dataset only contains a training split, and all episodes are utilized for training.

创建时间:
2026-07-04
原始信息汇总

数据集概述

  • 名称: Task-one-2nd-onebag
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 标签: LeRobot

数据集来源与用途

该数据集使用 LeRobot 创建,旨在为机器人学习研究提供训练数据。

数据集配置

  • 配置名称: default
  • 数据文件: data/*/*.parquet

数据集结构

元数据摘要(来自 meta/info.json

属性
代码库版本 v3.0
机器人类型 so100_wowskin
总片段数 (Episodes) 100
总帧数 (Frames) 18,161
总任务数 1
块大小 1000
数据文件总大小 100 MB
视频文件总大小 200 MB
帧率 (FPS) 30
数据路径 data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
视频路径 videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

数据划分

  • 训练集: 片段索引 0 到 99(共 100 个片段)

特征字段

字段名 数据类型 形状 说明
action float32 [6] 动作:包括 6 个关节位置(shoulder_pan, shoulder_lift, elbow_flex, wrist_flex, wrist_roll, gripper)
observation.state float32 [6] 观察状态:6 个关节位置,与 action 命名相同
observation.wowskin float32 [15] 触觉传感数据(wowskin),维度为 15
observation.images.base video (AV1) [480, 640, 3] 基础摄像头图像:高度 480,宽度 640,3 通道,30 FPS
observation.images.wrist video (AV1) [480, 640, 3] 腕部摄像头图像:高度 480,宽度 640,3 通道,30 FPS
timestamp float32 [1] 时间戳
frame_index int64 [1] 帧索引
episode_index int64 [1] 片段索引
index int64 [1] 全局索引
task_index int64 [1] 任务索引
搜集汇总
数据集介绍
Task-one-2nd-onebag 数据集图片
构建方式
该数据集通过LeRobot框架在so100_wowskin型号机器人上采集而成,总计包含100个演示片段(episodes)和18161帧数据。每个片段记录了同一任务下的完整操作序列,数据以parquet格式分块存储于data目录下,对应的视频文件则存放在videos目录中,采用AV1编码,分辨率为480×640像素,帧率为30fps。数据集的所有样本被统一划归为训练集,未设置验证或测试划分。
使用方法
用户可通过Hugging Face的datasets库直接加载该数据集,配置名称为'default',数据文件匹配模式为data/*/*.parquet。加载后,每条样本包含动作指令、机器人状态、触觉传感、双路图像帧、时间戳及索引等字段。推荐使用LeRobot框架中的工具对数据进行可视化、重放或训练策略模型。由于数据集已在预定义的split中完成划分,用户无需额外处理即可直接开始训练循环。
背景与挑战
背景概述
在机器人学习与操控领域,数据驱动的模仿学习方法日益成为实现复杂灵巧操作的关键路径,其中高质量、多模态的机器人演示数据集是训练策略模型的基础。Task-one-2nd-onebag数据集由Hugging Face LeRobot社区创建,基于so100_wowskin机器人平台采集,专注于单任务(如抓取或放置物体)的精细操作学习。该数据集于近期发布,旨在弥补开源机器人数据中针对特定低成本硬件平台的异构模态数据稀缺问题。其核心研究问题在于如何利用包含6维关节角度、15维触觉传感信息以及双目视觉(基础相机与腕部相机)的高频时序数据(30fps),训练出泛化能力强的机器人操作策略。作为LeRobot生态的重要组成部分,该数据集为研究触觉-视觉融合、低成本机器人学习算法提供了标准化 benchmark,有望推动家庭服务与轻工业应用中机器人技能的快速部署。
当前挑战
该数据集所解决的核心领域问题在于机器人从演示中学习精细操作时普遍面临的数据效率低下与跨模态对齐难题。具体挑战包括:1)触觉信号(15维wowskin)与视觉图像(640×480 RGB)及关节状态在时序上精确同步的难度,微小偏移即导致策略学习失败;2)仅含100个episode的小样本规模(共18161帧),要求算法必须从有限演示中提取出稳健的操作基元,对模仿学习模型的泛化构成严峻考验;3)构建过程中,基于so100低成本机械臂采集高质量演示受限于硬件重复精度与传感器噪声,必须通过人工遥操作或Kinesthetic示教反复校准,以保证动作轨迹的平滑性与任务完成度;4)数据集仅包含单一任务,限制了跨技能迁移能力的评估,也体现了从单一任务向多任务泛化拓展的挑战。
常用场景
经典使用场景
Task-one-2nd-onebag数据集是针对SO100柔顺灵巧机械臂设计的单任务操作数据集,在机器人模仿学习领域具有经典应用价值。该数据集聚类了100条完整操作轨迹,包含超过18000帧高质量观测数据,通过30帧每秒的视觉与状态同步采集,为复现精细抓取与放置动作提供了标准化训练素材。研究者常将其作为基准,用于验证行为克隆、逆强化学习等算法的有效性,尤其在评价模型对连续动作空间的拟合能力与多模态融合效果时,该数据集凭借结构化的运动学参数与双视角视觉输入,成为不可多得的实验平台。
解决学术问题
该数据集精准解决了机器人学习中数据稀疏性与任务泛化难的学术痛点。传统单一任务数据集常因轨迹数量有限导致过拟合,而Task-one-2nd-onebag通过100条高质量演示,为因果推断与状态-动作分布对齐提供了充足样本。它使学者能够深入探索示教数据的多样性对策略鲁棒性的影响,并推动从有限数据中提取通用运动先验的研究。其意义在于降低了重复采集数据的成本,为验证多模态融合算法在机械臂控制中的可靠性树立了行业基准,促进了机器人学习理论从仿真到真实场景的迁移。
实际应用
在实际应用中,该数据集主要服务于柔性产线与服务机器人的技能移植。例如,通过训练SO100机械臂完成特定物品的精准拾取与放置,可快速部署于电子元器件装配或医疗器材分拣场景。双摄像头视角(基座与腕部)的设定使其能适应光照变化与遮挡环境,结合触觉传感数据(15维wowskin信号),实现了对力敏感任务的精准复现。此外,紧凑的100M数据体量便于边缘设备加载,为工业机器人操作系统的快速原型开发提供了可靠支持。
数据集最近研究
最新研究方向
该数据集聚焦于基于LeRobot框架的机器人灵巧操作任务,以SO-100仿生柔性皮肤(wowskin)机械臂为硬件原型,通过记录6自由度关节状态与触觉传感数据,为模仿学习与强化学习提供低门槛的闭环控制基准。当前研究前沿集中于利用此类包含视觉-触觉多模态对齐的示范数据,推动策略网络从小样本演示中泛化至非结构化场景,尤其在与具身智能体相关的零样本适应、远程操作技能迁移等热点领域具有显著价值。其公开的100条完整轨迹与200MB视频资源,为验证上下文学习、扩散策略等最新算法在精细装配或柔性物体操作中的鲁棒性提供了标准化测试床,进一步加速了开源机器人社区从模拟环境向真实物理系统转移的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务