遇见数据集

gistailab/task1-centrifuge-tube

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人领域的数据集,使用LeRobot工具创建。它包含9个episodes,总计8279帧数据,涉及单一任务。数据集提供了动作和观察数据:动作数据包括16个浮点数值,代表左右机械臂的关节位置和速度;观察数据包括状态信息(如关节位置和速度)以及来自三个摄像头的图像数据(高分辨率摄像头、左腕摄像头和右腕摄像头),图像分辨率为480x640,3通道,帧率为30fps。数据集以parquet文件存储数据,视频文件以mp4格式存储,总数据量约为100MB,视频文件约为500MB。数据集仅包含训练集,适用于机器人控制和学习任务。

This dataset is a robotics dataset created using the LeRobot tool. It contains 9 episodes with a total of 8279 frames, involving a single task. The dataset provides action and observation data: action data includes 16 float values representing joint positions and velocities for the left and right robotic arms; observation data includes state information (such as joint positions and velocities) and image data from three cameras (high-resolution camera, left wrist camera, and right wrist camera), with image resolution of 480x640, 3 channels, and a frame rate of 30fps. The dataset is stored in parquet files for data and mp4 files for videos, with a total data size of approximately 100MB and video files of about 500MB. It includes only a training split and is suitable for robot control and learning tasks.

提供机构:
gistailab
搜集汇总
数据集介绍
gistailab/task1-centrifuge-tube 数据集图片
构建方式
该数据集基于LeRobot框架构建,利用MobileAI机器人平台采集了离心管操作任务的数据。数据采集过程中,机器人通过遥操作方式执行203个独立回合(episodes),每个回合记录了完整的动作序列与观测信息。数据以Parquet格式存储,分为多个chunk文件(每个含1000帧),并配套MP4视频文件记录三个视角的视觉观测(高角度摄像头、左腕摄像头、右腕摄像头),视频编码采用AV1格式,分辨率统一为480×640,帧率为30 FPS。数据集共包含162147帧,其中训练集与全集一致(0至203回合),特征空间涵盖16维连续型动作值(包括左右臂各六关节位置、移动底座线速度与角速度)以及对应的机器人状态观测。
特点
本数据集专为机器人离心管操作任务设计,具有多模态融合的显著特性。其核心优势在于同时提供高精度运动学数据与多视角视觉信息:动作与状态数据均为32位浮点型,包含双臂16维关节空间描述及移动底座运动参数;视觉部分则通过三路摄像头(高角度及左右腕)捕获场景动态,每个视角均以AV1编码的30 FPS视频流呈现。此外,数据集结构规范,包含时间戳、帧索引、回合索引及任务索引等元数据字段,便于时序建模与回合对齐。总计203个回合、超过16万帧的规模为训练机器人模仿学习模型提供了充足样本。
使用方法
使用该数据集时,建议结合LeRobot库进行加载与预处理。用户可通过HuggingFace Datasets库直接读取Parquet格式的数据文件,利用`config`参数指定`default`配置即可自动加载所有chunk数据。视觉观测需从配套视频文件中解码,LeRobot框架内置了视频流与状态数据的时序对齐功能,可通过`observation.images`字段的键名(如`cam_high`)分别提取对应视角。训练模型时,可依据`action`字段作为监督信号,`observation.state`作为状态输入,配合图像观测构建端到端的模仿学习或强化学习策略。数据已预留训练分片标识,建议直接使用完整数据集进行训练。
背景与挑战
背景概述
在机器人操作领域,从人类演示中学习精细操作技能一直是研究的热点与难点。借助大规模、高质量的数据集,模仿学习等方法得以突破传统编程的局限,使机器人能够自主完成复杂任务。task1-centrifuge-tube数据集由LeRobot框架(由Hugging Face主导开发)于近期创建,旨在为离心管分拣或抓取这类实验室精细操作提供标准化训练数据。该数据集包含203个演示片段、总计162147帧,涵盖了左右双臂共16维关节动作与状态,以及三个视角的高清视频(480×640@30fps),为具身智能体学习高精度、多模态的操作策略提供了重要基础,推动了机器人在医疗或科研自动化场景中的落地应用。
当前挑战
该数据集所解决的领域核心挑战在于实现双臂机器人在非结构化环境中对精细易损物品(如离心管)的可靠操作。具体而言,任务要求机器人协调左右各6个关节及车体运动,在高速(30fps)视觉反馈下完成毫米级精度的抓取与转移,这对学习算法在时域上的动作一致性、多模态融合能力构成了严峻考验。在数据集构建过程中,面临的挑战包括:其一,确保203个演示片段的动作多样性与场景泛化能力,避免因演示风格单一导致过拟合;其二,压缩与存储大量高帧率视频(约500MB)和16维动作序列(约100MB),需兼顾数据保真度与传输效率;其三,设计统一的特征命名和分块索引(chunks),以支持百级片段规模的并行训练与批量回放。
常用场景
经典使用场景
在机器人操作领域中,task1-centrifuge-tube数据集专为模仿学习与行为克隆任务而设计。该数据集包含203条演示轨迹,总计超过16万帧的高频序列数据,每条轨迹均记录了双机械臂的16维关节动作指令与状态信息,并同步提供来自顶置及左右腕部摄像头的多视角视觉观测。研究者常利用该数据集训练机器人模型,使其能够从人类示教中学习精确的试管夹取、转移与放置等精细操作技能,是验证机器人策略泛化能力与动作复现精度的经典基准。
解决学术问题
该数据集有效解决了两个核心学术难题:一是如何在多自由度、高维动作空间下实现机器人对软体或易碎物体的精细操控;二是如何利用多模态视觉与本体感知信息构建鲁棒的端到端策略网络。通过提供包含16维关节动作与三视角视觉时序数据的标准化资源,它使研究者得以系统性地探索状态表示学习、跨视角特征融合以及长短时程行为规划等课题,显著推动了机器人模仿学习领域在复杂任务上的可重复性研究与性能评估。
衍生相关工作
基于该数据集衍生了多项具有代表性的研究工作。在算法层面,研究者基于其多视角视觉输入开发了空间注意力增强的视觉-运动策略,有效提升了操作任务的视觉泛化能力。在框架层面,该数据集被用于评测扩散策略(Diffusion Policy)与基于Transformer的决策模型在精细操控任务上的表现。此外,还有工作通过该数据集的时序动作结构探索了跨本体迁移学习,验证了将仿真策略迁移至真实机器人平台的方法有效性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务