遇见数据集

zijian2022/t83

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人数据集,专为机器人任务设计。数据集基于xarm机器人,包含2个总集数、338个总帧数和1个总任务。数据以parquet格式存储,总数据文件大小为100MB,视频文件大小为200MB,帧率为20fps。数据集分为训练集(包含所有集)。特征包括时间戳、帧索引、集索引、索引、任务索引、观察状态(如关节位置j0、j1、j2和旋转数据r0至r5、j7)、观察图像(正面和侧面摄像头,分辨率480x640,3通道,视频编码为av1,帧率30fps,无音频)以及动作数据(与观察状态类似的结构)。数据集旨在支持机器人学习和控制研究。

This dataset was created using LeRobot and is designed for robotics tasks. It is based on the xarm robot, containing a total of 2 episodes, 338 frames, and 1 task. The data is stored in parquet format, with a total data file size of 100MB and video file size of 200MB, at a frame rate of 20fps. The dataset is split into a training set (covering all episodes). Features include timestamp, frame index, episode index, index, task index, observation state (such as joint positions j0, j1, j2 and rotation data r0 to r5, j7), observation images (front and side cameras, resolution 480x640, 3 channels, video codec av1, frame rate 30fps, no audio), and action data (with a structure similar to observation state). The dataset aims to support robotics learning and control research.

提供机构:
zijian2022
搜集汇总
数据集介绍
zijian2022/t83 数据集图片
构建方式
t83数据集依托LeRobot开源框架构建,通过采集xarm机械臂在真实环境中的操作数据生成。数据集包含2个完整演示片段(episodes),共计338帧视频与动作序列,所有数据以Parquet格式存储于分块文件中。采集频率为20 FPS,并同步录制了正面与侧面两个视角的640×480像素彩色视频,采用AV1编码压缩。动作与状态空间均包含10个维度,对应机械臂各关节的位置与姿态信息。
特点
该数据集具有多模态融合与高时间对齐的特性。除标准的关节状态数据外,还提供同步的双视角视觉观测,为模仿学习提供丰富的感知输入。数据通过分块存储(chunk size=1000帧)优化了加载效率,并内置训练/验证划分(train:0:2)。视频帧与传感器数据的时间戳严格对应,确保了状态-动作-图像序列的精确同步,适用于端到端机器人学习任务。
使用方法
数据集可通过LeRobot库直接加载,用户利用`lerobot.Dataset`接口指定数据集路径与配置即可。加载后的数据以字典形式返回,包含`observation.state`、`observation.images.front`、`observation.images.side`及`action`等键。推荐使用PyTorch或TensorFlow的数据加载器进行批量处理,视频帧需解码为三维张量后输入神经网络。数据集兼容常见的模仿学习与强化学习框架,仅需调整数据形状即可适配不同模型架构。
背景与挑战
背景概述
在机器人学习领域,数据驱动的模仿学习与行为克隆技术近年来取得了显著进展,其核心依赖于高质量、高保真的机器人操作数据集。t83数据集由研究者zijian2022于近期创建,基于Hugging Face的LeRobot框架进行构建,旨在为双臂协作机器人(xarm类型)提供精细化的操作轨迹数据。该数据集仅包含2个实验片段(episodes)和338帧数据,但针对单一任务场景设计了10维状态空间(包括6个关节位置与4个末端执行器姿态参数)及对应动作空间,并配有前视与侧视双目视觉记录(640×480分辨率,30fps视频流),为研究多模态感知与机器人控制之间的映射关系提供了结构化样本。尽管规模较小,t83体现了从传统仿真环境向真实机器人数据迁移的趋势,在LeRobot生态体系中作为轻量级验证测试集,可支撑算法鲁棒性初步评估与跨数据集泛化能力研究,对推动可复现的机器人学习基准建设具有参考价值。
当前挑战
t83数据集所解决的领域核心问题在于机器人操作技能的泛化迁移——如何在有限演示数据下让机械臂完成精准的抓取、组装等任务。数据集构建过程中面临多重挑战:首先,实物机器人数据采集面临成本与安全性限制,2个片段的极低容量必然导致训练的模仿学习模型极易过拟合,难以应对环境扰动或物体位姿变化;其次,10维动作空间与关节位置、应变的命名体系(如j0-j7)暗示可能存在冗余或未校准的维度,而未公开的硬件标定参数与零位基准会引入跨机器人移植时的保真度下降;再者,视觉数据与运动指令的时序对齐(20fps动作 vs 30fps视频)需精确解耦帧同步误差,视频编码采用的AV1压缩格式虽节省存储却可能损失高频纹理信息,影响基于像素的控制策略学习;最后,当前缺乏基准任务定义与评估协议,阻碍了与其他xarm数据集(如MimicGen)的公平对比,使得该数据集的领域影响力局限于概念验证阶段。
常用场景
经典使用场景
在机器人学习领域,t83数据集为模仿学习与行为克隆提供了宝贵的训练资源。该数据集记录了xarm机械臂在执行单一任务过程中的多模态感知数据,包括来自前视和侧视两个视角的视觉图像序列、10维关节状态信息以及对应的动作指令。研究者常利用这些成对的观测-动作序列来训练端到端的机器人操控策略,使机械臂能够从视觉输入直接映射出精确的关节控制信号。由于数据采集频率稳定、结构清晰,该数据集尤为适合用于评测机器人从示教中泛化行为的能力。
解决学术问题
t83数据集主要解决了机器人学中数据驱动的策略学习所面临的小样本与少样本挑战。在仅有2个演示片段、338帧数据的情况下,它迫使研究者探索如何在极端有限的示范下实现有效的技能获取。这直接回应了机器人学习领域中一个核心困境:真实环境中收集大规模高质量演示成本高昂且难以扩展。通过该数据集,学术界能够系统研究迁移学习、元学习以及数据增强技术在半结构化环境中的效能,推动更高效、更少依赖人工标注的弱监督机器人学习方法的发展。
衍生相关工作
基于t83数据集的结构特点,研究者已衍生出若干重要工作。例如,在LeRobot框架下,该数据集常被用作评测视觉运动策略(如扩散策略或基于Transformer的策略)在小样本条件下的基准。此外,相关工作探索了利用多视角图像融合进行状态估计,以提升机械臂在遮挡严重环境下的鲁棒控制能力。近期工作还尝试将其与预训练视觉表示(如CLIP或ResNet)相结合,研究如何通过视觉特征先验加速机器人策略的收敛,为少样本机器人学习提供了新的范式考量。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务