遇见数据集

stevenworkspace/eval_taken_13

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人数据集,专为机器人任务设计。数据集包含一个总集(episode),总帧数为2308帧,总任务数为1。数据以30帧/秒的帧率采集,数据文件大小为100MB,视频文件大小为200MB。数据集的结构包括动作特征(16维浮点数组,表示左右机械臂的关节位置和速度)、观测状态特征(同样为16维浮点数组,与动作特征对应)以及来自三个摄像头的图像观测:高摄像头(cam_high)、左腕摄像头(cam_left_wrist)和右腕摄像头(cam_right_wrist),每个视频的分辨率为480x640,3通道,使用AV1编码。此外,数据集还包含时间戳、帧索引、集索引、索引和任务索引等元数据。数据集采用Apache 2.0许可证,适用于机器人学习和控制任务。

This dataset is a robotics dataset created using LeRobot, designed for robotics tasks. It contains a total of 1 episode, 2308 frames, and 1 task. The data is collected at 30 frames per second, with data files sized at 100MB and video files at 200MB. The dataset structure includes action features (a 16-dimensional float32 array representing joint positions and velocities for left and right robotic arms), observation state features (also a 16-dimensional float32 array, corresponding to action features), and image observations from three cameras: a high camera (cam_high), a left wrist camera (cam_left_wrist), and a right wrist camera (cam_right_wrist). Each video has a resolution of 480x640 with 3 channels, encoded using AV1. Additionally, the dataset includes metadata such as timestamp, frame index, episode index, index, and task index. The dataset is licensed under Apache 2.0 and is suitable for robot learning and control tasks.

提供机构:
stevenworkspace
搜集汇总
数据集介绍
stevenworkspace/eval_taken_13 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于移动机器人平台的数据采集与处理。数据以Parquet格式存储于'data/*/*.parquet'路径下,并采用分块机制,将全部数据划分为多个大小为1,000帧的chunk文件,便于高效管理与加载。数据集仅包含1个任务、1个完整episode,共计2,308帧,采样帧率为30 FPS,训练集与全集重合。采集过程记录了多模态信息,包括16维的机器人关节位置与速度动作指令、对应的观测状态,以及来自三台摄像机(高角度、左手腕、右手腕)的AV1编码视频流,分辨率均为640×480。数据还附加了时间戳、帧索引、episode索引等结构化元信息,确保时序对齐与可回溯性。整体构建流程遵循LeRobot的标准化格式,兼顾数据完整性与存储效率。
特点
本数据集的核心特点在于其面向移动机器人系统的多模态时空对齐能力。观测空间融合了16维关节状态与速度向量,同时包含高分辨率视觉流,使数据集具备感知-动作联合建模的潜力。三路摄像头的配置提供了全局与局部视角的互补信息,尤其适用于模仿学习中的视觉抓取与导航任务。数据集仅含单一任务与episode,适合作为小样本验证集或针对特定操作场景的评估基准。视频采用AV1编码压缩,在保持画质的同时显著降低存储占用。此外,动作与状态空间维度一致,简化了策略网络的输入输出设计,有利于快速原型验证与算法迭代。
使用方法
使用者可通过LeRobot库直接加载该数据集,利用其内置的数据加载器自动解析Parquet与视频文件。数据集预设了'default'配置,只需指定路径即可获取完整的多模态序列。在模型训练中,可调用'action'与'observation.state'数据作为连续控制指令的参数化表征,同时将'observation.images'中的三路视频帧作为视觉输入。推荐采用分块索引机制进行批量读取,以适配大规模轨迹回放。数据集兼容强化学习与模仿学习管道,尤其便于在移动机器人平台上测试基于视觉的运动规划算法。用户亦可借助Hugging Face Spaces提供的可视化工具,在线预览视频帧与动作序列,辅助数据质量审查。
背景与挑战
背景概述
近年来,机器人学习领域对高质量演示数据集的需求日益迫切,尤其在模仿学习与行为克隆等方法的推动下,精细化的多模态数据采集成为提升机器人泛化能力的关键。eval_taken_13数据集由名为stevenworkspace的研究人员基于LeRobot框架创建,采用Apache-2.0许可证公开发布。该数据集聚焦于移动双臂机器人平台,通过单次任务、2308帧的视频与状态动作记录,为机器人操作技能的捕捉与复现提供了标准化样本。其核心研究问题在于验证高维连续动作空间与视觉观测的协同建模能力,对推动小而精的机器人数据集构建范式具有示范意义。
当前挑战
该数据集面临着机器人领域普遍存在的泛化性挑战,单次任务(1集)和有限帧数(2308帧)难以覆盖真实环境中的扰动与多变性。构建过程中,动作空间涉及16维度的混合信号(包括双机械臂关节位置与底盘速度),高采样率(30fps)和视频编码(AV1)对存储与处理效率构成压力。同时,多摄像头视角(顶部、左右腕部)的同步协调与数据对齐、缺乏更多元任务标签,均限制了数据集在复杂场景下的迁移学习能力,凸显了低资源机器人数据集构建时在规模、保真度与可复现性之间的平衡难点。
常用场景
经典使用场景
在机器人学习与操控领域,eval_taken_13数据集为研究者提供了以MobileAI机器人为平台、包含16维动作空间及多视角视觉观测的精细化操控记录。该数据集采集了单条完整轨迹,涵盖左右臂各6个关节与1个滑台的位置指令、底盘线速度与角速度,以及高帧率、多角度(前视、左右腕部)的视觉信息,是开展模仿学习、行为克隆与端到端机器人操控策略训练的经典基准。研究者可利用其将视觉观测与底层运动指令对齐,探索从感知到动作的映射关系,尤其在有限样本下评估策略泛化能力时具有重要价值。
解决学术问题
该数据集精准回应了机器人领域长期面临的低样本效率与策略泛化难题。它提供了完整的状态-动作序列与多模态感知数据,便于学者验证基于行为的复制学习、逆强化学习以及基于模型的强化学习等范式。通过对比不同算法在同质化数据上的表现,数据集帮助学界厘清视觉特征抽取、时序建模与动作预测之间的内在关联,推动了关于数据质量(如高帧率摄像头记录)与策略鲁棒性之间关系的实证研究。其意义在于为系统性评测机器人操控策略的可迁移性提供了标准化参照。
衍生相关工作
基于eval_taken_13数据集,研究者已衍生出多项标志性工作。其中最典型的是基于LeRobot框架开展的视觉-运动策略蒸馏研究,其将专家演示数据映射为轻量级网络,实现高效的行为克隆。此外,该数据集被广泛应用于对比不同动作表示方法(如关节空间与任务空间规划)对策略复制保真度的影响;一些工作还探索了利用其多视角图像训练跨视角泛化的视觉编码器,或在时序模型中引入注意力机制以捕捉长程依赖关系。这些工作共同构筑了从数据采集到策略部署的标准化研究链路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务