遇见数据集

task4_1_rgb

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

该数据集是一个基于LeRobot框架采集的双臂机器人操控数据集。机器人类型为双UR5e机械臂(dual_ur5e_rosbag),配备左右夹爪。数据集包含93个episode,共160,755帧,所有episode均属于同一任务。数据以30fps的帧率记录,包含14维的状态观测(左右臂各6个关节位置加上左右夹爪状态)、12维的关节位置和速度、14维的动作指令(目标关节和夹爪位置),以及2维的夹爪位置。此外,还提供了四个摄像头视角的RGB视频:前视相机、顶部相机、左腕相机和右腕相机,视频分辨率均为240×424,编码为AV1。数据以parquet文件存储,视频以mp4文件存储。数据集适用于机器人学习、模仿学习、行为克隆、强化学习等任务,特别是双臂协作场景。

This dataset is a dual-arm robot manipulation dataset collected based on the LeRobot framework. The robot type is dual UR5e robotic arms (dual_ur5e_rosbag) equipped with left and right grippers. The dataset contains 93 episodes with a total of 160,755 frames, all belonging to the same task. Data is recorded at 30fps, including 14-dimensional state observations (6 joint positions for each arm plus left and right gripper states), 12-dimensional joint positions and velocities, 14-dimensional action commands (target joint and gripper positions), and 2-dimensional gripper positions. Additionally, RGB videos from four camera views are provided: front camera, top camera, left wrist camera, and right wrist camera. The video resolution is 240×424, encoded with AV1. Data is stored in parquet files, and videos are stored in mp4 files. The dataset is suitable for robot learning, imitation learning, behavior cloning, reinforcement learning, and other tasks, especially for dual-arm collaboration scenarios.

创建时间:
2026-08-24
原始信息汇总

数据集概述:takeru01/task4_1_rgb

基本信息

  • 任务类别:机器人学(robotics)
  • 许可证:Apache-2.0
  • 创建工具:LeRobot(Hugging Face 机器人学习框架)
  • 数据格式:Parquet 文件(位于 data/*/*.parquet
  • 机器人类型:双 UR5e 机械臂(dual_ur5e_rosbag)

数据集规模

项目 数据
总回合数(Episodes) 93
总帧数(Frames) 160,755
总任务数 1
数据文件大小 约 100 MB
视频文件大小 约 200 MB
帧率 30 FPS
训练集划分 0:93(全部数据)

数据特征结构

观测状态(Observation.State)

  • 维度:14 维(float32)
  • 包含:左/右机械臂 6 个关节位置 + 左/右夹爪位置

关节位置(Joint Position)

  • 维度:12 维(float32)
  • 包含:左/右机械臂各 6 个关节角度

关节速度(Joint Velocity)

  • 维度:12 维(float32)
  • 包含:左/右机械臂各 6 个关节角速度

动作(Action)

  • 维度:14 维(float32)
  • 包含:左/右臂目标关节角度 + 左/右夹爪目标位置

夹爪位置(Gripper Position)

  • 维度:2 维(float32)
  • 包含:左夹爪、右夹爪位置

图像观测(4 个摄像头)

  • 分辨率:240 × 424 × 3(高 × 宽 × 通道)
  • 编码:AV1 视频编码(yuv420p 像素格式)
  • 帧率:30 FPS
  • 摄像头视角
    • camera_front:前置摄像头
    • camera_top:顶部摄像头
    • camera_left_wrist:左腕部摄像头
    • camera_right_wrist:右腕部摄像头

额外元数据

  • 时间戳(timestamp):float32,1 维
  • 帧索引(frame_index):int64,1 维
  • 回合索引(episode_index):int64,1 维
  • 全局索引(index):int64,1 维
  • 任务索引(task_index):int64,1 维

数据存储方式

  • 数据文件data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 块大小:1000 帧/块

可视化工具

数据集支持通过 LeRobot 可视化工具进行在线预览,可直接访问 https://huggingface.co/spaces/lerobot/visualize_dataset?path=takeru01/task4_1_rgb 查看。

搜集汇总
数据集介绍
task4_1_rgb 数据集图片
构建方式
该数据集源于机器人操作任务,采用LeRobot平台构建,包含93个操控双UR5e机械臂与夹爪的演示片段,共计160,755帧,帧率30FPS。数据采集覆盖前视、顶视及左右腕部四个视角的RGB视频流,同步记录关节位置、速度、夹爪状态及目标动作指令,以Parquet格式存储元数据,视频采用AV1编码压缩。所有数据划分为单一训练集,供模仿学习算法端到端训练。
特点
数据集突出呈现多模态融合特性,整合高维视觉观测与低维本体感受信息,支持细粒度动作表征。双机械臂14维动作空间涵盖六关节角度与夹爪开合,配合多视角视觉输入,可捕捉复杂操作细节。视频编码采用高效AV1压缩,兼顾存储效率与视觉质量。数据包含时间戳与帧索引,便于时序建模,任务标签明确,适用于策略学习与评估。
使用方法
数据集可基于LeRobot库加载,通过HuggingFace可视化工具交互式查看样本。使用者应自定义变换以处理多视角图像与状态数据,构建批次训练模型。建议按时间顺序对传感器流进行对齐,利用提供的动作与状态差分进行行为克隆或强化学习预训练。评测时依据任务需求拆分帧或片段,以实现跨场景泛化验证。
背景与挑战
背景概述
task4_1_rgb数据集诞生于机器人学习与模仿学习的前沿领域,由研究者在LeRobot框架下构建,旨在捕获双臂机器人执行精细操作任务的丰富视觉与状态信息。该数据集通过整合多视角摄像头(包括前视、顶视及双腕部相机)与高精度关节状态、速度及动作指令,为训练鲁棒的机器人操作策略提供了关键数据支撑。其创建时间可追溯至LeRobot生态发展的重要阶段,核心研究问题聚焦于提升机器人在复杂任务中的感知-决策-执行闭环能力。该数据集凭借标准化格式与开放许可(Apache 2.0),对推动基于视觉的机器人学习研究、促进跨平台算法验证与比较具有重要影响,成为领域内可复现性研究的基石。
当前挑战
该数据集面临的挑战涵盖多维度。领域层面,双UR5e机械臂的14维动作空间与高自由度协同控制,要求算法有效处理多模态数据(视觉、本体感觉)的融合与时序对齐,以应对非结构化环境下的泛化难题。构建层面,数据采集依赖同步多摄像头系统,面临硬件校准、光照变化与遮挡问题,需确保视频编码(AV1)与状态采样的时间一致性,同时管理大规模视频与状态数据的存储效率。此外,仅93个episode的有限样本量,对模型在复杂任务上的泛化能力构成显著瓶颈,亟需结合数据增强与迁移学习策略予以缓解。
常用场景
经典使用场景
该数据集以双UR5e机械臂为平台,通过多视角视觉传感器(包括前视、顶视及左右腕部相机)与高精度关节状态记录,构建了面向复杂操控任务的视觉-运动控制数据集。其经典使用场景聚焦于模仿学习(Imitation Learning)与行为克隆(Behavioral Cloning)研究,即在给定视觉观测与本体感觉的状态序列下,训练策略网络直接映射到关节空间的精确动作指令,从而让机械臂习得精细的操作技能,如物体抓取与工具的灵巧操作。
实际应用
在实际应用中,该数据集直接服务于工业自动化与智能物流的柔性装配场景,例如上下料分拣、精密部件对准等环节。研究机构与开发团队可借此数据集离线训练控制策略,再部署于真实的双臂机器人平台,实现快速技能迁移与工艺参数的自适应调整。此外,数据集的标准化格式也使其成为软硬件协同优化的测试床,辅助验证视觉伺服、轨迹规划及人机安全交互算法在实际任务中的鲁棒性与效率。
衍生相关工作
该数据集衍生了一系列具有影响力的研究工作。在算法层面,它催生了基于Transformer的动作分块(Action Chunking)方法,如ACT(Action Chunking with Transformers)和Diffusion Policy,这些模型利用多帧动作预测提升长时序控制的稳定性。在框架层面,基于LeRobot生态,它促进了统一数据采集与训练流程的标准化,催生了如RDT(Robotics Diffusion Transformer)等大规模预训练模型的评测基准。同时,该数据集也被用于多模态语言-动作联合建模的初步验证,为具身智能体的跨模态理解开辟了新的探索路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务