遇见数据集

yam_lego_taxi

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集是一个用于机器人双手机器人操作任务的机器人数据集,基于 LeRobot 框架创建。数据集包含 347 个 episode,共 937,993 帧,帧率为 30 fps,所有数据均用于训练。机器人类型为 yam_bimanual。数据内容包括多视角视频观测(左腕、右腕及 agentview 摄像头,分辨率 480×640,H.264 编码)、状态信息(左右臂各 7 维位置、速度、力/扭矩,共 42 维)、leader 控制信号(12 维)、末端执行器位姿(14 维,包含位置和四元数)、控制模式(1 维)以及动作指令(左右臂各 7 维,共 14 维)。此外还包含时间戳、帧索引、episode 索引等元数据。数据文件总大小约 100MB,视频文件总大小约 200MB。该数据集适用于机器人模仿学习、强化学习、行为克隆等任务。

创建时间:
2026-08-01
原始信息汇总

数据集概述:jellyho/yam_lego_taxi

基本信息

  • 许可证:Apache-2.0
  • 任务类型:机器人(Robotics)
  • 标签:LeRobot
  • 创建工具:该数据集使用 LeRobot 框架创建

数据集规模

  • 总回合数(episodes):347
  • 总帧数(frames):937,993
  • 总任务数(tasks):1
  • 数据文件大小:100 MB(Parquet 格式)
  • 视频文件大小:200 MB(MP4 格式)
  • 帧率(FPS):30

数据结构

  • 机器人类型:yam_bimanual(双臂机器人)
  • 数据划分:训练集包含全部 347 个回合(train: 0-347)
  • 数据文件路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • Codebase 版本:v3.0
  • Chunk 大小:1000

数据特征(Features)

视觉观测(视频数据,分辨率 480x640x3,H.264 编码)

  • observation.images.wrist_left:左腕摄像头图像
  • observation.images.wrist_right:右腕摄像头图像
  • observation.images.agentview:代理视角图像

状态观测(浮点型)

  • observation.state(维度 42):双臂的位置、速度、力矩(各 7 维,左右各一组)
  • observation.leader(维度 12):双臂领导者的 6 维状态(左右各一组)
  • observation.eef(维度 14):双臂末端执行器位姿(XYZ + 四元数,左右各一组)
  • observation.control_mode(维度 1):控制模式

动作与元数据

  • action(维度 14):双臂动作指令(左右各 7 维)
  • timestamp(维度 1):时间戳
  • frame_index(维度 1):帧索引
  • episode_index(维度 1):回合索引
  • index(维度 1):全局索引
  • task_index(维度 1):任务索引

其他说明

  • 该数据集可通过 可视化工具 进行在线预览
  • 引用信息(BibTeX)暂未提供
搜集汇总
数据集介绍
yam_lego_taxi 数据集图片
构建方式
该数据集基于LeRobot框架构建,源自yam_bimanual双臂机器人平台,聚焦于LEGO积木出租车组装的精细操作任务。数据集包含347个演示轨迹,共计937993帧,以30帧每秒的采样频率记录,通过多样本采集策略确保了任务的全面覆盖。数据以parquet格式存储,并伴有高分辨率视频流,实现了状态与视觉信息的同步捕获。
特点
数据集特点鲜明,集成了多模态感知信息:包括左右腕部摄像头与全局视角相机捕捉的高清视觉数据,以及42维双臂关节状态、14维末端执行器位姿、12维领导臂指令和动作指令等丰富状态信息。这种多源数据的融合为模仿学习提供了全面的观测基础,有助于提升策略的泛化能力与鲁棒性。
使用方法
数据集的使用遵循LeRobot的标准流程,可直接通过HuggingFace数据集库加载。研究者可基于其提供的训练集划分(0-347个轨迹)进行模型训练,利用其中的状态特征与动作标签构建行为克隆或强化学习算法。此外,配套的可视化空间支持在线预览,便于快速理解任务特征与数据质量。
背景与挑战
背景概述
该数据集名为yam_lego_taxi,由jellyho创建,采用LeRobot框架v3.0版本构建,于近期发布,主要用于机器人操作领域的研究。数据集聚焦于双机械臂(yam_bimanual)在一项特定任务(lego taxi)中的表现,共包含347个演示回合,总计937,993帧数据,涵盖了高分辨率的视觉观测(如手部、手腕和正前方摄像头)以及丰富的低维状态信息,如关节位置、速度、力矩、末端执行器位姿等。其核心研究问题在于通过模仿学习,使机器人能够从多模态感官输入中学习复杂操作技能,特别是在精细装配或搬运场景中的应用。该数据集提供了完整的数据记录格式和标准化接口,便于研究者直接用于训练和评估策略,对推动机器人学习领域的发展具有重要参考价值。
当前挑战
该数据集所面临的挑战主要源于机器人操作任务的复杂性和数据采集的高要求。领域问题方面,遥操作或自主装配任务要求机器人具备高度精确的协同控制能力和环境适应性,而当前算法在样本效率和泛化能力上仍有局限。构建过程中,数据采集需同步记录多路视频流和大量状态变量,确保时间戳对齐及数据一致性,且高频率(30fps)下的数据量庞大,增加了存储和处理的负担。此外,347个演示回合虽具一定规模,但可能不足以覆盖所有实际场景变化,存在分布偏移风险;标注和元信息的完善度也限制了数据的可复用性。这些挑战共同制约了策略学习的效果和数据的广泛适用性。
常用场景
经典使用场景
该数据集由LeRobot框架采集,聚焦于双机械臂协作拼装乐高积木的场景,具体任务涉及将乐高积木块精确放置到指定位置。数据以30Hz频率采集,包含左右腕部相机和第三方视角的视觉信息,以及丰富的状态与动作数据,如关节位置、速度、力、末端执行器位姿等。其经典使用场景是作为模仿学习与机器人操作策略训练的标准基准,研究者可基于此数据集训练视觉-运动策略,实现从观测到动作的端到端映射,验证算法在新任务上的泛化能力。
衍生相关工作
基于此数据集,衍生出了一系列具有影响力的研究工作。例如,利用其视觉与状态数据,研究者开发了跨模态表征学习方法,提升策略对环境变化的鲁棒性;部分工作将其作为基准测试,比较不同动作空间分解策略对双臂任务学习的影响;还有研究结合该数据集探索数据增强技术,如视角扰动和动力学随机化,以提升策略的泛化性。这些衍生工作共同丰富了机器人学习的方法论,推动了从单一数据集到通用操作智能的演进。
数据集最近研究
最新研究方向
该数据集聚焦于双臂机器人精细操作领域,特别是基于视觉的乐高积木拼装任务。随着具身智能与模仿学习的兴起,多模态传感融合与灵巧操作成为研究热点。数据集包含347个演示片段,涵盖左右腕部相机及全局视角的高清视觉信息,并同步记录关节位置、速度、力矩及末端执行器位姿等状态数据,为训练双臂协同控制策略提供了丰富样本。其基于LeRobot框架的标准化格式,有利于推动开源社区在机器人操作领域的复现与创新,对研究双臂协调、视觉-动作映射及泛化能力具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务