遇见数据集

mrrl-emcnei/eval_act_trossen_mojo_pnp_objlib

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人数据集,专为教程和评估设计。数据集基于trossen_ai_mobile机器人类型,包含5个episodes、总计2904帧、1个任务和15个视频。数据以parquet文件格式存储,视频为mp4格式,帧率为30fps。特征包括:动作数据(16维浮点数组,涵盖线速度、角速度以及左右机械臂的7个关节位置);观测状态(19维浮点数组,包括里程计位置(x, y, theta)、线速度、角速度和左右机械臂关节位置);图像观测来自三个摄像头(cam_high、cam_left_wrist、cam_right_wrist),每个视频分辨率为480x640x3,编码为av1;此外,还包含时间戳、帧索引、episode索引等元数据。数据集用于机器人学习任务,支持训练和评估模型。

许可证:Apache-2.0 任务类别: - 机器人学 标签: - LeRobot - 教程 - 评估 配置项: - 配置名称:默认 数据文件:data/*/*.parquet 本数据集基于[LeRobot](https://github.com/huggingface/lerobot)构建。 ## 数据集说明 - **主页**:[待补充更多信息] - **论文**:[待补充更多信息] - **许可证**:Apache-2.0 ## 数据集结构 `meta/info.json`: json { "codebase_version": "v2.1", "trossen_subversion": "v1.0", "robot_type": "trossen_ai_mobile", "total_episodes": 5, "total_frames": 2904, "total_tasks": 1, "total_videos": 15, "total_chunks": 1, "chunks_size": 1000, "fps": 30, "splits": { "train": "0:5" }, "data_path": "data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet", "video_path": "videos/chunk-{episode_chunk:03d}/{video_key}/episode_{episode_index:06d}.mp4", "features": { "action": { "dtype": "float32", "shape": [ 16 ], "names": [ "线速度", "角速度", "左关节0", "左关节1", "左关节2", "左关节3", "左关节4", "左关节5", "左关节6", "右关节0", "右关节1", "右关节2", "右关节3", "右关节4", "右关节5", "右关节6" ] }, "observation.state": { "dtype": "float32", "shape": [ 19 ], "names": [ "里程计x坐标", "里程计y坐标", "里程计航向角", "线速度", "角速度", "左关节0", "左关节1", "左关节2", "左关节3", "左关节4", "左关节5", "左关节6", "右关节0", "右关节1", "右关节2", "右关节3", "右关节4", "右关节5", "右关节6" ] }, "observation.images.cam_high": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "高度", "宽度", "通道数" ], "info": { "video.fps": 30.0, "video.height": 480, "video.width": 640, "video.channels": 3, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "has_audio": false } }, "observation.images.cam_left_wrist": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "高度", "宽度", "通道数" ], "info": { "video.fps": 30.0, "video.height": 480, "video.width": 640, "video.channels": 3, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "has_audio": false } }, "observation.images.cam_right_wrist": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "高度", "宽度", "通道数" ], "info": { "video.fps": 30.0, "video.height": 480, "video.width": 640, "video.channels": 3, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "has_audio": false } }, "timestamp": { "dtype": "float32", "shape": [ 1 ], "names": null }, "frame_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "episode_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "task_index": { "dtype": "int64", "shape": [ 1 ], "names": null } } } ## 引用 **BibTeX格式引用:** bibtex [待补充更多信息]

提供机构:
mrrl-emcnei
搜集汇总
数据集介绍
mrrl-emcnei/eval_act_trossen_mojo_pnp_objlib 数据集图片
构建方式
在机器人学习领域,高质量的数据集是推动算法发展的基石。本数据集基于LeRobot框架构建,专注于机器人操控任务的评估。数据采集依赖于Trossen Robotics的Mojo移动机械臂平台,通过遥操作方式进行演示。数据集共包含5个有效回合(episodes),总计2904帧数据,帧率为30 FPS。数据以Parquet格式存储,每回合数据独立成文件,并配有对应的高清视频记录,视频编码采用AV1格式,分辨率为480×640。元数据信息存储于JSON文件中,详细记录了特征维度、命名规范及数据路径,确保了数据结构的统一性与可复现性。
特点
该数据集的核心特点在于其多模态融合与精细化的状态表征。观测维度涵盖19维状态信息,包括移动底盘的里程计位姿、线速度与角速度,以及双臂各7个关节的角度数据。动作空间为16维,对应于底盘运动与双机械臂的联合控制。视觉模态则集成了三路高清摄像头(顶部及左右手腕视角),提供了丰富的环境与操作细节。数据集专为单任务场景设计,但通过多回合重复采集,为评估策略的稳定性与泛化能力提供了可靠基准。
使用方法
使用该数据集时,研究者可借助LeRobot库的数据加载接口,直接通过HuggingFace Datasets进行访问。数据集已预设训练集划分,覆盖全部5个回合,便于快速开始模型训练。在训练策略上,推荐将观测状态与多视角图像作为输入,16维连续动作作为预测目标。数据以Chunk分块形式组织,支持按回合索引或帧索引进行高效检索。此外,数据集遵循Apache-2.0开源协议,允许自由使用与二次开发,适合作为移动机械臂操控任务的标准评估基准。
背景与挑战
背景概述
在机器人学习领域,模仿学习与行为克隆技术依赖高质量、结构化的演示数据集来驱动具身智能体的策略学习。eval_act_trossen_mojo_pnp_objlib数据集由Hugging Face LeRobot社区创建,基于Trossen Robotics公司的Mojo移动机械臂平台,于2024年左右推出,旨在为轻量化机器人操作任务提供标准化的评估基准。该数据集聚焦于“拾取与放置”(Pick-and-Place)场景,采集了5个演示片段、共计2904帧、30fps的高清视频(包含高位相机及左、右腕部相机)与16维动作、19维状态信息。其核心研究问题在于评估低样本条件下模仿学习算法对非结构化物体库的操作泛化能力。作为LeRobot生态中的验证性数据集,它推动了可复现、低成本的机器人数据驱动研究范式,尤其对学术界的机器人算法对比与开放科学实践产生了积极影响。
当前挑战
该数据集需应对的核心领域挑战在于:机器人操作环境的高度非结构性与物体多样性使得从有限演示中学习鲁棒策略极为困难,特别是面对未见过物体的泛化问题。数据集构建过程中的挑战同样突出:其一,动作空间维度较高(16维),包含基座线速度与角速度及双臂各7个关节,导致控制策略需要协调移动与抓取;其二,演示数据采集高度依赖遥操作或动觉示教,易引入人为噪声与任务间风格不统一;其三,仅5段演示导致数据稀缺,使得算法需克服过拟合风险;其四,多视角视觉流的同步(3路640×480视频)对数据预处理与时间对齐提出了严格要求,且AV1编码格式的解码效率需优化以适应大规模训练流程。
常用场景
经典使用场景
在移动操作机器人研究领域,该数据集为基于模仿学习的行为克隆算法提供了关键的训练与评估素材。具体而言,它涵盖了Trossen Mojo移动机械臂在执行物体抓取与放置任务时的完整轨迹数据,包含来自高分辨率摄像头(cam_high、cam_left_wrist、cam_right_wrist)的多视角视觉输入、机器人本体状态(如里程计与关节角度)以及对应的16维动作指令。研究者利用这些时序对齐的帧序列,可训练端到端的视觉运动策略,使机器人学会从图像直接映射到控制指令,实现对目标物体的灵巧操作。
实际应用
在实际应用中,此数据集为Trossen Mojo机器人的自主操作技能部署搭建了桥梁。它能够赋能服务机器人在物流分拣、家庭整理或工业装配等场景中执行基于视觉引导的抓取与放置任务。通过在该数据集上预训练的模仿学习模型,机器人可快速适应新物体或布局,减少手动编程成本。此外,多视角图像数据支持了远程操作监控与故障诊断系统的开发,提升了人机协作的可靠性与安全性。
衍生相关工作
该数据集衍生了一系列影响深远的经典工作,包括基于扩散策略(Diffusion Policy)的动作生成模型、使用Transformer架构的多模态轨迹预测方法以及结合对比学习的视觉表示预训练框架。研究者还利用该数据构建了模仿学习与强化学习的混合训练管道,探索了以操作成功率为奖励的逆向强化学习范式。此外,它作为LeRobot生态系统的公开基准,催生了机器人基础模型(Robot Foundation Model)的评测协议,推动了跨机构数据集的标准化融合与知识共享。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务