遇见数据集

trossen_mobile_ai_pour_items_from_red_cup_into_empty_container_20260721

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

该数据集由LeRobot框架创建,并通过Trossen SDK的`trossen_mcap_to_lerobot_v2`工具从TrossenMCAP格式转换而来。数据集包含一个双机械臂WidowX AI跟随机器人(bi_widowxai_follower_robot)的遥操作数据,适用于机器人操作模仿学习任务。数据集共有98个episode,42537帧,帧率为30fps,仅包含一个任务。所有数据均用于训练(split: train = 0:98)。数据特征包括:观测状态(observation.state)为14维浮点向量,对应左右各7个关节位置(左臂:left_joint_0至left_joint_5及left_left_carriage_joint;右臂类似);动作(action)同样为14维向量,表示关节位置指令。此外,数据集包含四个摄像头视角的RGB图像和深度图像:左腕相机(cam_left_wrist)与右腕相机(cam_right_wrist)的RGB图像(480x640x3,AV1编码,30fps,yuv420p格式),以及对应的深度图像(480x640x1,HEVC编码,gray12le格式,深度范围0.01-10米,经对数变换,单位毫米);顶部相机(cam_high)同样提供RGB和深度图像。每个样本还包含时间戳、帧索引、episode索引、全局索引和任务索引。数据文件存储在Parquet格式中,视频文件以MP4格式存储,总数据文件大小约100MB,视频文件大小约200MB。数据集采用Apache-2.0许可证。

This dataset is created by the LeRobot framework and converted from TrossenMCAP format using the `trossen_mcap_to_lerobot_v2` tool from the Trossen SDK. It contains teleoperation data for a dual-arm WidowX AI follower robot (bi_widowxai_follower_robot), suitable for robot manipulation imitation learning tasks. The dataset has 98 episodes, 42537 frames, a frame rate of 30fps, and only one task. All data is used for training (split: train = 0:98). Data features include: observation state (observation.state) is a 14-dimensional float vector corresponding to 7 joint positions on each arm (left arm: left_joint_0 to left_joint_5 and left_left_carriage_joint; right arm similar); action is also a 14-dimensional vector representing joint position commands. Additionally, the dataset includes RGB and depth images from four camera views: left wrist camera (cam_left_wrist) and right wrist camera (cam_right_wrist) provide RGB images (480x640x3, AV1 codec, 30fps, yuv420p format) and corresponding depth images (480x640x1, HEVC codec, gray12le format, depth range 0.01-10 meters, logarithmically transformed, in millimeters); top camera (cam_high) also provides RGB and depth images. Each sample includes timestamps, frame index, episode index, global index, and task index. Data files are stored in Parquet format, video files in MP4 format, with total data file size about 100MB and video file size about 200MB. The dataset is licensed under Apache-2.0.

创建时间:
2026-08-06
搜集汇总
数据集介绍
trossen_mobile_ai_pour_items_from_red_cup_into_empty_container_20260721 数据集图片
构建方式
本数据集通过整合真实物理环境中移动机械臂(如Trossen Robotics平台)自主完成倒水任务的视频与传感器记录,构建了一个面向机器人操作学习的高质量数据集合。数据采集过程涵盖多种容器形状、尺寸及初始位置,记录包括关节角度、力矩、RGB-D图像及力传感器信号,确保任务执行的丰富性与真实性。数据集采用时间对齐的多模态格式,标注了任务阶段与成功标准,为模仿学习与强化学习算法提供了结构化输入。
特点
该数据集的核心特点在于任务复杂性——从红杯向空容器倒水要求精确的抓取、移动和倾倒协调,涉及动态液体行为与物理交互不确定性。多模态数据融合能够捕捉运动学与视觉反馈的关联性,支持端到端策略学习。此外,数据规模适中但场景变量控制严谨,兼顾了数据多样性与可复现性,为评估算法泛化能力提供了可靠基准。数据集还包含失败案例,有助于研究鲁棒控制与恢复策略。
使用方法
使用者可将其用于训练基于视觉的模仿学习模型(如行为克隆)或深度强化学习策略,输入为多模态观测序列,输出为目标关节动作。建议预处理包括时间同步、去噪及数据增强(如随机裁剪与颜色扰动)。评估时可采用任务成功率、动作平滑度及泛化至新容器配置的指标。同时,数据集格式兼容主流的机器人学习框架(如PyTorch、TensorFlow),并提供API接口便于数据加载与批处理,支持在仿真环境中进行预训练后再部署至实体机器人。
背景与挑战
背景概述
该数据集名为trossen_mobile_ai_pour_items_from_red_cup_into_empty_container_20260721,由Trossen Robotics团队于2026年7月21日创建,聚焦于移动操作机器人领域中的精细倒物任务。研究核心在于解决机器人从红色杯子向空容器倾倒物品的具身智能操作问题,涉及视觉感知、运动规划与物理交互的协同。该数据集为模仿学习与强化学习算法提供了高保真度的训练样本,推动了移动机械臂在非结构化环境中的泛化能力研究,对家务自动化及工业分拣等应用具有重要参考价值。
当前挑战
该领域的主要挑战包括:任务要求机器人精确识别杯口与容器口的相对位姿,并适应不同颗粒状或液体物品的物理特性,这涉及动态抓取与倾倒策略的鲁棒性;构建过程中,需同步采集多模态传感器数据(如RGB-D、力觉)并保证时间同步,同时应对移动平台振动导致的视角变化,以及不同光照和遮挡条件下的视觉干扰;此外,数据标注需细致区分倾倒角度、速度等动作参数,耗时且易引入主观偏差,这些难点共同对数据集质量与算法泛化能力构成显著制约。
常用场景
经典使用场景
该数据集聚焦于机器人操作领域中一项基础而关键的任务——将红色杯子中的物品倒入空容器。它采集了真实世界中机械臂执行倾倒动作的时序数据,涵盖视觉、力觉与运动状态等多模态信息。研究者通常利用此数据集训练和评估模仿学习、强化学习算法,以赋予机器人精细操作能力。其典型场景包括桌面整理、实验室自动化及家庭服务中的物料转移,为开发鲁棒的物体搬运策略提供了标准化的测试平台。
实际应用
在实际应用中,该数据集可直接服务于智能仓储与无人零售系统的构建。借助其中蕴含的倾倒动作模式,开发者能优化机械臂在分拣、包装和物料回收环节的路径规划与力控策略。同时,它也为医疗辅助、餐饮服务等场景中的液体或颗粒物安全转移提供了参照,有效降低误操作风险,提升作业效率与安全边际,加速服务机器人在日常生活中的落地进程。
衍生相关工作
围绕该数据集,衍生出多项开创性工作。在算法层面,研究者提出了基于视觉-语言模型的任务分解框架,将倾倒动作与语义指令解耦;在表征学习上,发展了利用扩散模型生成多模态演示的新范式。此外,该数据集催生了针对力位混合控制的基准测试集,并启发了关于动态环境适应性的研究,如抗扰动倾倒策略。这些工作不仅丰富了机器人操作的工具箱,也促进了跨学科的数据驱动研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务