人形机器人抓取水杯过程多模态采集数据
收藏资源简介:
本数据集原始数据来源于VR遥操作机械臂完成办公室取水杯全过程,全程基于VR遥控系统同步采集各类实操数据,可直接用于VLA(视觉语言动作)模型训练。数据采集核心维度包含机械臂本体运动数据、多视角视觉图像数据、任务语义提示词数据及全局时间戳数据,所有数据以机械臂控制周期帧为最小时间粒度,依托设备全局控制频率与视觉采集频率完成同步记录,保障多类数据时序匹配。可支撑算法训练、验证与性能评估,主要解决机械臂抓取路径规划优化、视觉目标定位跟踪、关节运动学与动力学控制、末端抓取策略鲁棒性验证等问题,全方位支撑VLA模型视觉、语言、动作的联合建模训练。本数据集的原始数据为人形机器人抓取水杯过程中,机械臂关节状态数据、多视角视觉数据、任务语义数据、辅助数据,数据来源为LeRobot 框架通过其内置的机器人控制接口与人形机器人硬件建立通信,实时采集抓取过程中的关节角度、末端执行器动作指令、相机图像路径及时间戳等多模态原始数据。 为保障数据集的有效性、时序合理性及VLA模型训练适配性,对原始采集数据进行清洗、同步对齐与标签标准化处理,具体流程如下:(1)异常无效数据清洗:批量剔除视觉摄像头丢帧、VR遥操通信延迟、机械臂关节状态跳变、指令缺失等异常无效数据,过滤操作失误、中断、卡顿等无效作业样本,仅保留完整、流畅、真实的办公室取水杯操作全过程数据。(2)多模态数据帧同步:以统一时间步(timestamp)和设备帧率为基准,搭建全局统一时间轴,对机械臂关节状态数据、多视角图像视觉数据、任务提示词语义数据三类核心模态数据进行精准时间对齐,严格保证视觉、语言、动作数据的时序因果性,符合VLA时序建模训练要求。(3)训练标签标准化映射:采用时序监督学习标签规则,完成数据集标签构建,核心规则为:以当前帧的视觉图像、任务提示词、机械臂关节状态作为模型输入特征,对应下一帧的机械臂关节状态作为当前帧的训练标签,形成标准的时序配对训练样本。同时增设任务结束标志位(体现在左右抓夹指令字段中),若当前帧为取水杯任务完成后的收尾帧,统一将结束标志位置为1,其余正常操作帧结束标志位默认为0,区分作业过程帧与任务终止帧。 最终形成的数据内容如下:一是机械臂关节状态数据,包含各关节实时角度、位置、运动速率等编码器反馈状态数据;二是多视角视觉数据,同步采集机械臂搭载的胸口摄像头、左手摄像头、右手摄像头的实时原始图像帧数据;三是任务语义数据,即适配VLA训练的场景任务提示词,统一标注办公室取水杯任务相关语义信息;四是辅助数据,包含全局精准时间戳、机械臂末端执行器(夹爪)位姿及运行状态数据。




