RoboVQA:机器人长时序视频视觉问答数据集
收藏官方服务:
资源简介:
RoboVQA 是 DeepMind 联合 Meta 推出的机器人长时序视频视觉问答数据集,采集 3 栋办公楼内机器人、人类执行任务的 238 小时真实视频,包含 82 万余组视频文本配对、2.9 万条独特指令,分为中短时序与数十步长周期规划两类任务,覆盖空间、时序、物理常识、多步骤任务规划八大推理维度
提供机构:
极市
RoboVQA 是 DeepMind 联合 Meta 推出的机器人长时序视频视觉问答数据集,采集 3 栋办公楼内机器人、人类执行任务的 238 小时真实视频,包含 82 万余组视频文本配对、2.9 万条独特指令,分为中短时序与数十步长周期规划两类任务,覆盖空间、时序、物理常识、多步骤任务规划八大推理维度