ActionGenome4D
收藏资源简介:
ActionGenome4D是由德克萨斯大学达拉斯分校和印度理工学院德里分校联合构建的4D时空场景数据集,通过升级Action Genome视频数据形成。该数据集采用π3模型进行单目视频的3D重建,生成世界坐标系下的定向3D边界框,并包含遮挡或相机运动导致的暂时未观测对象的密集关系标注。数据集包含几何标注(GDINO检测+SAM2分割)和语义标注(基于VLM的关系伪标注),旨在支持世界场景图生成任务,解决传统帧中心方法在物体消失和时空一致性方面的局限性,适用于机器人交互和物理推理等需要长期场景理解的领域。
ActionGenome4D is a 4D spatiotemporal scene dataset co-developed by the University of Texas at Dallas and the Indian Institute of Technology Delhi, upgraded from the Action Genome video dataset. This dataset adopts the π3 model to conduct monocular video 3D reconstruction, generating oriented 3D bounding boxes in the world coordinate system, and includes dense relational annotations for temporarily unobserved objects caused by occlusion or camera motion. The dataset contains geometric annotations (GDINO detection + SAM2 segmentation) and semantic annotations (relationship pseudo-annotations based on VLMs), aiming to support the world scene graph generation task. It addresses the limitations of traditional frame-centric methods in terms of object disappearance and spatiotemporal consistency, and is applicable to domains requiring long-term scene understanding such as robot interaction and physical reasoning.
WorldSGG数据集概述
数据集基本信息
- 数据集名称: ActionGenome4D
- 任务背景: 面向时空世界场景图生成(World Scene Graph Generation, WSGG)任务,该任务涉及在连续的4D场景设置中预测物体的3D边界框及其关系属性(如注意力、空间邻近性和接触)。
- 数据来源: 单目视频
- 状态: 正在更新中,预计于2026年6月发布
数据集内容与特点
- 数据类型: 提供丰富的4D标注,涵盖物体及其随时间变化的动态交互。
- 场景范围: 涵盖多种室内环境。
- 标注维度: 包含时间维度,构成4D(3D空间+时间)场景表示。
数据处理与构建流程
- 4D场景构建流程: 处理单目视频以构建环境的综合4D表示,整合了3D物体检测、跟踪和跨时间的度量空间投影。
- 人工标注与校正:
- 关系校正: 提供人工介入的界面,用于审查和细粒度修改生成的关系,确保高质量的真实标注。
- 3D地面校正: 提供3D标注界面,用于将重建的点云与地面对齐。通过旋转和平移调整的多步骤过程,校正地面对齐,确保场景中所有物体在世界坐标系中的准确性。
相关模型与评估
- WSGG模型架构: 包含专用编码器(结构、运动、相机姿态)、未观测物体表示(如PWG、MWAE和4DST变体)以及时空解码器,用于预测4D中的复杂物体关系。
- 评估方法: 包含多模态大语言模型评估流程,利用视觉语言模型生成粗略的事件图,并采用由Graph RAG支持的大语言模型从视频片段推断连续的世界场景图。
发布计划
- 预计发布时间: 2026年6月
- 预计发布内容:
- ActionGenome4D标注
- 训练好的模型检查点
- VLM评估代码




