DynAction4D
收藏资源简介:
DynAction4D是一个专为4D视觉语言对齐而构建的基准数据集,由莫拉图瓦大学等机构联合创建,旨在弥合动态点云序列与自然语言之间的语义鸿沟。该数据集包含约54,729个时空序列,覆盖单一人体动作、物体交互及杂乱场景三大类,每个序列均配有精细的文本描述。其构建过程基于HumanML3D和Humoto数据集,通过SMPL参数生成点云帧,并利用Unity引擎进行多样化渲染与增强。该数据集主要用于训练和评估4D视觉语言模型,尤其聚焦于动态场景中几何结构与时间演化的联合推理,为解决零样本动作-文本检索和4D视觉问答等任务提供了关键支撑。
DynAction4D is a benchmark dataset specifically constructed for 4D vision-language alignment, co-developed by Molatua University and other institutions. It aims to bridge the semantic gap between dynamic point cloud sequences and natural language. This dataset contains approximately 54,729 spatiotemporal sequences, covering three major categories: single human actions, object interactions, and cluttered scenes. Each sequence is paired with elaborate textual descriptions. Its construction is based on the HumanML3D and Humoto datasets, where point cloud frames are generated via SMPL parameters, and diversified rendering and augmentation are performed using the Unity engine. This dataset is primarily used for training and evaluating 4D vision-language models, with a particular focus on joint reasoning of geometric structures and temporal evolution in dynamic scenes, providing critical support for solving tasks such as zero-shot action-text retrieval and 4D visual question answering.
CL4D 数据集详情
数据集概述
CL4D (Contrastive Language–4D Pretraining) 是首个直接处理动态点云的基础4D视觉编码器,通过对比学习目标将时空几何表示与自然语言描述进行对齐。该工作由斯里兰卡莫拉图瓦大学、新加坡-麻省理工学院研究与技术联盟中心(SMART)及新加坡科技研究局(A*STAR)的研究团队联合提出,发表于 ECCV 2026。
核心贡献
- CL4D:首个直接操作动态点云的4D基础视觉编码器,通过对比学习实现动态环境中零样本的运动到文本和文本到运动检索。
- 4DVLM:首个直接基于4D点云进行语言生成的4D视觉语言模型,无需依赖2D图像、2D视频或静态3D点云。
DynAction4D 数据集
为支持语言-4D表示学习,研究团队构建了 DynAction4D 大规模动态人体动作点云数据集,包含四个不同部分:
| 数据集分段 | 描述 | 规模 |
|---|---|---|
| HumanOnly | 捕捉多样环境中的人体动作(行走、跳跃、舞蹈等) | 23k训练序列,4k测试序列 |
| ObjInteractions | 聚焦涉及物体交互的人体动作(源自Humoto) | 包含73个物体,736种交互类型 |
| Cluttered | 在杂乱环境中人体动作,包含不同物体位置和密度条件 | 未提及具体规模 |
| 4D-VQA | 专门用于评估下游4D时空推理能力,通过Gemini提示生成Unity渲染视频序列 | 未提及具体规模 |
方法与架构
采用两阶段训练策略:
阶段1:对比语言-4D预训练(CL4D)
- 时空视觉编码器 直接操作动态点云 (x, y, z, t)
- 包含帧级 Pointnet 点编码器、空间Transformer(建模帧内全局空间关系)和时间Transformer(建模帧间时间依赖)
- 通过对称交叉熵目标将4D视觉嵌入与文本嵌入对齐
阶段2:4D大视觉语言模型(4DVLM)
- 预训练的视觉编码器作为冻结基础编码器
- 投影后的4D视觉标记与 Vicuna-7B(LLaVA架构)融合
- 实现动态环境中的复杂空间、时间和基于动作的推理
实验结果
运动-文本检索性能
CL4D 在 DynAction4D 各分段及真实世界 RH20T 基准上均优于现有方法,最高可提升约 16.75% R@1:
| 数据集分段 | CL4D 文本→运动检索 (R@1, Batch) | CL4D 运动→文本检索 (R@1, Batch) |
|---|---|---|
| DynAction4D-HumanOnly | 70.32% | 68.62% |
| DynAction4D-ObjInteractions | 49.40% | 46.97% |
| DynAction4D-Cluttered | 55.07% | 51.94% |
视觉问答(VQA)性能
4DVLM 在所有评估指标上均优于前沿视频VLM(如Gemini和GPT-5),验证了3D空间基础的重要性:
| 方法 | BLEU ↑ | ROUGE-1 ↑ | ROUGE-2 ↑ | ROUGE-L ↑ | METEOR ↑ | BERTScore ↑ | SimCSE ↑ |
|---|---|---|---|---|---|---|---|
| VideoLLaMA 3 | 0.0437 | 0.3382 | 0.1174 | 0.2951 | 0.2481 | 0.4317 | 0.8158 |
| Gemini 3.0 Flash | 0.0447 | 0.3389 | 0.1156 | 0.2812 | 0.2673 | 0.4057 | 0.8009 |
| Gemini 3.1 Pro | 0.0300 | 0.2763 | 0.0923 | 0.2427 | 0.1933 | 0.3736 | 0.7690 |
| GPT-5 | 0.0184 | 0.1935 | 0.0403 | 0.1612 | 0.1347 | 0.3191 | 0.7432 |
| 4DVLM(本文) | 0.0729 | 0.3857 | 0.1563 | 0.3324 | 0.3152 | 0.4459 | 0.8189 |
资源信息
- 论文(Paper)已发布
- 补充材料(Supplementary)已发布
- 代码(Code)即将推出(Coming Soon)
- 演示(Demo)即将推出(Coming Soon)

- 1CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes斯里兰卡莫拉图瓦大学; 新加坡-麻省理工学院研究与技术联盟中心; 新加坡科技研究局; CNRS@CREATE · 2026年




