遇见数据集

DynAction4D

收藏
arXiv2026-08-19 更新2026-08-21 收录
数据链接:
官方服务:

资源简介:

DynAction4D是一个专为4D视觉语言对齐而构建的基准数据集,由莫拉图瓦大学等机构联合创建,旨在弥合动态点云序列与自然语言之间的语义鸿沟。该数据集包含约54,729个时空序列,覆盖单一人体动作、物体交互及杂乱场景三大类,每个序列均配有精细的文本描述。其构建过程基于HumanML3D和Humoto数据集,通过SMPL参数生成点云帧,并利用Unity引擎进行多样化渲染与增强。该数据集主要用于训练和评估4D视觉语言模型,尤其聚焦于动态场景中几何结构与时间演化的联合推理,为解决零样本动作-文本检索和4D视觉问答等任务提供了关键支撑。

DynAction4D is a benchmark dataset specifically constructed for 4D vision-language alignment, co-developed by Molatua University and other institutions. It aims to bridge the semantic gap between dynamic point cloud sequences and natural language. This dataset contains approximately 54,729 spatiotemporal sequences, covering three major categories: single human actions, object interactions, and cluttered scenes. Each sequence is paired with elaborate textual descriptions. Its construction is based on the HumanML3D and Humoto datasets, where point cloud frames are generated via SMPL parameters, and diversified rendering and augmentation are performed using the Unity engine. This dataset is primarily used for training and evaluating 4D vision-language models, with a particular focus on joint reasoning of geometric structures and temporal evolution in dynamic scenes, providing critical support for solving tasks such as zero-shot action-text retrieval and 4D visual question answering.

创建时间:
2026-08-19
原始信息汇总

CL4D 数据集详情

数据集概述

CL4D (Contrastive Language–4D Pretraining) 是首个直接处理动态点云的基础4D视觉编码器,通过对比学习目标将时空几何表示与自然语言描述进行对齐。该工作由斯里兰卡莫拉图瓦大学、新加坡-麻省理工学院研究与技术联盟中心(SMART)及新加坡科技研究局(A*STAR)的研究团队联合提出,发表于 ECCV 2026。

核心贡献

  1. CL4D:首个直接操作动态点云的4D基础视觉编码器,通过对比学习实现动态环境中零样本的运动到文本和文本到运动检索。
  2. 4DVLM:首个直接基于4D点云进行语言生成的4D视觉语言模型,无需依赖2D图像、2D视频或静态3D点云。

DynAction4D 数据集

为支持语言-4D表示学习,研究团队构建了 DynAction4D 大规模动态人体动作点云数据集,包含四个不同部分:

数据集分段 描述 规模
HumanOnly 捕捉多样环境中的人体动作(行走、跳跃、舞蹈等) 23k训练序列,4k测试序列
ObjInteractions 聚焦涉及物体交互的人体动作(源自Humoto) 包含73个物体,736种交互类型
Cluttered 在杂乱环境中人体动作,包含不同物体位置和密度条件 未提及具体规模
4D-VQA 专门用于评估下游4D时空推理能力,通过Gemini提示生成Unity渲染视频序列 未提及具体规模

方法与架构

采用两阶段训练策略:

阶段1:对比语言-4D预训练(CL4D)

  • 时空视觉编码器 直接操作动态点云 (x, y, z, t)
  • 包含帧级 Pointnet 点编码器、空间Transformer(建模帧内全局空间关系)和时间Transformer(建模帧间时间依赖)
  • 通过对称交叉熵目标将4D视觉嵌入与文本嵌入对齐

阶段2:4D大视觉语言模型(4DVLM)

  • 预训练的视觉编码器作为冻结基础编码器
  • 投影后的4D视觉标记与 Vicuna-7B(LLaVA架构)融合
  • 实现动态环境中的复杂空间、时间和基于动作的推理

实验结果

运动-文本检索性能

CL4D 在 DynAction4D 各分段及真实世界 RH20T 基准上均优于现有方法,最高可提升约 16.75% R@1

数据集分段 CL4D 文本→运动检索 (R@1, Batch) CL4D 运动→文本检索 (R@1, Batch)
DynAction4D-HumanOnly 70.32% 68.62%
DynAction4D-ObjInteractions 49.40% 46.97%
DynAction4D-Cluttered 55.07% 51.94%

视觉问答(VQA)性能

4DVLM 在所有评估指标上均优于前沿视频VLM(如Gemini和GPT-5),验证了3D空间基础的重要性:

方法 BLEU ↑ ROUGE-1 ↑ ROUGE-2 ↑ ROUGE-L ↑ METEOR ↑ BERTScore ↑ SimCSE ↑
VideoLLaMA 3 0.0437 0.3382 0.1174 0.2951 0.2481 0.4317 0.8158
Gemini 3.0 Flash 0.0447 0.3389 0.1156 0.2812 0.2673 0.4057 0.8009
Gemini 3.1 Pro 0.0300 0.2763 0.0923 0.2427 0.1933 0.3736 0.7690
GPT-5 0.0184 0.1935 0.0403 0.1612 0.1347 0.3191 0.7432
4DVLM(本文) 0.0729 0.3857 0.1563 0.3324 0.3152 0.4459 0.8189

资源信息

  • 论文(Paper)已发布
  • 补充材料(Supplementary)已发布
  • 代码(Code)即将推出(Coming Soon)
  • 演示(Demo)即将推出(Coming Soon)
搜集汇总
数据集介绍
DynAction4D 数据集图片
构建方式
DynAction4D数据集的构建依托于多源动态场景数据的融合与系统性增强。其HumanOnly段基于HumanML3D的SMPL参数,通过坐标变换与随机增强生成多样化人体点云序列;ObjInteractions段利用Humoto数据集,模拟人与物体的交互场景;Cluttered段则将人体动作置于布满随机物体的杂乱环境中,以提升场景复杂性。此外,通过Gemini生成的四维视觉问答段,为模型训练提供了丰富的语言标注。
使用方法
DynAction4D可用于训练和评估四维视觉语言模型。在预训练阶段,其用于对比学习,对齐点云序列与文本描述;在下游任务中,支持动作识别、运动检索及四维视觉问答。数据集的分段设计允许针对特定场景进行模块化测试,如评估模型在物体交互或杂乱环境下的表现。其开源发布为四维场景理解研究提供了标准化基准。
背景与挑战
背景概述
DynAction4D数据集由斯里兰卡莫拉图瓦大学与新加坡科技研究局等机构的研究团队于2026年构建,旨在解决动态三维场景中视觉-语言推理的基础性难题。该数据集包含四类片段:纯人体动作、物体交互、杂乱场景及4D视觉问答,涵盖约2.7万段动态点云序列及15.9万对问答,为对比学习预训练和4D视觉语言模型提供了大规模基准。作为首个支持语言对齐的4D动态点云数据集,DynAction4D推动了具身智能体对时空几何与运动语义的联合理解,为后续研究奠定了重要基石。
当前挑战
该领域面临的核心挑战在于,现有视觉编码器多局限于静态图像、静态点云或二维视频,难以同时捕获动态场景中的空间结构与运动演化,导致跨模态检索与推理性能受限。数据集构建过程中亦遭遇多重困难:需将SMPL参数转换为Unity兼容格式并进行坐标系统变换;从人类动作捕捉数据生成高保真4D点云序列,需处理随机体形、纹理、放置等增强以提升多样性;杂乱场景需程序化生成复杂物体布局并划分训练/测试集;同时还要为大规模序列生成高质量的自然语言描述与QA对,确保语义准确且覆盖动作、时序与身体空间属性。
常用场景
经典使用场景
DynAction4D作为首个面向语言与4D动态场景对齐的基准数据集,其经典应用聚焦于训练和评估跨模态检索模型。该数据集包含时间演化的4D点云序列与对应的自然语言描述,覆盖单纯人体动作、物体交互以及杂乱环境等多样场景,为对比学习框架提供了丰富的正负样本。研究者利用其进行文本-动作双向往检索任务,即在给定文本描述时准确检索对应的4D动作序列,或反之从4D序列中检索匹配的文本,显著提升了模型对动态几何结构与运动语义的联合理解能力。
解决学术问题
该数据集有效解决了现有视觉编码器局限于静态2D图像、缺乏时间建模的2D视频或静态3D点云,无法同时捕捉空间结构与运动演化的学术难题。通过提供大规模语言-4D对齐数据,DynAction4D支持了CL4D这类首个直接在动态点云上训练的对比学习4D视觉编码器的开发,实现了零样本跨模态检索,并作为基础编码器支撑4D视觉语言模型的推理任务,填补了动态3D场景下语言接地推理的研究空白,推动了具身智能对物理世界时空动态的深层认知。
实际应用
在实际应用中,DynAction4D所支撑的4D视觉语言模型可直接部署于需要实时理解动态三维环境的系统,如机器人操作、自动驾驶或增强现实交互。其点云表示不依赖RGB外观,具备隐私保护优势,适合在敏感场景中应用。此外,CL4D在真实机器人动作数据集RH20T上的优异表现,证明了该数据集训练的编码器能够泛化至非人类主体的动作理解,为机器人从语言指令到物理动作的映射提供了可靠基础,有望加速人机协作与智能监控等领域的落地。
数据集最近研究
最新研究方向
DynAction4D数据集的最新研究方向聚焦于推动4D视觉-语言预训练与推理的前沿探索,其核心在于通过对比学习范式将动态点云序列与自然语言描述在共享嵌入空间中对齐,从而构建首个能够直接处理时变三维几何信息的4D视觉编码器CL4D。在此基础上,研究进一步拓展至4D视觉语言模型4DVLM,使其能够在不依赖2D图像或视频的情况下,直接对动态点云进行空间与时间的联合推理,显著提升了对人类动作、物体交互及杂乱场景的理解能力。该数据集支持从动作识别到跨模态检索、视觉问答等多层次任务,其最新研究不仅验证了4D表示在复杂动态环境中的优越性,也为具身智能体的物理世界理解与交互提供了关键的数据基础与方法论支撑。
相关研究论文
  • 1
    CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes斯里兰卡莫拉图瓦大学; 新加坡-麻省理工学院研究与技术联盟中心; 新加坡科技研究局; CNRS@CREATE · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务