遇见数据集

PointMotionBench

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

PointMotionBench 是一个用于评估视频中3D点运动的基准数据集,整合了来自DAVIS、HOT3D和WorldTrack三个源数据集的样本,覆盖第一人称和第三人称两种视角的多样化场景。每个数据样本包含一个RGB视频剪辑、与之配对的人工验证自然语言描述,以及视频中物体的3D和2D跟踪表面点轨迹。数据集旨在为3D点运动预测、视频理解及相关多模态学习任务提供统一的评估基准。数据规模方面,共包含约2720个视频剪辑:DAVIS提供90个剪辑(24 fps,第三人称视角,涵盖多样室内外场景),HOT3D提供2475个剪辑(30 fps,第一人称视角,主要记录物体操纵场景),WorldTrack提供155个剪辑(30 fps,包含第一人称和演播室场景,并细分为adt_mini、ds_mini、po_mini和pstudio_mini四个子集,各子集剪辑长度在12到300帧之间)。数据集提供了2D和3D的点轨迹标注,主要用于研究、教育和基准测试目的。

PointMotionBench is a benchmark dataset for evaluating 3D point motion in videos. It integrates samples from three source datasets: DAVIS, HOT3D, and WorldTrack, covering diverse scenarios from both first-person and third-person perspectives. Each data sample includes an RGB video clip, paired with manually verified natural language descriptions, as well as 2D and 3D tracked surface point trajectories of objects in the video. This dataset aims to provide a unified evaluation benchmark for 3D point motion prediction, video understanding, and related multimodal learning tasks. In terms of scale, it contains approximately 2,720 video clips in total: DAVIS provides 90 clips (24 fps, third-person perspective, covering diverse indoor and outdoor scenarios); HOT3D provides 2,475 clips (30 fps, first-person perspective, mainly recording object manipulation scenarios); WorldTrack provides 155 clips (30 fps, including first-person and studio scenarios, which are further divided into four subsets: adt_mini, ds_mini, po_mini, and pstudio_mini, with clip lengths ranging from 12 to 300 frames per subset). The dataset provides 2D and 3D point trajectory annotations, and is primarily intended for research, education, and benchmarking purposes.

提供机构:
Allen Institute for AI
创建时间:
2026-06-12
搜集汇总
数据集介绍
PointMotionBench 数据集图片
构建方式
PointMotionBench的构建基于三大源数据集:DAVIS、HOT3D与WorldTrack,旨在汇聚多源的三维点运动数据。具体流程包括:首先下载各源数据集的原始视频和注释,并通过脚本将DAVIS的静态帧重建为MP4视频,对HOT3D进行TAR包下载、RGB帧提取与时间窗口裁剪,同时依据索引映射从WorldTrack的四个子场景中提取片段。最终,每个样本由一段RGB视频片段、每个物体的三维与二维追踪表面点,以及一条经人工校验的自然语言描述组成,形成统一的评估基准。
特点
该基准的最大特色在于其跨场景多样性,融合了第三人称的户外/室内动态场景(DAVIS)、以智能眼镜视角为中心的手部操作场景(HOT3D),以及涉及单人运动、多人交互与体育活动的室内外场景(WorldTrack)。所有样本均提供2D与3D双模态的物体表面点追踪,并配有人工验证的自然语言描述,确保语义与空间信息的统一。数据覆盖24-30帧/秒的视频片段,总计超2700个剪辑,为鲁棒评估提供了丰富样本。
使用方法
使用PointMotionBench需通过HuggingFace CLI下载注释、描述与索引文件,并配置相应路径。随后根据源数据集类型分别执行重建脚本:DAVIS部分需从官方源下载并转换帧;HOT3D需从BOP基准获取,支持分片并行提取以提升效率;WorldTrack需从St4RTrack仓库下载原始数据并依据索引映射提取。建议在研究与教育场景下遵循Ai2的责任使用指南,且视频源数据受各自许可约束,用户需自行核验合规性。
背景与挑战
背景概述
PointMotionBench是由艾伦人工智能研究所(Ai2)主导,联合多位学者于2026年创建的多源视频三维点运动评估基准。该数据集整合了DAVIS、HOT3D与WorldTrack三大来源,覆盖第三人称多样场景与第一人称物体操作情境,旨在系统评估模型对视频中三维点轨迹的预测能力。每份样本均包含RGB视频、精细追踪的三维与二维物体表面点坐标,以及经人工验证的自然语言描述,为动态场景理解与语言驱动的运动预测提供了标准化测试平台。作为首个聚焦三维点运动推理的综合性基准,PointMotionBench填补了该方向评估工具的空白,对计算机视觉中动作理解、人机交互及具身智能领域的研究具有重要推动意义。
当前挑战
PointMotionBench应对的核心领域挑战在于如何从视频中精确预测三维空间内物体点的持续运动轨迹,这要求模型同时理解动态场景的三维几何结构、时间关联性及语意上下文。数据构建过程中面临多重困难:首先,需从不同分辨率、帧率与视角的原始视频中重建一致的三维点追踪,尤其是DAVIS视频需从帧序列重构为mp4格式;其次,HOT3D与WorldTrack数据规模庞大,HOT3D包含2475个剪辑,需分片提取RGB图像并切割至基准时间窗;再者,跨数据集的标注统一性、物体遮挡处理及自然语言描述的可靠性验证,均对构建流程提出了严苛要求。
常用场景
经典使用场景
PointMotionBench作为首个统一评估视频中3D点运动追踪能力的基准数据集,其经典使用场景聚焦于多视角动态场景下的3D点轨迹预测与匹配任务。数据集汇集了DAVIS、HOT3D和WorldTrack三大来源,覆盖了第三人称自然场景、第一人称物体操作以及室内外混合运动场景,每个样本都提供了RGB视频片段、每帧物体的3D及2D表面点追踪结果,并辅以人工验证的自然语言描述。研究者可借此基准评估模型在非刚性物体形变、遮挡恢复、视角切换等复杂条件下的点级运动理解能力,为动态场景三维感知技术的标准化评测提供了权威参考。
实际应用
PointMotionBench的实际应用场景涵盖了机器人操作、增强现实交互和自动驾驶感知等多个前沿领域。在人机协作中,利用该数据集训练的模型可实时追踪第一人称视野中操作物体的3D表面点,辅助机械臂精确抓取或避让。在增强现实领域,通过精准的3D点运动预测,系统能将虚拟物坐标与动态现实世界严密对齐,实现自然的虚实融合。此外,该数据集还赋能了体育赛事中的三维动作分析,例如从WorldTrack子集的篮球或网球视频中解析运动员与球体的运动轨迹,为智能教练系统或自动回放生成提供核心技术支持。
衍生相关工作
PointMotionBench的发布催生了多项开创性研究工作,最直接的衍生成果为同团队提出的MolmoMotion框架,该工作首次实现了基于自然语言指令的3D点轨迹预测,其模型在PointMotionBench上进行了系统性评测。后续工作包括将Transformer架构引入点级运动建模的PointTrack-Transformer,以及利用扩散模型生成连续3D点轨迹的DDPM-Dynamics。在自监督学习领域,有研究基于该基准设计对比学习预训练任务,显著提升了跨场景的泛化性能。此外,该数据集还被应用于多模态大语言模型的评估中,用以验证视觉-语言模型对三维时空动态的理解深度,推动了动态场景理解与语言交互的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务