遇见数据集

molmo-motion-1m

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

MolmoMotion-1M 是一个大规模、多领域的3D点轨迹标注数据集,专为3D点跟踪、轨迹预测及相关机器人视觉研究设计。该数据集整合了来自七个不同视频语料库的标注,涵盖第一人称操作、真实世界机器人遥操作、动态真实世界场景以及模拟器渲染等多种场景。核心内容是为每个视频片段提供精确的、经过运动过滤的3D点轨迹,大多数子数据集还提供对应的2D像素级轨迹。每个数据样本包含:与源视频帧对齐的3D/2D轨迹点序列、一个简短的动作描述文本、逐帧的相机姿态与内参,以及预设的训练/测试数据划分。数据以结构化格式组织,根目录下包含多个子数据集文件夹,其中annotations/目录下的JSON索引文件定义了视频片段元数据和数据集划分,实际的轨迹数据和相机参数存储在以视频ID命名的.npz文件中。3D轨迹和2D轨迹的轴顺序不同,存储格式因上游来源而异。数据集适用于计算机视觉和机器人学领域的多项任务,如3D点跟踪、长时轨迹预测、以物体为中心的视频理解,以及涉及第一人称视角和机器人操作场景的研究。数据集的混合许可证结构要求用户在使用每个子数据集前查阅对应的上游许可证条款。

MolmoMotion-1M is a large-scale, multi-domain 3D point trajectory annotation dataset designed specifically for 3D point tracking, trajectory prediction, and related robotic vision research. This dataset integrates annotations from seven distinct video corpora, covering various scenarios including first-person manipulation, real-world robotic teleoperation, dynamic real-world scenes, and simulator-rendered environments. The core content is to provide precise, motion-filtered 3D point trajectories for each video segment, and most sub-datasets also provide corresponding 2D pixel-level trajectories. Each data sample contains: 3D/2D trajectory point sequences aligned with source video frames, a brief action description text, per-frame camera poses and intrinsic parameters, as well as pre-defined train/test data splits. The data is organized in a structured format: the root directory contains multiple sub-dataset folders, where the JSON index file under the annotations/ directory defines video segment metadata and dataset splits, while actual trajectory data and camera parameters are stored in .npz files named after video IDs. The axis order of 3D trajectories and 2D trajectories differs, and storage formats vary depending on upstream sources. The dataset is applicable to multiple tasks in the fields of computer vision and robotics, such as 3D point tracking, long-term trajectory prediction, object-centric video understanding, and research involving first-person perspective and robotic manipulation scenarios. The dataset has a mixed license structure, requiring users to consult the corresponding upstream license terms before using each sub-dataset.

提供机构:
Allen Institute for AI
创建时间:
2026-06-11
搜集汇总
数据集介绍
molmo-motion-1m 数据集图片
构建方式
MolmoMotion-1M数据集整合了来自七个视频语料库的3D点轨迹标注,涵盖第一人称操作、真实世界机器人遥操作、动态真实场景以及仿真渲染等多个领域。每个视频片段均提供了经过运动滤波的3D轨迹(多数数据集还包含2D像素轨迹)、简短动作描述、逐帧相机参数以及训练/测试划分。数据集不直接重新托管原始视频,而是提供生成的标注和轨迹数据,并附带重构脚本,用户需依据上游数据集的许可协议自行获取原始资源。
特点
该数据集的核心特点在于其跨领域的大规模3D点轨迹标注,总量超过100万条轨迹,覆盖了从日常厨房操作到复杂机器人遥操作等多样化场景。数据格式统一但保留了各子数据集的独特性,如轨迹文件在3D与2D维度顺序上的差异(K, T, 3)与(T, K, 2),以及部分数据集(如stereo4d)仅提供轨迹索引而非完整坐标。每个子数据集均有独立的README文件详细说明模式与重构流程,确保使用的灵活性与可追溯性。
使用方法
用户可通过HuggingFace CLI下载数据集,并利用提供的tar压缩包解压获得组织好的目录结构。各子数据集的标注JSON文件作为单一真实来源,应优先通过annotations目录下的剪辑索引、分割文件访问,而非直接枚举tracks目录。使用时需仔细阅读对应子数据集的README以解析差异化的轨迹格式,并遵循各自开源许可(如CC BY-NC 4.0或CC BY 4.0)进行学术研究。重构脚本便于从上游源视频还原完整数据,但需注意版权合规性。
背景与挑战
背景概述
MolmoMotion-1M是一个由Allen Institute for AI(Ai2)主导,联合Apple、YouTube-VOS等多所机构于2026年创建的大规模三维点轨迹预测数据集。该数据集聚焦于机器人在复杂动态场景中对运动点进行长期追踪与轨迹预测的核心研究问题,旨在弥合语言指令与物理运动理解之间的鸿沟。通过整合七类涵盖第一人称操作、真实机器人遥操作及仿真环境的视频语料,MolmoMotion-1M为视觉-语言-动作联合建模提供了高质量的三维运动标注,推动了具身智能体在非结构化环境中的推理与规划能力,对机器人学与计算机视觉交叉领域产生了显著影响。
当前挑战
该数据集主要应对两方面的挑战。在领域问题层面,现有的轨迹数据集多局限于二维平面或静态场景,缺乏兼具三维度量精度、时间连续性与语言关联性的运动标注,难以支撑机器人从语言指令中理解物体运动模式并预测未来轨迹的需求。在构建过程中,研究者需从异构视频源中提取帧对齐的运动信息,克服不同采集设备、帧率及标注格式带来的对齐难题;同时,为避免重新分发原始视频数据,设计了可复现的追踪与相机参数重建脚本,确保数据使用合规性,这要求精细的版权管理与工程实现能力。
常用场景
经典使用场景
MolmoMotion-1M数据集的核心应用场景在于为三维空间中的点轨迹预测与跟踪任务提供大规模、多源异构的标注基准。该数据集汇聚了来自七类视频语料库的3D点轨迹注释,涵盖第一人称操作视频、真实机器人遥操作、动态现实场景及仿真环境渲染等内容。每个视频片段均配有运动滤波后的3D轨迹、简短的行动描述、每帧相机参数及训练/测试划分,从而构建了一个统一的、帧对齐的标准评估平台。研究者可借助该数据集训练模型,在复杂动态场景中学习点轨迹的时空演化规律,实现对物体运动的长程建模与推理。
解决学术问题
该数据集解决了当前三维视觉与机器人学习领域中长期存在的核心瓶颈——缺乏大规模、多样化且包含丰富运动信息的三维点轨迹标注资源。传统数据集多聚焦于二维像素跟踪或稀疏关键点检测,难以应对真实世界中物体运动的连续性与三维空间变异性。MolmoMotion-1M通过整合多个领域的高质量标注,使研究者能够系统性地探索三维点轨迹预测、视频中的动作理解以及第一人称视角下的运动规划等问题。其意义在于为跨场景、跨任务的知识迁移提供了统一的试验场,推动了从感知到预测的端到端智能体研究范式。
衍生相关工作
基于MolmoMotion-1M数据集已衍生出一系列具有影响力的经典工作。其中,《MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction》是该数据集的伴随研究,首次提出了结合语言指令引导的三维点轨迹预测框架,展示了多模态信息融合在运动建模中的潜力。后续工作包括面向机器人抓取规划的轨迹生成模型、基于点跟踪的视觉反馈控制算法,以及跨场景运动先验的自监督学习范式。此外,该数据集还为视频理解中的动作分割与意图推断提供了新的基准,激发了诸多关于时空特征提取与运动表征解耦的探索,形成了一个围绕三维点轨迹的活跃研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务