遇见数据集

video_datasets

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

MotionBench 是一个全面的评估基准数据集,旨在评估视频理解模型在细粒度运动理解方面的能力。该数据集针对当前基准中未充分探索的关键能力——细粒度运动理解——而设计,旨在填补这一研究空白。其核心是通过六种主要的运动导向问题类型来评估模型的运动层面感知能力。数据内容来源于多样化的渠道,包括网络收集的视频、公开数据集(如MedVid、SportsSloMo、HA-ViD)以及通过Unity3生成的自合成视频,以确保能够广泛代表现实世界的视频内容分布。数据集包含一个Caption子集,提供了5000个带有手动标注的细粒度运动描述的视频,这些描述在基准标注过程中经过标注和双重检查,标注密度达到每秒12.63个词。数据集遵循CC-BY-NC-SA-4.0许可证,仅用于学术研究,禁止任何形式的商业用途。该数据集适用于视频问答(VideoQA)、多模态理解等任务,是 benchmarking 视频运动理解模型的工具。

MotionBench is a comprehensive evaluation benchmark dataset designed to assess the fine-grained motion understanding capabilities of video understanding models. This dataset is specifically developed for the key capability of fine-grained motion understanding, which has been insufficiently explored in existing benchmarks, aiming to fill this research gap. Its core lies in evaluating the motion-level perceptual abilities of models through six major motion-oriented question types. The dataset content is sourced from diverse channels, including web-collected videos, public datasets (e.g., MedVid, SportsSloMo, HA-ViD), and self-synthesized videos generated via Unity3, to ensure broad representation of real-world video content distributions. The dataset includes a Caption subset, which contains 5,000 videos paired with manually annotated fine-grained motion descriptions. These descriptions underwent annotation and double-checking during the benchmark labeling process, with an annotation density of 12.63 words per second. The dataset is released under the CC-BY-NC-SA-4.0 license, and is exclusively for academic research use, with all forms of commercial usage prohibited. This dataset is applicable to tasks such as video question answering (VideoQA) and multimodal understanding, and serves as a benchmarking tool for video motion understanding models.

创建时间:
2026-05-25
原始信息汇总

MotionBench 数据集概述

MotionBench 是一个综合评估基准,旨在评估视觉语言模型(VLMs)对视频中细粒度运动的理解能力。该数据集涵盖了六大类运动导向问题类型,并从多种来源收集数据,确保对真实世界视频内容的广泛代表性。

核心特性

  1. 核心能力评估:聚焦六大类细粒度运动理解的核心能力,评估模型的运动级感知水平。
  2. 数据多样性:从网络、公开数据集以及通过 Unity3 自合成视频中收集数据,覆盖真实应用场景的广泛分布。
  3. 高质量标注:经过精心的人工标注和多阶段质量控制流程,确保数据集的可靠性。

许可协议

  • 许可证:CC-BY-NC-SA-4.0
  • 用途限制:仅限学术研究用途,禁止任何形式的商业使用。数据集不拥有原始视频文件的版权。

数据获取与使用

下载

  • 从该仓库下载 video_info.meta.jsonl 文件。
  • 需先安装 video2dataset 库。

数据集组成

  • 描述数据集:包含 5,000 个视频,并配有手动标注的细粒度运动描述,标注密度达到每秒 12.63 个词。
  • 公开数据集:对于公开数据(如 MedVid、SportsSloMo、HA-ViD),不提供原始视频文件,用户需参考其 GitHub 仓库获取映射文件和视频剪辑准备说明。

评价与提交

引用

如需引用,请参考提供的 BibTeX 条目: bibtex @misc{hong2024motionbench, title={MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models}, author={Wenyi Hong and Yean Cheng and Zhuoyi Yang and Weihan Wang and Lefan Wang and Xiaotao Gu and Shiyu Huang and Yuxiao Dong and Jie Tang}, year={2024}, eprint={2501.02955}, archivePrefix={arXiv}, primaryClass={cs.CV} }

搜集汇总
数据集介绍
video_datasets 数据集图片
构建方式
MotionBench数据集由清华大学团队构建,旨在填补当前视频理解模型在细粒度运动感知能力评估上的空白。数据集的视频来源广泛,涵盖网络爬取、公开数据集以及通过Unity3D引擎自主合成的视频片段,确保了真实世界视频内容的多样性。所有数据均经过精细的人工标注和多阶段质量控制流程,每个视频都附带高度密集的动态描述信息,标注密度达到每秒12.63词,从而构建出可靠且高质量的评估基准。
特点
该数据集最显著的特点在于其聚焦于细粒度运动理解的六项核心能力评估,涵盖运动级感知的全面维度。数据来源的多样性使其能够代表广泛的真实应用场景,而自合成视频进一步增强了数据分布的覆盖范围。此外,MotionBench采用严格的CC-BY-NC-SA-4.0许可协议,仅限学术研究使用,并提供了公开的排行榜和评估工具,便于研究者进行模型性能的横向对比。
使用方法
使用MotionBench时,用户需先从HuggingFace仓库下载`video_info.meta.jsonl`元数据文件,并安装`video2dataset`工具以获取视频数据。对于来自公开数据集的视频(如MedVid、SportsSloMo、HA-ViD),需参照GitHub仓库中的映射文件自行准备视频片段。安装完成后,通过运行`scripts/test_acc.py`脚本即可生成评估结果文件,并可将其提交至在线排行榜进行性能比较。
背景与挑战
背景概述
随着视觉语言模型(VLMs)在视频理解领域取得显著进展,细粒度运动理解作为一项关键认知能力,在现有基准测试中仍鲜有深入探索。为弥合这一研究空白,清华大学研究团队于2025年提出了MotionBench数据集,该工作发表于CVPR 2025,由Wenyi Hong、Yean Cheng等作者共同完成。MotionBench旨在系统评估模型对视频中细微运动模式的理解能力,涵盖来自网络、公开数据集及Unity3D合成视频的多样化数据源,通过六类运动导向的核心问题类型构建评测框架。其高质量的人工标注与多阶段质量控制流程,为视频运动理解研究提供了可靠标杆,推动了视觉语言模型在动态场景感知领域的发展。
当前挑战
MotionBench所解决的领域核心挑战在于,现有基准过度关注静态对象识别与场景语义,忽视了视频中运动轨迹、速度变化、动作交互等细粒度运动信息的评估,导致模型在真实动态任务中的能力短板难以被揭示。在数据集构建过程中,研究者面临数据来源多样性与标注一致性之间的平衡难题,需从网络视频、公开数据集与合成视频中提取具有代表性的运动片段,并设计符合人类直觉的六类运动问题。此外,人工标注细粒度运动描述需达到12.63词/秒的高密度标准,加之多阶段质量控制的严格流程,显著增加了构建成本与复杂度。
常用场景
经典使用场景
MotionBench作为一个专为精细运动理解设计的评测基准,在视频理解领域扮演着不可或缺的角色。它通过六大核心运动导向问题类型,全面评估视觉语言模型在运动层级感知上的能力。该数据集整合了来自网络、公开数据集及Unity3D自合成视频的多元素材,确保了真实世界视频内容的广泛代表性。其经典使用场景是对各类视频理解模型进行系统性的细粒度运动理解测试,例如评估模型能否准确识别物体的运动轨迹、速度变化或交互动作的动态细节,从而揭示模型在运动感知方面的优劣。
实际应用
在实际应用领域,MotionBench可为诸多需要精细运动理解的场景提供技术支撑。例如,在智能视频监控中,模型需准确识别人的异常运动(如跌倒、奔跑)或物体的精确位移;在体育赛事分析中,实时追踪运动员的动作细节以辅助裁判决策或战术分析;在自动驾驶中,精准理解其他车辆和行人的运动状态是实现安全行驶的关键。MotionBench通过标准化的评估框架,助力这些应用中的模型不断迭代优化,提升其在动态视觉环境下的感知精度和可靠性。
衍生相关工作
围绕MotionBench数据集,学术界已衍生出多项创新工作。其CVPR 2025接收的论文首次提出了细粒度运动理解的基准框架,后续研究可在其基础上开发面向特定运动类型(如周期性运动、复杂交互)的增强型模型,或结合时间注意力机制提升运动特征的提取能力。此外,该数据集的高质量人工标注(每秒钟12.63词的运动描述)也激发了关于运动描述生成的跨模态研究,推动了视频语言模型从语义理解向动态运动解析的演进,形成了一系列改善运动感知策略的经典工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务