Video-MME-v2
收藏资源简介:
Video-MME-v2是一个用于全面视频理解的基准数据集,旨在推动下一代视频理解模型的评估。它包含多级评估维度,从信息检索到跨时间推理,并通过严格的标注流程和质量控制确保数据质量。数据集基于3,300多小时的人工标注,旨在解决现有评估范式无法捕捉真实视频理解能力的问题。
Video-MME-v2 is a benchmark dataset for comprehensive video understanding, designed to advance the evaluation of next-generation video understanding models. It encompasses multi-level evaluation dimensions ranging from information retrieval to cross-temporal reasoning, and ensures data quality through rigorous annotation procedures and quality control mechanisms. Built upon over 3,300 hours of manual annotations, this dataset is intended to address the limitation that existing evaluation paradigms fail to capture the genuine video understanding capabilities of models.
Video-MME-v2 数据集概述
数据集基本信息
- 数据集名称:Video-MME-v2
- 发布年份:2026年
- 数据集地址:https://huggingface.co/datasets/MME-Benchmarks/Video-MME-v2
- 相关论文地址:https://arxiv.org/abs/2604.05015
- 项目主页地址:https://video-mme-v2.netlify.app/
- 排行榜地址:https://video-mme-v2.netlify.app/#leaderboard
数据集简介
Video-MME-v2 是一个为驱动下一代视频理解模型而设计的渐进式、鲁棒的基准测试。它旨在解决现有基准测试分数饱和,但排行榜性能与实际用户体验之间仍存在明显差距的问题。该数据集基于超过 3,300 人工小时 的标注工作构建。
核心创新点
- 渐进式多级评估维度:将视频理解系统性地分解为三个渐进层级:
- 层级 1(多点信息聚合):检索、提取和整合分散在视频中的多模态线索(帧、音频、字幕)。
- 层级 2(时序理解):关注动态演化和因果关系,要求模型准确捕捉状态变化、动作序列和事件逻辑。
- 层级 3(时序复杂推理):要求结合多模态时序信息与外部先验知识(世界知识、社会常识)来执行复杂推理任务。
- 分组非线性评估机制:将问题组织成以“能力一致性”和“推理连贯性”为目标的小组。每组包含 4 个相互关联的问题,采用非线性评分方案,分数不仅取决于单个准确性,还取决于整体一致性和推理循环的完整性。
- 严格的数据标注与质量控制:建立了全面的数据标注流程,涉及 60 多位专家的 3,300 人工小时。
数据集内容与结构
- 许可证:仅用于学术研究。禁止任何形式的商业使用。未经事先批准,不得分发、发布、复制、传播或修改 Video-MME-v2 的全部或部分内容。
- 数据规模:
- 800 个视频(存储在 40 个 zip 存档中)。
- 800 个字级字幕文件(JSONL 格式,带时间戳)。
- 一个
test.parquet文件,包含 3,200 个人工标注的问答对(每个视频 4 个问题,按组组织)。
- 字幕格式:每个字幕文件 (
<video_id>.jsonl) 包含带时间戳的字级条目。 json {"text": "Hello", "start_time": 0.5, "end_time": 0.8}
评估流程与配置
- 评估工具支持:已在 VLMEvalKit 中内置支持,并正在集成到 LMMs-Eval。
- 提示词格式:提供两种主要提示词格式,一种用于标准评估,另一种用于思维/推理设置。
- 可用数据集配置:
配置 帧数 字幕 推理 Video-MME-v2_64frame64 ✗ ✗ Video-MME-v2_1fps1 fps ✗ ✗ Video-MME-v2_64frame_subs64 拼接 ✗ Video-MME-v2_1fps_subs1 fps 拼接 ✗ Video-MME-v2_64frame_subs_interleave64 交错 ✗ Video-MME-v2_1fps_subs_interleave1 fps 交错 ✗ Video-MME-v2_64frame_reasoning64 ✗ ✓ Video-MME-v2_64frame_reasoning_subs64 拼接 ✓ Video-MME-v2_64frame_reasoning_subs_interleave64 交错 ✓ - 独立评估脚本:提供独立的推理与评估脚本 (
evaluation/test_video_mme_v2.py),可使用 HuggingFace Transformers 进行端到端运行,无需外部评估工具包。 - 评分机制:使用分组非线性评分机制。问题被组织成 4 个一组,每组根据以下之一进行评分:
- 相关性(能力一致性):基于组内正确答案数量的指数分数映射。
- 逻辑性(推理连贯性):基于链式的分数,奖励连续的正确答案,尊重组内的依赖结构。
- 排行榜提交:若要将模型添加到排行榜,请将模型响应发送至 bradyfu24@gmail.com。
实验与分析要点
- 非线性评分的优势:与平均准确率相比,非线性评分能更好地反映模型在回答相关问题时的一致性,从而揭示模型的鲁棒性。
- 思维模式的影响:
- 文本模态有助于解锁推理能力。
- 当前的思维模式在某些情况下仍可能导致性能下降,表明视频 MLLMs 的思维机制仍有很大改进空间。
- 能力雷达图分析:
- 音频带来显著增益。
- 在长时序推理方面存在优势。
- 各维度仍有明显的改进空间。
引用
如果本工作对您的研究有帮助,请考虑引用相关论文。




