MMR-V
收藏资源简介:
MMR-V是一个用于视频多模态深度推理的基准数据集,具有长距离多帧推理、超越感知、可靠性和混淆性等特征。数据集包含317个视频和1,257个任务,要求模型对视频的不同帧进行深入推理和分析。
MMR-V is a benchmark dataset for video multimodal deep reasoning, featuring characteristics including long-range multi-frame reasoning, reasoning beyond basic perception, reliability, and ambiguity. The dataset includes 317 videos and 1,257 tasks, which require models to perform in-depth reasoning and analysis on different frames of the videos.
MMR-V: 视频多模态深度推理基准数据集概述
数据集简介
MMR-V是一个针对多模态大语言模型(MLLMs)在视频中定位多帧证据并进行多模态推理能力的基准测试数据集。该数据集专注于挑战模型在长范围、多帧推理以及超越直接感知的隐藏信息推理能力。
核心特征
- 长范围多帧推理:要求模型分析可能远离问题帧的证据帧。
- 超越感知的推理:问题无法仅通过直接感知回答,需推理隐藏信息。
- 可靠性:所有任务均手动标注,参考真实用户理解以符合共同认知。
- 混淆性:精心设计的干扰项标注策略以减少模型捷径。
数据集规模
- 包含317个视频
- 1,257个任务
评估方法
-
数据加载: shell huggingface-cli download JokerJan/MMR-VBench --repo-type dataset --local-dir MMR-V --local-dir-use-symlinks False
-
视频提取: shell cat videos.tar.part.* > videos.tar tar -xvf videos.tar
-
评估设置:
- 解压后的视频文件需放置在
MMR-V/videos目录下 - 其他模型推理细节见
utils/video_utils.py
- 解压后的视频文件需放置在
-
评估脚本: shell python evaluation/server_evaluation_on_MMR.py --model_name gemini-2.5-flash-preview-04-17 --api_url https://XXX/v1/chat/completions --api_key sk-XXX --with_cot --frame_count 32
实验成果
- 主要结果:展示了不同模型在MMR-V上的表现对比
- 任务分析:呈现了模型在不同类型任务上的性能分布
模型响应示例
- 展示了Gemini和o4-mini模型对样本任务的多模态思维链(MCoT)响应
- 重点比较了模型在视频内容推理深度上的差异
- 示例完整视频:https://www.youtube.com/watch?v=g1NuAfkQ-Hw




