MVU-Eval-Data
收藏资源简介:
MVU-Eval是一个用于评估多模态大型语言模型在多视频理解方面的能力的综合性基准。它包含了1,824个问题-答案对,覆盖了4,959个来自不同领域的视频,旨在评估模型在基本感知和高阶推理任务上的表现。
MVU-Eval is a comprehensive benchmark for evaluating the multi-video understanding capabilities of multimodal large language models. It contains 1,824 question-answer pairs and covers 4,959 videos from diverse domains, aiming to assess model performance on both basic perceptual and high-order reasoning tasks.
MVU-Eval数据集概述
基本信息
- 许可证: Apache-2.0
- 标签: Multi-Video-Understanding
- 数据集名称: MVU-Eval
- 数据规模: 1K<n<10K
- 配置文件:
- 配置名称: default
- 数据文件:
- 分割: train
- 路径: mvu_eval_config.csv
数据集描述
MVU-Eval是首个用于评估多模态大语言模型(MLLMs)在多视频理解(Multi-Video Understanding)方面能力的综合基准。该数据集主要评估八项核心能力,包含1,824个精心设计的问答对,涵盖4,959个来自不同领域的视频。这些能力既包括基础感知任务,也包括高阶推理任务,并严格与自动驾驶中的多传感器合成和跨角度体育分析等实际应用场景对齐。
数据集内容
- 核心能力评估:
- 物体识别(OR)
- 空间理解(SU)
- 计数(Counting)
- 比较(Comparison)
- 知识密集型推理(KIR)
- 上下文学习(ICL)
- 检索增强生成(RAG)
- 时序推理(TR)
排行榜
- 随机选择基准: 26.0(总体得分)
- 闭源模型表现:
- Gemini 2.5 Pro: 58.4(总体得分)
- Gemini 1.5 Pro: 57.3(总体得分)
- Gemini 2.0 Flash: 56.3(总体得分)
- 开源模型表现:
- 模型大小 > 40B:
- Qwen2.5-VL-72B: 57.1(总体得分)
- InternVL3-78B: 50.6(总体得分)
- 8B < 模型大小 ≤ 40B:
- Qwen2.5-VL-32B: 55.6(总体得分)
- InternVL3-38B: 48.4(总体得分)
- 4B < 模型大小 ≤ 8B:
- Qwen2.5-VL-7B: 51.9(总体得分)
- VideoChat-Flash-7B: 48.5(总体得分)
- 模型大小 ≤ 4B:
- Qwen2.5-VL-3B: 46.2(总体得分)
- InternVL2.5-4B: 37.3(总体得分)
- 模型大小 > 40B:
评估资源
- VideoLLaMA3-7B评估代码:
- 主代码: https://huggingface.co/datasets/MVU-Eval-Team/MVU-Eval-Data/resolve/main/main_all_QA_video_llama3.py
- 环境依赖: https://huggingface.co/datasets/MVU-Eval-Team/MVU-Eval-Data/resolve/main/requirements.py
- MVU-Eval问答对: https://huggingface.co/datasets/MVU-Eval-Team/MVU-Eval-Data/resolve/main/MVU_Eval_QAs.json
依赖设置与执行
bash wget https://huggingface.co/datasets/MVU-Eval-Team/MVU-Eval-Data/resolve/main/main_all_MVU_Eval_llama3.py wget https://huggingface.co/datasets/MVU-Eval-Team/MVU-Eval-Data/resolve/main/requirements.py -O requirements.txt pip install -r requirements.txt apt-get update apt-get install -y ffmpeg
基本执行命令
python main_all_QA_video_llama3.py --input_dir <the dir to downloaded MVU_Eval> --model_name VideoLLaMA/VideoLLaMA3-7B --max_pixel 720 --nframes 32




