FAVOR-Bench
收藏资源简介:
FAVOR-Bench是一个用于全面评估多模态大型语言模型在细粒度视频运动理解能力的基准数据集,包含1,776个带有结构化手动注释的视频,涵盖6个子任务的8,184个多项选择题-答案对。此外,还开发了开放评估方法和FAVOR-Train数据集,用于提升视频理解模型的性能。
FAVOR-Bench is a benchmark dataset for comprehensively evaluating the fine-grained video motion understanding capabilities of multimodal large language models. It contains 1,776 videos with structured manual annotations, encompassing 8,184 multiple-choice question-answer pairs across 6 subtasks. Additionally, open evaluation methods and the FAVOR-Train dataset have been developed to enhance the performance of video understanding models.
FAVOR-Bench 数据集概述
基本信息
- 数据集名称: FAVOR-Bench
- 发布日期: 2025年3月19日
- 数据集类型: 视频理解基准测试
- 论文链接: arXiv:2503.14935
- 数据集链接: HuggingFace
- 官方网站: FAVOR-Bench
数据集简介
FAVOR-Bench是一个用于细粒度视频运动理解的综合基准测试,旨在评估多模态大语言模型(MLLMs)在视频运动理解方面的能力。数据集包含1,776个视频,带有结构化的人工标注,涵盖多种运动类型。
数据集内容
- 视频数量: 1,776个
- 标注类型: 结构化运动标注
- 任务类型:
- 封闭式任务: 8,184个多选题对
- 开放式任务: 使用LLM-free和GPT辅助的标注评估方法
- 子任务数量: 6个
评估任务
- 封闭式评估: 包括多选题对,用于评估模型的运动理解能力。
- 开放式评估: 使用两种标注评估方法,增强基准测试的可解释性和可重复性。
数据集统计
- 任务类型分布: 封闭式和开放式任务的分布
- 运动数量分布: 每个视频的运动序列长度分布
- 运动词汇统计: 词云统计
- 正确答案分布: 封闭式任务的正确答案选项分布
- 视频时长分布: 视频时长的分布情况
- 问题数量分布: 每个视频对应的问题数量分布
相关数据集
- FAVOR-Train: 包含17,152个视频,带有细粒度运动标注,用于模型微调。
实验结果
- 模型比较: 21种最先进的MLLMs在FAVOR-Bench上的表现比较
- 基准比较: FAVOR-Bench与其他基准测试的比较结果
使用示例
- 下载视频: 从HuggingFace下载FAVOR-Bench视频
- 安装依赖: 按照官方仓库说明安装依赖并下载检查点
- 运行推理: 使用提供的脚本进行推理,结果将保存在指定目录中
引用
bibtex @misc{tu2025favor, title={FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding}, author={Chongjun Tu and Lin Zhang and Pengtao Chen and Peng Ye and Xianfang Zeng and Wei Cheng and Gang Yu and Tao Chen}, year={2025}, eprint={2503.14935}, archivePrefix={arXiv}, primaryClass={cs.CV} }




