InfiniBench
收藏资源简介:
InfiniBench是由阿卜杜拉国王科技大学等机构创建的一个综合性长视频理解基准数据集,旨在评估大型多模态模型在处理非常长视频时的性能。该数据集包含108.2K个问题-答案对,视频来源包括电影和日常电视节目,平均时长为76.34分钟。数据集的创建过程结合了视频帧、剧本和摘要等多种信息源,通过GPT-4自动生成问题和答案。InfiniBench主要应用于评估模型在长视频理解中的表现,特别是在人类中心的问题解决和深度上下文理解方面。
InfiniBench is a comprehensive long video understanding benchmark dataset created by institutions including King Abdullah University of Science and Technology (KAUST). It aims to evaluate the performance of large multimodal models when processing extremely long videos. This dataset contains 108.2K question-answer pairs, with video sources covering movies and daily TV programs, and an average duration of 76.34 minutes. The dataset was developed by integrating multiple information sources such as video frames, scripts and summaries, with questions and answers automatically generated via GPT-4. InfiniBench is primarily used to evaluate model performance in long video understanding, particularly in human-centric problem-solving and deep contextual comprehension.
InfiniBench 数据集概述
数据集简介
InfiniBench 是一个用于非常长视频理解的全面基准测试,旨在评估大型多模态模型在长视频理解方面的能力。该数据集包含以下特点:
- 最长视频时长:平均时长为 76.34 分钟。
- 最多的问答对:共有 108.2K 个问答对。
- 问题多样性:涵盖九种不同的技能,包括多选题和开放式问题。
- 以人为中心:视频来源包括电影和日常电视节目,问题设计旨在测试人类水平的理解和推理能力。
数据集技能分类
InfiniBench 包含九种不同的技能,具体包括:
- 全局外观
- 场景过渡
- 以及其他七种技能(具体名称未在提供的内容中详细说明)
数据集统计信息
- 视频数量和时长:来自 TVQA 和 MovieNet 数据集的视频数量及其时长。
- 问题数量:各类技能的问题数量。
- 问题和答案长度:问题和答案长度的直方图分布。
数据集比较
InfiniBench 在问答对数量、视频数量和平均时长方面均超过现有视频理解基准。
数据集结果
- 整体性能:不同模型在 InfiniBench 上的表现相对较低,突显了该基准的独特挑战。
- 特定技能性能:不同技能的性能差异显著,其中场景过渡和电影剧透问题对模型来说最具挑战性。
数据集链接
- 论文:arXiv
- 代码:GitHub
- 数据集:Hugging Face




