遇见数据集

LongVQUBench

收藏
arXiv2026-07-01 更新2026-07-03 收录
数据链接:
官方服务:

资源简介:

LongVQUBench是由南洋理工大学创建的一个综合性基准数据集,专门用于评估大规模视觉语言模型在长期视频质量理解方面的能力。该数据集包含超过1200个视频,涵盖电影、纪录片、监控录像、第一人称记录和动画等多种类型,视频时长从几分钟到近两小时不等,并配备了1500个多项选择和开放式问答对,以支持验证和测试。其构建过程基于从公开数据集和媒体库中收集的长视频,通过系统性地应用空间和时间失真来模拟真实退化模式,并采用分层评估框架和针孔失真问答范式来探究模型的感知推理能力。该数据集主要应用于视频质量评估和人工智能领域,旨在解决现有基准在长视频质量理解方面的不足,推动模型在感知保真度、时间连贯性和累积退化方面的进步,以实现更接近人类水平的长期视频理解。

LongVQUBench is a comprehensive benchmark dataset created by Nanyang Technological University, specifically designed to evaluate the capabilities of large-scale vision-language models in long-form video quality understanding. This dataset contains over 1200 videos spanning diverse genres including films, documentaries, surveillance footage, first-person recordings, animations and more, with durations ranging from several minutes to nearly two hours. It is equipped with 1500 multiple-choice and open-ended question-answer pairs to support model validation and testing. The dataset is built upon long videos collected from public datasets and media libraries, where systematic spatial and temporal distortions are applied to simulate real-world degradation patterns. A hierarchical evaluation framework and the pinhole distortion-based question-answering paradigm are adopted to explore the perceptual reasoning abilities of models. This dataset is mainly applied in the fields of video quality assessment and artificial intelligence, aiming to address the shortcomings of existing benchmarks in long-form video quality understanding, and promote the advancement of models in terms of perceptual fidelity, temporal coherence and cumulative degradation, so as to achieve long-form video understanding that is closer to human-level performance.

提供机构:
南洋理工大学
创建时间:
2026-07-01
原始信息汇总

LongVQUBench 数据集详情

LongVQUBench 是一个用于评估大视觉语言模型(LVLMs)长时视频质量理解能力的基准测试。该论文已被 ECCV 2026 收录。

核心信息

  • 数据规模:包含 1,200 个多样化视频,时长平均约 12分钟;以及 1,500 个用于验证和测试的问答对(包括多项选择题和开放性问题)。
  • 视频来源:涵盖电影、纪录片、监控录像、自我中心视角录像、动画、信息图、新闻、vlog 和烹饪等多种类型。部分视频源自 LongVideoBench、MLVU 和 LongVideo-Reason-Eval 等数据集。

评估框架

数据集设计了三个层级递进的评估级别,用以测试模型从局部失真检测到全局感知推理的能力:

  1. 局部事件质量理解(LQU):检测、定位并评估单一、有界时域内的失真事件(如局部模糊、闪烁或压缩噪声)的严重程度。
  2. 跨事件质量推理(CQR):比较、关联并整合分布在较长时域跨度内的多个失真事件,评估其累积效应和时间关系。
  3. 全局质量理解(GQU):对整个视频进行全局感知判断,跟踪质量趋势,识别主要退化类型,并评估整体感知稳定性。

此外,一个名为 针式失真问答(NDQA) 的任务范式被嵌入到上述所有三个层级中,通过在视频中稀疏插入微弱的空间或时间伪影来探测模型的细粒度检测和推理能力。

实验评估

14 个最先进的LVLMs进行了广泛实验,结果显示:随着视频长度和推理深度的增加,模型性能显著下降,表明它们在长程时间整合和感知归因方面能力有限。

相关资源

  • 数据集🤗 数据集(根据页面信息推断)
  • 代码GitHub(根据页面信息推断)
  • 排行榜Leaderboard(根据页面信息推断)
搜集汇总
数据集介绍
LongVQUBench 数据集图片
构建方式
LongVQUBench的构建源于对长视频质量理解评估空白的深刻洞察。研究团队首先从LongVideoBench、MLVU和LongVideoReason等公开数据集中汇聚超过1200段涵盖电影、纪录片、监控录像、第一人称视角及动画内容的多样视频,时长从数分钟跨越至两小时。为确保评估的严谨性,所有视频经过精细筛选与标注,划分为高、中、低三个质量层次。在此基础上,引入14种空间失真与4种时间失真,通过控制强度与嵌入位置,在高质量源视频中植入受控退化,构建了分层级的问答对,并辅以针尖失真问答范式,从而催生了这一综合性评估体系。
特点
该数据集最鲜明的特征在于其层级化与精细化的评估架构。它创新性地设计了局部事件质量理解、跨事件质量推理与全局质量理解三个逐级递进的评估层级,分别考察模型对单一失真事件的感知、对多个时空离散退化事件的整合推理以及对整段视频的全局质量判断。此外,内置的针尖失真问答范式通过在长视频中稀疏嵌入空间或时间伪影,精准探测模型对细微失真的敏感度。这种多层次、多维度、主客观结合的评估设计,使其能够系统揭示大语言模型在时间整合与感知归因方面的深层局限。
使用方法
使用LongVQUBench时,研究者需对每段长视频以固定帧率进行均匀采样,获得时序化的帧序列,并配合预先设计的提示模板输入至评估模型中。提示需包含视频总时长、采样帧率及总帧数等上下文信息,并严格限定输出格式。评估涵盖选择题与开放式问答两种形式,前者针对检测、定位、分类等客观维度,后者侧重推理与解释能力。研究建议采用分层抽样的验证与测试集划分策略,并可在不同帧采样预算下对比模型表现,以全面衡量其长时视频质量理解的性能天花板。
背景与挑战
背景概述
LongVQUBench由新加坡南洋理工大学的Arpita Nema、Hanwei Zhu、Xi Zhang和Weisi Lin等人于2026年提出,旨在填补大型视觉语言模型在长期视频质量理解领域的评估空白。现有基准多聚焦于短片段与孤立失真,忽视了长视频中时序连续性、累积退化与推理复杂性的核心挑战。该基准汇聚了超过1200段来自电影、纪录片、监控及动画等多元场景的视频,并引入分层评估框架,涵盖局部事件理解、跨事件推理与全局质量感知三个递进层次,为系统性评估LVLMs的长期感知推理能力奠定了坚实基础。
当前挑战
LongVQUBench面临的核心挑战在于如何评估模型对长视频中感知保真度与时间连贯性的深层推理能力。现有LVLMs在全局质量理解方面表现薄弱,随视频时长与推理深度增加,性能显著下降。构建过程亦颇具难度,需从海量素材中筛选并注入14种空间与4种时间失真,确保失真自然嵌入而不破坏语义流。同时,设计涵盖检测、定位、分类等多维度的1500道问答对,并经由专家多轮校验以保障时空标注的精准性与解释的一致性,这为高质量基准的构建提出了严苛要求。
常用场景
经典使用场景
在多媒体质量评估与计算机视觉交叉领域,LongVQUBench被设计为衡量大型视觉语言模型(LVLM)对长时视频质量理解能力的综合性基准。其经典使用场景在于构建一个层次化评估框架,系统性地检验模型对局域失真事件(如局部模糊或闪烁)的感知、对跨事件质量退化的推理,以及对整体视频质量随长时间变化的全局把握。研究者和工程师利用该基准,在包含电影、纪录片、监控录像等多种内容的超1200段视频上,通过多选与开放式问题,剖析模型在不同时间尺度下的感知推理深度。
解决学术问题
该数据集填补了现有视频质量基准仅关注短片段和孤立失真的核心学术空白,开创性地解决了长时视频中时间连续性、累积退化与推理复杂性三大难题。LongVQUBench引入的“变体问答”(NDQA)范式与三级递增评估体系(LQU、CQR、GQU),使得对感知忠实度、时间连贯性及多事件交互的量化成为可能。通过对14个顶尖LVLM的实证分析,它揭示了模型随视频长度和推理深度增加而性能显著下降的关键局限,为探索长距离时间整合与感知归因能力提供了奠基性工具。
衍生相关工作
LongVQUBench的设计理念已催生一系列后续研究工作。在模型层面,推动了如VQA2等专用于视频质量问答的模型开发,将传统MOS预测转化为可解释的质量属性理解。在方法创新上,启发NDQA范式被应用于时间敏感的多模态检索与推理任务中。同时,该基准的层次化评估结构显著影响了后续长视频理解数据集(如MLVU、LongVideoBench)的构建策略,促使它们纳入感知维度与时间推理指标,进一步拓展了从“语义理解”到“质量理解”的研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务