LVOmniBench
收藏资源简介:
LVOmniBench是一个专门为长格式音频和视频的跨模态理解设计的新基准。我们策划了一系列多样化的长视频,时长从10到90分钟不等,平均时长为2,069秒。这一时长比现有的音频-视觉理解基准的时长大六倍以上。我们手动构建了1,014个高质量的多选题,这些问题明确设计为需要跨音频和视觉模态的联合推理,从而促进对OmniLLMs的更全面评估。每个QA按难度级别排名,长音频-视频理解对当前专有和开源模型都提出了重大挑战。
LVOmniBench is a novel benchmark specifically designed for cross-modal understanding of long-form audio and video. We curated a collection of diverse long-form videos, ranging from 10 to 90 minutes in duration, with an average length of 2,069 seconds. This duration is over six times longer than that of existing audio-visual understanding benchmarks. We manually constructed 1,014 high-quality multiple-choice questions, which are explicitly designed to require joint reasoning across audio and visual modalities to facilitate more comprehensive evaluations of OmniLLMs. Each QA pair is ranked by difficulty level, and long-form audio-video understanding poses significant challenges to both current proprietary and open-source models.
LVOmniBench 数据集概述
数据集基本信息
- 数据集名称:LVOmniBench
- 核心定位:面向全模态大语言模型的长音频-视频理解评估基准
- 主要任务:音频-视频问答、长视频理解
- 发布状态:已发布
- 项目页面:https://kd-tao.github.io/LVOmniBench/
- 论文链接:暂未提供
- 数据集地址:https://huggingface.co/datasets/KD-TAO/LVOmniBench
- 联系邮箱:taokeda@westlake.edu.cn
数据集背景与目标
- 旨在解决现有评估主要针对短音频和视频片段(10秒至5分钟)的局限性。
- 针对现实应用需求,专注于长音频-视频输入的跨模态理解评估。
数据集关键特征
数据规模与构成
- 视频数量与时长:收集了多样化的长视频集合,视频时长范围在10至90分钟之间。
- 平均时长:视频平均时长为2,069秒。
- 时间尺度对比:与现有视听理解基准相比,时间尺度增加了六倍以上。
- 问答对数量:手动构建了1,014个高质量多项选择题。
数据质量与设计
- 问题设计:问题明确设计为需要跨音频和视觉模态进行联合推理。
- 难度分级:每个问答对均按难度等级进行排名。
- 评估挑战:长音频-视频理解对当前专有和开源模型均构成重大挑战。
评估方法
- 提示词格式:采用固定的提示词模板,要求模型直接输出代表选项的字母(A/B/C/D),不提供解释。
- 排行榜:支持通过联系邮箱提交结果以更新排行榜。
实验与结果
- 提供了不同全模态大语言模型在LVOmniBench上的主要评估结果。
- 提供了不同任务类型下的评估结果对比。
引用
- 引用信息暂未正式发布。




