LvBench
收藏资源简介:
LvBench是一个用于多功能多模态问答的长视频理解基准数据集。它通过三个关键特征区别于现有的长视频问答数据集:1)扩展的时间范围:考虑从70秒到4小时的视频,涵盖单场景、多场景和全场景上下文;2)多样化的问题类型和模态:引入六种不同的问题类型,评估各种感知和认知能力,利用视频帧和字幕;3)高质量标注:采用严格的人工标注
LvBench is a long video understanding benchmark dataset for multi-functional and multimodal question answering. It distinguishes itself from existing long-form video question answering datasets via three core characteristics: 1) Extended temporal coverage: It covers videos ranging from 70 seconds to 4 hours, encompassing single-scene, multi-scene and full-scene contexts; 2) Diverse question types and modalities: Six distinct question types are introduced to evaluate various perceptual and cognitive capabilities, leveraging both video frames and subtitles; 3) High-quality annotations: Strict manual annotation procedures are adopted.
LvBench 数据集概述
数据集简介
LvBench 是一个用于长视频理解的多模态问答基准数据集,专注于评估模型在长视频内容中的理解能力。
核心特征
- 扩展的时间跨度:视频时长范围从70秒到4小时,涵盖单场景、多场景和全场景上下文
- 多样化问题类型和模态:包含六种不同的问题类型,评估多种感知和认知能力,同时利用视频帧和字幕
- 高质量标注:采用严格的人工标注流程
数据获取
- 问答数据和视频可从 Lvbench 下载
评估方法
- 支持使用 Qwen2.5-VL 模型进行评估
- 评估脚本路径:test_code_qwenvl25/eval.sh
相关资源
- 论文链接:https://arxiv.org/pdf/2312.04817
- Hugging Face 数据集地址:https://huggingface.co/datasets/Lu1111/Lvbench




