LSDBench
收藏资源简介:
LSDBench数据集旨在评估长视频视觉语言模型(VLM)的采样效率。它包含基于小时长视频的多选题问答对,重点关注具有高必要采样密度(NSD)的短时动作。数据集包含1304个问答对,400个视频,平均视频长度为45.39分钟(范围从20.32到115.32分钟),平均目标片段时长为3分钟。
The LSDBench dataset is designed to evaluate the sampling efficiency of long-video vision-language models (VLMs). It consists of multiple-choice question-answer pairs sourced from hour-long videos, with a particular focus on short-duration actions that demand high necessary sampling density (NSD). The dataset includes 1,304 question-answer pairs spanning 400 videos, with an average video duration of 45.39 minutes (ranging from 20.32 to 115.32 minutes) and an average target segment duration of 3 minutes.
LSDBench: Long-video Sampling Dilemma Benchmark
概述
LSDBench是一个专注于长视频任务中采样困境的基准测试,旨在评估长视频视觉语言模型(VLMs)的采样效率。该基准通过设计高必要采样密度(NSD)的任务,解决低密度采样可能遗漏关键信息而高密度采样引入冗余的问题。
关键特性
-
LSDBench数据集:
- 包含基于小时级视频的多选题问答对。
- 聚焦于长视频中短时动作的高密度采样需求。
- 数据规模:
- 问答对数量:1304
- 视频数量:400
- 平均视频长度:45.39分钟(范围20.32至115.32分钟)
- 平均目标片段时长:3分钟
-
Reasoning-Driven Hierarchical Sampling (RHS):
- 两阶段框架,通过聚焦重要片段提升长视频处理效率。
-
Semantic-Guided Frame Selector (SGFS):
- 轻量级模块,无需问题先验即可选择视觉信息量更高的帧。
数据集使用
-
环境设置:
- 需要Python 3.9.2环境,依赖项通过
requirements.txt安装。 - 支持Flash Attention优化。
- 需要Python 3.9.2环境,依赖项通过
-
视频下载:
- 需从Ego4D数据集获取,使用Ego4D CLI工具下载。
- 下载步骤包括申请许可证、配置AWS CLI、安装Ego4D CLI工具。
-
视频预处理:
- 提供脚本进行视频下采样处理,需安装ffmpeg。
- 支持自定义目标帧率(建议不低于2fps)。
-
评估:
- 提供两种评估模式:
- 标准评估(使用RHS-Qwen2.5-VL模型)
- Oracle设置评估(使用Qwen2.5-VL模型)
- 提供两种评估模式:
引用
bibtex @article{qu2025lsdbench, title = {Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?}, author = {Qu, Tianyuan and Tang, Longxiang and Peng, Bohao and Yang, Senqiao and Yu, Bei and Jia, Jiaya}, journal = {arXiv preprint arXiv:2503.12496}, year = {2025} }




