SVHighlights
收藏资源简介:
SVHighlights 是一个用于极长体育视频亮点检测的基准数据集,包含 320 个全长体育广播视频及其对应的官方亮点视频,涵盖美式足球、棒球、篮球、冰球、赛车、橄榄球、足球和排球等 8 种体育类别。每个视频平均时长为 2 小时,总时长达 640.18 小时,远超现有亮点检测数据集。该数据集通过生成流程构建,无需传统的逐片段显著性标注,旨在为长视频亮点检测提供挑战性测试平台。
SVHighlights is a benchmark dataset for extremely long sports video highlight detection. It contains 320 full-length sports broadcast videos and their corresponding official highlight videos, covering 8 sports categories including American football, baseball, basketball, ice hockey, motor racing, rugby, soccer and volleyball. Each video has an average duration of 2 hours, with a total combined duration of 640.18 hours, which far exceeds the scale of existing highlight detection datasets. This dataset is constructed via a generative pipeline without requiring traditional per-segment saliency annotation, aiming to provide a challenging testbed for long-form video highlight detection.
数据集概述:SVHighlights
SVHighlights 是目前已知首个针对超长体育视频精彩片段检测的基准数据集,旨在解决现有方法因缺乏长视频基准而局限于短视频内容的问题。
核心特征
- 视频规模:包含 320 个完整的体育比赛视频及其对应的官方精彩片段,总时长达到 640.18 小时。
- 视频时长:每个完整视频的平均时长为 2.00 小时,远超现有的精彩片段检测数据集(约是后者的 30-60 倍)。
- 体育项目:涵盖 8 种体育项目,每个项目包含 40 个视频:
- 美式足球 (
american_football) - 棒球 (
baseball) - 篮球 (
basketball) - 冰球 (
ice_hockey) - 竞速 (
race) - 橄榄球 (
rugby) - 足球 (
soccer) - 排球 (
volleyball)
- 美式足球 (
数据构建方法
- 标签生成:采用自动化管道生成标签,无需传统逐片段的手动评分标注。通过将官方精彩片段与对应完整视频进行逐帧对齐(基于 PSNR 像素级相似度匹配)来自动生成精彩片段标签。
- 对齐后处理:包括时间一致性约束和过滤步骤,以移除不匹配的帧。
数据下载与组成
- 发布平台:数据集以 Hugging Face 数据集形式发布(https://huggingface.co/datasets/idong1004/SVHighlights)。
- 发布内容:不包含原始视频,仅提供:
- 视频URL列表 (
video_list.csv) - 标注文件:包含精彩片段对齐信息 (
alignment/)、最终对齐帧索引 (all_filtered_frame_idx.json)、逐片段0/1标签 (label.json)、镜头边界 (shots/)、WhisperX 转录文本 (whisper/)、上下文感知片段 (segments/)、片段描述 (segment_caption.json)、音频音量特征 (volume.json和minmax_volume.json)。 - 预提取特征(QVHighlights 风格):视频 CLIP 特征、视频 SlowFast 特征、查询文本 CLIP 特征以及 PANN 音频特征。
- 视频URL列表 (
评估方法
- 预测格式:模型需要为每个视频生成逐片段(每2秒为一片段)的显著性分数预测文件,格式为 JSON。
- 评估指标:使用
eval.py脚本评估,报告四个指标:HL-mAP:片段级别的平均精度。HL-Hit1:得分最高的片段是否为真实精彩片段的命中率。HL-Hitk:在得分最高的K个片段中(K等于真实精彩片段数量)的命中率。HL-IoU:得分最高的K个预测与真实精彩片段之间的时间交并比。
基准模型:TF-SELECTOR
- 方法:一个无需训练的基于片段的基线方法,包含三个阶段:
- 上下文感知分割:通过镜头检测和共享语义内容合并相邻镜头,形成连贯片段。
- 片段描述生成:使用视觉-语言模型(VLM)为每个片段生成文本描述。
- 片段级评分:利用大语言模型(LLM)综合描述、转录文本和音频音量来预测每个片段的显著性分数。
- 性能:在 HIT@1(+3.12)、HIT@K(+4.06)和 IoU(+2.95)等指标上超越了基于视频时间定位(VTG)微调的基线方法。
数据获取
- 视频帧数据:对于需要原始视觉内容的研究,可通过填写表单(请求访问帧数据)申请访问以 1 fps 采样的逐视频帧数据,需遵守仅用于研究且不重新分发的协议。




