遇见数据集

SVHighlights

收藏
github2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

SVHighlights 是一个用于极长体育视频亮点检测的基准数据集,包含 320 个全长体育广播视频及其对应的官方亮点视频,涵盖美式足球、棒球、篮球、冰球、赛车、橄榄球、足球和排球等 8 种体育类别。每个视频平均时长为 2 小时,总时长达 640.18 小时,远超现有亮点检测数据集。该数据集通过生成流程构建,无需传统的逐片段显著性标注,旨在为长视频亮点检测提供挑战性测试平台。

SVHighlights is a benchmark dataset for extremely long sports video highlight detection. It contains 320 full-length sports broadcast videos and their corresponding official highlight videos, covering 8 sports categories including American football, baseball, basketball, ice hockey, motor racing, rugby, soccer and volleyball. Each video has an average duration of 2 hours, with a total combined duration of 640.18 hours, which far exceeds the scale of existing highlight detection datasets. This dataset is constructed via a generative pipeline without requiring traditional per-segment saliency annotation, aiming to provide a challenging testbed for long-form video highlight detection.

创建时间:
2026-05-23
原始信息汇总

数据集概述:SVHighlights

SVHighlights 是目前已知首个针对超长体育视频精彩片段检测的基准数据集,旨在解决现有方法因缺乏长视频基准而局限于短视频内容的问题。

核心特征

  • 视频规模:包含 320 个完整的体育比赛视频及其对应的官方精彩片段,总时长达到 640.18 小时
  • 视频时长:每个完整视频的平均时长为 2.00 小时,远超现有的精彩片段检测数据集(约是后者的 30-60 倍)。
  • 体育项目:涵盖 8 种体育项目,每个项目包含 40 个视频:
    • 美式足球 (american_football)
    • 棒球 (baseball)
    • 篮球 (basketball)
    • 冰球 (ice_hockey)
    • 竞速 (race)
    • 橄榄球 (rugby)
    • 足球 (soccer)
    • 排球 (volleyball)

数据构建方法

  • 标签生成:采用自动化管道生成标签,无需传统逐片段的手动评分标注。通过将官方精彩片段与对应完整视频进行逐帧对齐(基于 PSNR 像素级相似度匹配)来自动生成精彩片段标签。
  • 对齐后处理:包括时间一致性约束和过滤步骤,以移除不匹配的帧。

数据下载与组成

  • 发布平台:数据集以 Hugging Face 数据集形式发布(https://huggingface.co/datasets/idong1004/SVHighlights)。
  • 发布内容:不包含原始视频,仅提供:
    • 视频URL列表 (video_list.csv)
    • 标注文件:包含精彩片段对齐信息 (alignment/)、最终对齐帧索引 (all_filtered_frame_idx.json)、逐片段0/1标签 (label.json)、镜头边界 (shots/)、WhisperX 转录文本 (whisper/)、上下文感知片段 (segments/)、片段描述 (segment_caption.json)、音频音量特征 (volume.jsonminmax_volume.json)。
    • 预提取特征(QVHighlights 风格):视频 CLIP 特征、视频 SlowFast 特征、查询文本 CLIP 特征以及 PANN 音频特征。

评估方法

  • 预测格式:模型需要为每个视频生成逐片段(每2秒为一片段)的显著性分数预测文件,格式为 JSON。
  • 评估指标:使用 eval.py 脚本评估,报告四个指标:
    • HL-mAP:片段级别的平均精度。
    • HL-Hit1:得分最高的片段是否为真实精彩片段的命中率。
    • HL-Hitk:在得分最高的K个片段中(K等于真实精彩片段数量)的命中率。
    • HL-IoU:得分最高的K个预测与真实精彩片段之间的时间交并比。

基准模型:TF-SELECTOR

  • 方法:一个无需训练的基于片段的基线方法,包含三个阶段:
    1. 上下文感知分割:通过镜头检测和共享语义内容合并相邻镜头,形成连贯片段。
    2. 片段描述生成:使用视觉-语言模型(VLM)为每个片段生成文本描述。
    3. 片段级评分:利用大语言模型(LLM)综合描述、转录文本和音频音量来预测每个片段的显著性分数。
  • 性能:在 HIT@1(+3.12)、HIT@K(+4.06)和 IoU(+2.95)等指标上超越了基于视频时间定位(VTG)微调的基线方法。

数据获取

  • 视频帧数据:对于需要原始视觉内容的研究,可通过填写表单(请求访问帧数据)申请访问以 1 fps 采样的逐视频帧数据,需遵守仅用于研究且不重新分发的协议。
搜集汇总
数据集介绍
SVHighlights 数据集图片
构建方式
SVHighlights的构建巧妙地规避了传统逐片段显著性人工标注的高昂成本。该数据集利用320对完整体育赛事直播视频与其对应的官方集锦视频,通过一套自动化流水线生成标注。核心在于一种基于像素级PSNR分数的对齐算法,将集锦视频中的每一秒片段与全长视频中最相似的帧进行匹配,并辅以时序一致性后处理与误匹配帧过滤步骤,最终产出具有二进制显著性标签的基准数据集。
特点
该数据集的核心特质在于其前所未有的视频时长规模与领域广度。涵盖美式足球、棒球、篮球等八类主流运动项目,每段视频平均时长达到2小时,总时长逾640小时,远超既有高光检测基准。此规模直接挑战了现有方法在长视频上的泛化能力,并促使研究者从短片段分析转向具备更长上下文理解能力的范式。
使用方法
使用SVHighlights进行评估时,研究者需首先生成符合规范的预测文件。该文件为JSON格式,需为数据集内每段视频逐2秒片段输出一个预测显著性分数。随后,开发者可利用仓库提供的eval.py脚本,将预测结果与数据集自带的ground truth标签文件(annotations/label.json)进行对比,从而计算HL-mAP、HL-Hit1等四项关键指标,实现模型性能的标准化评估。
背景与挑战
背景概述
SVHighlights数据集由韩国蔚山科学技术院(UNIST)的Donggyu Lee、Youngbin Ki、Jeonghun Kang和Taehwan Kim等研究人员于2026年创建,并发表于KDD 2026会议的数据集与基准评测轨道。该数据集聚焦于超长体育视频精彩瞬间检测这一极具实用价值却长期缺乏基准的研究领域。现有方法多局限于数分钟的短视频内容,难以推广至时长数小时的体育直播。SVHighlights填补了这一空白,通过从完整体育转播与其官方精彩片段视频的配对中,利用无需逐片段标注的数据生成流水线,构建了包含320个视频、覆盖8个体育项目、平均时长2小时、总计超过640小时的极长视频精彩检测基准,为探索长视频时序理解提供了关键资源。
当前挑战
SVHighlights所解决的领域核心挑战在于:现有精彩检测模型在分钟级短片段上表现良好,却无法泛化至时长超过一小时的完整体育转播,基于片段级别的评分缺乏识别长视频中精彩时刻所需的全局语境。在数据集构建过程中,研究者面临的最大难题是如何高效获取精确的帧级标注——最终采用基于PSNR的像素级对齐技术,将官方精彩片段与完整视频帧进行匹配,并通过时序一致性后处理与误匹配过滤机制保障标签质量,克服了传统逐片段人工标注在超长视频场景下耗时极巨、成本高昂的障碍。
常用场景
经典使用场景
SVHighlights数据集聚焦于极端长时体育视频的高光时刻检测,其核心使用场景在于为时长超过一小时的完整体育赛事广播提供高效、精准的精彩片段自动定位。该数据集包含了来自美式足球、棒球、篮球、冰球、赛车、橄榄球、足球和排球等八类运动的320段全场比赛视频,每段视频平均时长达两小时,总时长超过640小时,极大地突破了现有高光检测数据集仅覆盖短时视频的局限。研究者可利用该数据集训练和评估模型在极长视频中捕捉关键事件的能力,尤其是在缺乏人工逐帧标注的情况下,通过视频与官方高光集的对齐自动生成标签,为长视频理解领域开辟了新的实验范式。
衍生相关工作
围绕SVHighlights数据集,研究社区已衍生出一系列富有影响力的工作,其中最具代表性的是该论文同步提出的TF-SELECTOR基线方法。TF-SELECTOR作为一种无需训练的片段级高光检测器,创新性地将视频分割为语义一致的上下文感知片段,并利用多模态大语言模型综合视觉描述、语音转录和音频响度来预测每段的显著性得分,在HIT@1等关键指标上相比视频时序定位调优基线取得了显著提升。这一方法开启了在极端长视频上无需额外训练即可实现高性能高光检测的新方向。此外,该数据集的开放特征和模块化标注体系也为后续融合语音、视觉和音频特征的多模态长视频理解研究提供了标准化实验平台,催生了更多关于长视频结构建模与语义对齐的探索。
数据集最近研究
最新研究方向
SVHighlights数据集聚焦于超长时长体育视频的精彩片段检测这一前沿方向,其研究挑战了传统方法仅适用于短视频的局限性。该数据集汇集了320段平均时长达到2小时的体育赛事视频,覆盖8种运动项目,总时长突破640小时,极大拓展了该领域的研究边界。为了应对超长视频处理中的上下文缺失难题,研究团队提出了无需训练的TF-SELECTOR方法,通过基于语义内容的上下文感知分段策略,结合多模态大语言模型进行片段级显著性评分,在HIT@1、HIT@K和IoU等关键指标上均取得显著提升。这一创新不仅为视频理解领域提供了极具挑战性的基准测试平台,也暗示了未来在直播流媒体、体育转播自动化剪辑等实际应用中的巨大潜力,推动了长视频内容分析技术的实用化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务