遇见数据集

LCric

收藏
arXiv2023-03-26 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

LCric是由印度理工学院罗克分校、普林斯顿大学和多伦多大学的研究团队开发的一个大规模长视频理解基准数据集。该数据集包含超过1000小时的密集注释板球视频,平均样本长度约为50分钟。通过自动化注释和视频流对齐管道(ASAP),研究团队能够以几乎零注释成本收集这些视频。LCric数据集不仅用于评估视频理解模型,还通过大量组合多选择和回归查询来分析这些模型的性能。此外,该数据集还用于建立人类基准,表明在长视频理解方面仍有显著的研究空间。

LCric is a large-scale long-form video understanding benchmark dataset developed by research teams from the Indian Institute of Technology Roorkee, Princeton University, and the University of Toronto. The dataset includes over 1,000 hours of densely annotated cricket videos, with an average sample duration of approximately 50 minutes. Leveraging the Automated Annotation and Stream Alignment Pipeline (ASAP), the research team collected these videos at nearly zero annotation cost. The LCric dataset is not only used to evaluate video understanding models, but also to analyze their performance via a large set of combined multiple-choice and regression-based queries. Additionally, this dataset is employed to establish human performance baselines, demonstrating that there remains significant research potential in the domain of long-form video understanding.

创建时间:
2023-01-17
搜集汇总
数据集介绍
LCric 数据集图片
构建方式
在体育视频理解领域,构建大规模、密集标注的长视频基准数据集一直面临巨大挑战,传统方法依赖耗时费力的逐帧人工标注,严重限制了数据集的规模与时长。为突破这一瓶颈,研究者提出了自动化标注与视频流对齐流水线(ASAP),并基于该流水线构建了LCric数据集。LCric通过ASAP自动解析板球比赛视频中嵌入的记分牌信息,利用光学字符识别(OCR)技术提取比赛状态(如当前进行的球局),进而与网络上免费获取的逐球专家解说文本进行时间对齐,从而以近乎零标注成本生成了超过1000小时、平均样本时长约50分钟的密集标注长视频数据,涵盖131场板球比赛及约6.2万条球级事件标注。
特点
LCric数据集在长视频理解领域展现出显著特色。其平均视频片段长度接近2800秒,较以往同类基准数据集提升了近一个数量级,为评估模型在极长时序上的推理能力提供了前所未有的测试平台。数据集包含12种原子事件(如得分、出局、无效投球等),并通过布尔逻辑组合自动生成了丰富的组合式多选与回归查询,这些查询需要模型在5分钟至1小时不等的连续比赛时段内进行上下文聚合与推理。此外,LCric的标注具有高保真度,人工验证显示约95%的注释与视频事件的时间偏差在±1秒以内,且数据集的规模仅受限于可获取的板球比赛视频数量,具备持续扩展的潜力。
使用方法
LCric数据集旨在推动长视频理解模型的发展,其使用方法围绕组合式查询展开。用户可利用数据集提供的球级事件链,构建三类典型任务:二值查询(如判断某事件的发生次数是否在指定范围内)、多选查询(如预测特定事件序列的出现次数)以及回归查询(如预测总得分)。模型需先准确检测局部事件(如识别单次投球的结果),再将局部信息在长时间跨度内进行有效聚合以回答查询。基准实验表明,当前最先进的模型(如TQN与MeMViT)在50分钟片段上的表现显著低于人类基线(准确率下降约38%),凸显了该数据集对新一代长视频推理模型研发的挑战与价值。
背景与挑战
背景概述
长视频理解(Long-horizon Video Understanding, LVU)是计算机视觉领域一个长期存在且至关重要的研究方向,其目标在于使系统能够对持续时间长达数十分钟甚至数小时的视频流进行推理与分析。然而,该领域的发展长期受限于高质量密集标注数据的匮乏,因为传统的人工逐帧标注方式耗时耗力,难以规模化。2023年,由普林斯顿大学、多伦多大学及印度理工学院鲁尔基分校的研究人员共同提出的LCric数据集,旨在突破这一瓶颈。该数据集依托于所设计的自动化标注与视频流对齐流水线(ASAP),通过将板球比赛视频与网络上公开的专家解说文本自动对齐,以近乎零标注成本构建了超过1000小时的密集标注长视频基准,样本平均时长约50分钟,为长视频理解模型的评估提供了前所未有的规模化数据支撑。
当前挑战
LCric数据集所面临的挑战主要体现在两个层面。其一,在领域问题层面,现有长视频理解模型在处理时长约50分钟的视频片段时,性能急剧下降,接近随机水平。例如,TQN与MeMViT等先进模型在LCric上的二元查询准确率仅为约60%,远低于人类基线(96%),表明模型在长时序上下文聚合与事件推理方面存在显著不足。其二,在数据集构建过程中,ASAP流水线面临诸多技术难点,包括板球记分牌因广告遮挡或格式变化而难以稳定提取、高帧率视频逐帧调用OCR的成本高昂,以及不同体育项目(如美式橄榄球与篮球)的注释时间戳粒度不一致导致对齐精度波动。尽管ASAP在跨体育项目上达到了平均95%的对齐准确率,但美式橄榄球的误对齐问题(因罚球时间戳偏差)仍凸显了自动化标注在复杂动态场景下的鲁棒性挑战。
常用场景
经典使用场景
LCric数据集专为长时域视频理解(LVU)研究而设计,其经典使用场景聚焦于评估模型在长达50分钟体育视频片段上的推理能力。通过自动对齐板球比赛的实时解说与视频帧,LCric提供了密集的逐球标注,支持构建复杂的组合式查询,例如二元判断、多选计数和回归预测任务。研究者可利用该数据集测试模型在长时间跨度内的事件检测与上下文聚合能力,从而推动LVU领域的基准发展。
衍生相关工作
LCric数据集的诞生催生了多项衍生研究:其核心流水线ASAP启发了自动视频标注工具的开发,可扩展至美式足球、篮球等运动领域;基于LCric的组合式查询设计,类似CLEVR的推理框架被引入视频理解,促进了结构化问答任务的发展;此外,TQN和MeMViT等模型在LCric上的性能分析,推动了长时记忆机制与高效视频处理架构的改进,例如内存增强型变换器(MeMViT)的优化和时序查询网络的适配。
数据集最近研究
最新研究方向
在长视频理解领域,数据集构建的瓶颈长期受限于人工标注的高昂成本与视频时长不足。LCric通过自动化注释与视频流对齐管道(ASAP),实现了对板球比赛视频的逐球密集标注,涵盖超过1000小时、平均时长约50分钟的长片段,开创了零成本大规模数据集构建的新范式。该数据集聚焦于时序推理与事件聚合能力,通过组合式多选与回归查询,系统评估模型在分钟至小时级时间跨度上的理解性能。当前前沿研究正围绕ASAP管道的跨运动泛化性、事件定位精度与长程记忆机制展开,尤其关注TQN与MeMViT等模型在长视频任务中性能随上下文增长而急剧退化的问题。LCric的提出不仅推动了长视频理解基准向真实场景延伸,也为体育视频分析、自动解说生成等热点应用提供了高质量数据支撑,其影响在于重新定义了长时序视觉推理的评估标准与数据获取路径。
相关研究论文
  • 1
    Building Scalable Video Understanding Benchmarks through Sports印度理工学院罗克分校, 普林斯顿大学, 多伦多大学 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务