遇见数据集

StoryVideoQA

收藏
arXiv2026-06-05 更新2026-06-08 收录
官方服务:

资源简介:

StoryVideoQA是由武汉大学研究团队构建的当前规模最大的深度视频理解数据集,旨在解决复杂故事情节的长视频理解难题。该数据集涵盖393.2小时的长篇故事视频,包含3部电视剧集和78部高评分电影,共生成超过36.3万个高质量问答对,平均视频时长分别为1635秒和7878秒。数据集通过升级的StoryMindv2多智能体协作框架自动生成,采用监督引导生成机制和多评审投票策略确保数据质量与主题平衡性。该数据集主要应用于深度视频理解领域,支持对长程角色关联、多层次故事元素和复杂推理能力的系统性评估,为视频问答模型的发展提供重要基准。

StoryVideoQA, constructed by the research team at Wuhan University, is the largest-scale deep video understanding dataset to date, designed to address the challenges of long-form video understanding with complex narrative plots. It encompasses 393.2 hours of long-form story videos, including 3 TV drama series and 78 highly-rated films, with a total of over 363,000 high-quality question-answer pairs. The average durations of the video samples for the TV series and film subsets are 1635 seconds and 7878 seconds, respectively. The dataset is automatically generated via the upgraded StoryMindv2 multi-agent collaboration framework, which adopts supervised-guided generation mechanisms and a multi-reviewer voting strategy to ensure data quality and topic balance. Primarily applied in the field of deep video understanding, this dataset supports systematic evaluations of long-range character relationships, multi-level story elements, and complex reasoning capabilities, serving as a critical benchmark for the development of video question answering models.

创建时间:
2026-06-05
搜集汇总
数据集介绍
StoryVideoQA 数据集图片
构建方式
StoryVideoQA的构建依托于增强型多智能体协作框架StoryMindv2,该框架在数据准备阶段通过动态时间规整算法对齐剧本与字幕,并辅以人工校验,构建大规模、高保真的时间对齐语料库。随后,框架引入监督引导机制与精细化多评审投票策略,自动生成涵盖14个细粒度主题的高质量问答对,最终经三重评审与多数表决过滤,形成包含超过36.3万问答对、覆盖393.2小时影视内容的数据集。
特点
该数据集具有显著的规模与多样性优势,涵盖3部电视剧(如《老友记》《权力的游戏》)及78部IMDb与豆瓣高分电影,视频平均时长分别达1635秒与7878秒。其核心特点在于对深度视频理解的全面支撑,包含感知与推理两种问题类型,并精细覆盖人物、动作、地点等七种故事元素组合,难度经多维度量化评估,确保了主题分布均衡与挑战层次分明。
使用方法
StoryVideoQA可作为深度视频理解任务的基准测试平台,使用时,研究者需将视频与对应问答对作为输入,评估模型在长时序剧情理解、角色关联保持及多粒度推理方面的能力。数据集附带人物库与难度标签,支持零样本、微调及基于智能体的方法评估。为降低API成本,可优先在人工验证的子集StoryVideoQA-G上进行实验,以高效分析模型性能。
背景与挑战
背景概述
深度视频理解(Deep Video Understanding, DVU)旨在超越浅层事实问答,要求模型理解复杂叙事长视频中的完整故事线。然而,现有数据集多聚焦于短视频片段中的感知性问答,缺乏对长程情节演变、实例级故事元素(如特定角色、动作与地点)以及多类型推理问题的覆盖。为此,武汉大学多媒体软件国家工程研究中心的研究团队于2026年提出了StoryVideoQA数据集,该数据集基于增强型多智能体协作框架StoryMindv2自动构建,涵盖3部电视剧(《老友记》《生活大爆炸》《权力的游戏》)与78部IMDB/Douban高分电影,总计393.2小时视频、超过36.3万对问答,跨越14个细粒度主题,成为当前规模最大、多样性最丰富的DVU基准数据集。
当前挑战
StoryVideoQA所解决的领域挑战主要源于DVU任务的固有复杂性:一方面,长视频中的故事线跨越巨大时间跨度,要求模型具备长程关联与跨场景推理能力;另一方面,问答涉及角色、动作、地点等实例级故事元素及其组合,现有方法在维持长程角色关联与构建连贯情节理解方面表现不足。在数据集构建过程中,挑战同样严峻——人工生成面向复杂情节的高质量问答耗时费力,导致既有数据集规模小且细粒度主题分布严重失衡;而将自动生成框架从情景喜剧推广至更长的电影时,问答质量显著下降。为此,StoryMindv2引入了监督引导生成机制与改进的多审阅者投票策略,在保证高质量的前提下实现了大规模自动化构建。
常用场景
经典使用场景
StoryVideoQA作为当前规模最为庞大的深度视频理解基准数据集,其经典使用场景聚焦于评估与推动视频问答模型在复杂叙事结构中的推理能力。该数据集涵盖了超过363K个问答对,横跨393.2小时的电视连续剧与电影内容,涉及14个细粒度话题的均衡分布。研究者在评估现有视频理解方法时,常采用该数据集作为测试床,用以探测模型在长时间跨度的角色关联追踪、多层面事件因果推断以及实例级故事元素整合等方面的表现上限。
衍生相关工作
围绕StoryVideoQA数据集已衍生出多项具有显著影响力的研究工作。其中,PlotTree作为一项标志性贡献,提出了一种基于层级剧情结构的视频理解智能体,通过将长时视频内容重构为树状的节点组织,实现了对故事线的递归式浓缩与高效推理。此外,Video2RAG与VideoTree等工作亦以此数据集为基准,探索了检索增强生成范式在长视频叙事理解中的适配性。这些衍生工作共同推动了从扁平化事件表示向层级化叙事建模的范式转变,为深度视频理解开辟了新的技术路线。
数据集最近研究
最新研究方向
当前,StoryVideoQA数据集的研究前沿聚焦于深度视频理解(DVU)领域,特别是在长视频叙事理解的自动化和规模化方面。该数据集通过StoryMindv2多智能体协作框架自动构建,融合了监督生成机制与多评审者投票策略,生成了超过36.3万问答对,覆盖393.2小时电视剧与电影内容,显著突破了人工标注在规模与主题平衡性上的局限。结合PlotTree层次化情节结构推理方法,研究揭示了现有视频问答方法在长程角色关联与复杂情节连贯理解上的结构性不足,推动了从事实性问答向叙事性推理的范式迁移。这一工作为面向故事视频的深层语义建模、跨模态推理与自动化数据集构建提供了关键基准与技术路径。
相关研究论文
  • 1
    StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset武汉大学·计算机学院; 国家多媒体软件工程技术研究中心; 湖北省多媒体与网络通信工程重点实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务