遇见数据集

CineDance-1M

收藏
arXiv2026-06-08 更新2026-06-10 收录
官方服务:

资源简介:

CineDance-1M是由多所顶尖学术机构联合创建的大规模、开源的文本-音频-视频(T2AV)数据集,专门为多镜头、长时长的影视级音视频联合生成而设计。该数据集包含100万条高质量序列,平均时长92.8秒,每段视频包含24.2个连续镜头,以1080p分辨率提供结构化、可配置的双模态标注。其创建过程采用严谨的三阶段流程:首先通过多样化来源与全面清洗确保原始素材质量;其次引入基于电影理论的叙事解析算法,将离散镜头组装为连贯的长叙事单元;最后采用分层双模态标注范式,通过锚定令牌实现全局主体定义与细粒度镜头级描述的精确绑定。该数据集主要应用于推动多镜头长时影视叙事生成研究,旨在解决现有开源模型在长时生成中存在的时序退化、跨镜头语义一致性缺失、以及音视频对齐困难等核心挑战,为构建下一代影视内容生成系统奠定数据基础。

CineDance-1M is a large-scale, open-source text-audio-video (T2AV) dataset jointly created by multiple top-tier academic institutions, specifically designed for multi-shot, long-duration film/TV-grade audio-video joint generation. This dataset encompasses 1 million high-quality sequences, with an average duration of 92.8 seconds, where each video contains 24.2 consecutive shots and is provided at 1080p resolution with structured, configurable dual-modal annotations. Its development follows a rigorous three-stage workflow: first, raw material quality is ensured through diverse data sources and comprehensive cleaning; second, a film theory-based narrative parsing algorithm is introduced to assemble discrete shots into coherent long narrative units; finally, a hierarchical dual-modal annotation paradigm is adopted, achieving precise binding between global subject definitions and fine-grained shot-level descriptions via anchor tokens. This dataset is primarily applied to advance research on multi-shot long-form film/TV narrative generation, aiming to address core challenges faced by current open-source models in long-duration generation, including temporal degradation, lack of cross-shot semantic consistency, and difficulties in audio-video alignment, laying a solid data foundation for building next-generation film and television content generation systems.

创建时间:
2026-06-08
原始信息汇总

数据集概述

CineDance-1M 是一个大规模、开放研究的文本到音频-视频 (T2AV) 数据集,专为多镜头、长格式的联合音视频生成而设计。

核心特征

  • 规模:包含 100 万(1M)个精心策划的序列。
  • 时长:平均时长 92.8 秒(长序列格式)。
  • 镜头数:平均每个视频包含 24.2 个连续镜头(多镜头)。
  • 分辨率:最低分辨率为 1080p,保证高质量画质。
  • 音频:包含原生音频,并配有结构化的音频标注。
  • 标注:提供面向两种模态(音频和视频)的分层结构化字幕。

数据构建流程

数据集通过一个严格的三阶段策划管线生成:

  1. 多样化来源与全面清洗
  2. 基于电影理论的叙事解析
  3. 分层双模态字幕生成

与其他数据集对比

CineDance-1M 是目前唯一达到百万级规模,同时具备以下特点的数据集:1080p 分辨率、长序列多镜头结构、原生音频以及结构化的音视频标注

配套基准:CineBench

  • 内容:包含 1,000 个测试用例,按主题/风格、时长、镜头数和生成难度分层。
  • 时长范围:覆盖 10 秒(2-3 镜头)、30 秒(4-9 镜头)和前瞻性的 60 秒(10-20 镜头)。
  • 评估维度:采用六维、与人类对齐的指标体系,包括:视频质量、音频质量、音画同步、提示词对齐、叙事连贯性和镜头结构响应。

配套模型:CineDance

基于 LTX-2.3 改造,是用于多镜头长序列音视频生成的稳健开源基线模型,具备镜头过渡、主题与环境一致性保持及结构化提示响应能力。

搜集汇总
数据集介绍
CineDance-1M 数据集图片
构建方式
CineDance-1M的构建遵循一套严格的三阶段流水线。首先,从MiraData、LVD-2M等公开数据集及SkyReels-V2采集流程中精选1080p原始视频,并执行粗到细的空域裁剪与字幕去除,以消除黑边、叠加文本等视觉伪影。随后,引入基于电影理论的叙事解析,通过状态驱动的自底向上分组算法,指导Qwen3.5-27B将离散的镜头(通过TransNetV2检测)依据多角度连贯性、交叉剪辑、因果动作及蒙太奇等规则合并为连贯的叙事序列。最后,采用可配置的分层双模态标注范式,利用锚标记(anchor token)全局绑定主题定义,并借助专用多模态大模型生成镜头级的视觉与音频描述,显著降低了跨模态绑定中的幻觉。
特点
该数据集拥有多个开创性特点。其包含超过一百万条序列,平均时长达到92.8秒,平均含有24.2个物理镜头,远超现有数据集。所有视频均为1080p分辨率,并原生配备音频轨道。在标注层面,CineDance-1M首次提供了原生结构化、可配置的镜头级双模态描述,每条视频平均包含超过6400词的密集标注,涵盖全局角色、场景列表及镜头级的视觉、音频、转场与ASR信息。这种高语义密度与精细粒度,使其能够为多镜头、长时程的联合音视频生成模型提供卓越的监督信号,有效弥补了现有数据集在叙事复杂度与结构化控制方面的空白。
使用方法
该数据集旨在为多镜头长时程联合音视频生成研究提供基准。研究人员可直接将结构化标注(如全局角色与场景定义、镜头级提示词)作为条件输入,微调如LTX-2.3等基础模型,以学习跨镜头的语义一致性与叙事节奏。论文提出的CineBench评测基准则提供了一个包含难度分层提示词与六维度自动化指标的标准化评估框架,可用于系统衡量模型在视频质量、音频质量、音视频同步、提示词对齐、叙事连续性及镜头结构响应方面的表现。此外,数据集中存储的元数据(如美学评分、运动平滑度)允许用户根据自身需求灵活设置过滤阈值,构建特定任务的子集。
背景与挑战
背景概述
随着视频生成模型在保真度与结构多样性上取得显著进展,商业系统已展现出生成电影级叙事内容的能力,然而开源模型的发展却长期受限于高质量训练数据的匮乏。为弥补这一鸿沟,来自上海交通大学、浙江大学、南洋理工大学等机构的研究团队于2026年提出了CineDance-1M数据集,致力于推动多镜头、长格式联合音视频生成的研究。该数据集由Yuheng Chen、Teng Hu等人主导创建,包含超过一百万个序列,平均每个序列时长92.8秒、包含24.2个连续镜头,并提供了可配置的结构化双模态标注。其核心研究问题在于如何突破现有数据集在时长、叙事复杂度与标注粒度上的局限,为下一代电影级音视频生成模型提供坚实的训练基础。CineDance-1M的出现有望加速该领域从单镜头短片向复杂叙事合成的范式转变。
当前挑战
CineDance-1M所应对的挑战源于多镜头长格式音视频生成的两大核心难题。其一为长程可扩展性:当前基于短片段训练的基础模型在直接扩展至长时长生成时,普遍出现空间模糊、运动幅度降低、背景重复与近静态动态等严重退化现象,表明强大的短片段合成能力并不等同于稳定的长格式生成。其二为跨镜头语义一致性:多镜头生成要求角色、物体与场景在不同镜头间保持视觉一致性与语义可识别性,同时联合音视频生成还需确保音频与音视频的跨模态吻合;现有方法即便在相对较短的片段中,也难以维持角色身份与环境的一致性。此外,数据集的构建同样面临严峻挑战:如何从海量原始视频中通过严格的时空裁剪、质量评估与电影理论启发的叙事解析,最终产出具备原生音轨与镜头级稠密标注的高质量序列,构成了复杂而艰巨的数据工程任务。
常用场景
经典使用场景
在视频生成研究领域,CineDance-1M作为一个开创性的大规模文本到音视频联合生成数据集,其经典使用场景聚焦于多镜头、长格式的电影化音视频合成。该数据集通过提供平均92.8秒时长、包含24.2个连续镜头的视频序列,以及结构化的双模态注释,使得研究者能够训练和评估模型在复杂叙事结构下的生成能力。典型的应用包括从文字描述出发,生成具有连贯镜头切换、一致角色身份和稳定环境背景的完整电影片段,从而推动生成式模型从简单的单镜头短片向具备叙事逻辑的多镜头长视频范式跃迁。
衍生相关工作
基于CineDance-1M数据集,衍生出一系列具有代表性的研究工作。其中,CineBench评估套件被构建用于系统性衡量模型在多镜头叙事生成中的表现,涵盖视频质量、音频质量、音画同步、提示对齐、叙事连续性及镜头结构响应等六维指标。此外,研究者将LTX-2.3模型适配为CineDance基线,通过引入渐进式参考支架移除策略(DARC)和基于数据驱动的课程学习,有效提升了模型在多镜头长格式联合生成中的跨模态同步与时空一致性。这些衍生工作共同验证了数据集的构建策略有效性,并为后续研究提供了可靠的模型与评价体系参照。
数据集最近研究
最新研究方向
CineDance-1M的发布标志着多镜头、长时段音视频联合生成领域迈入了一个崭新的纪元。该数据集以平均92.8秒的时长和24.2个连续镜头的规模,突破了现有数据集在时间跨度与叙事复杂性上的桎梏,为从短片段生成向电影级叙事合成的研究范式转变提供了关键数据基础。最新前沿研究集中于利用其结构化、可配置的双模态注释,探索基于参考帧的训练时视觉-时间支架策略(如DARC渐进式支架移除算法),以在不依赖显式镜头边界控制的前提下,学习跨镜头实体与环境的一致性保持。同时,CineBench基准的引入,通过六维人类对齐度量体系,系统地评估了模型在叙事连续性、音视频同步及镜头结构响应等方面的能力,推动了从单一模态质量评测向复杂叙事生成综合评估的演进。该数据集不仅验证了从电影理论启发的数据策展流程的有效性,更作为开源基石,显著加速了具备长程时空一致性与精确跨模态同步能力的下一代生成模型的发展。
相关研究论文
  • 1
    CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation上海交通大学; 电子科技大学; 浙江大学; 东京大学; 南洋理工大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务