遇见数据集

CineDance-1M

收藏
github2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

CineDance-1M是一个包含100万序列的电影级数据集,具有1080p分辨率、长形式多镜头序列、完整原生音频和结构化双模态注释。

CineDance-1M is a movie-grade dataset encompassing 1 million sequences, featuring 1080p resolution, long-form multi-shot sequences, complete native audio, and structured bimodal annotations.

创建时间:
2026-06-06
原始信息汇总

数据集概述:CineDance

CineDance 是一个面向下一代多镜头长片电影级音视频生成的数据集与框架,旨在解决开源模型在电影级视频生成中高质量训练数据严重短缺的问题。

核心组件

组件 说明
CineDance-1M 一个包含100万序列的电影级数据集,具有1080p分辨率、长形式多镜头序列、完整原始音频和结构化双模态标注。
CineBench 一个包含1000个案例的评估基准,采用六维度人类对齐指标,用于评估多镜头长形式音视频生成。
CineDance Model 一个基于LTX-2.3适配的开源基线模型,用于多镜头长形式音视频生成。
三阶段数据治理流程 多样化收集与清洗 → 电影叙事解析 → 层级化双模态标注。
视觉-时间参考脚手架 一种训练策略,在推理时逐步移除脚手架以保留多镜头组织能力。

数据规模与质量

  • 总序列数:1,000,000
  • 分辨率:1080p
  • 特点:包含长形式多镜头序列、完整原始音频、结构化双模态标注。

用途与场景

该数据集专为多镜头长形式音视频生成任务设计,可用于训练和评估能够生成电影级连续音视频内容的模型。

获取方式与状态

  • 论文已发布(arXiv: 2606.09639)
  • 项目页面已上线
  • CineDance-1M 数据集尚未公开发布,计划通过门控访问机制发布(数据总量超过80 TB,正在处理中)
  • 数据管理流程代码、推理代码、模型检查点、训练代码等相关资源将在后续发布

学术引用

bibtex @misc{chen2026cinedancenextgenerationmultishotlongform, title={CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation}, author={Yuheng Chen and Teng Hu and Yuji Wang and Qingdong He and Zhucun Xue and Qianyu Zhou and Xiangtai Li and Lizhuang Ma and Jiangning Zhang and Dacheng Tao}, year={2026}, eprint={2606.09639}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2606.09639}, }

搜集汇总
数据集介绍
CineDance-1M 数据集图片
构建方式
CineDance-1M数据集由上海交通大学、浙江大学、南洋理工大学等机构联合构建,旨在填补影视级多镜头长视频生成领域的高质量训练数据空白。其构建遵循一套严谨的三阶段数据治理管线:首先通过多样化采集与清洗获取海量原始影视素材,随后进行影视化叙事解析以提取多镜头长序列结构,最后实施层次化的双模态标注,为每段序列生成同步的音频与文本描述。该数据集包含超过100万条序列,每条均具备1080p分辨率、完整的原生音频以及结构化的双模态注释,整体数据规模超过80TB,为训练长程视听生成模型奠定了坚实的数据基础。
特点
CineDance-1M区别于现有数据集的核心特色在于其多镜头、长形式与原生同步音频的融合。数据集中的每条序列均跨越多个镜头切换,完整保留了影视作品中的叙事节奏与视听连贯性,突破了以往单镜头或短片段数据的局限。此外,结构化的双模态注释不仅涵盖视觉内容描述,还同步关联了音频事件与场景氛围,使得模型能够同时学习画面与声音的协同演化规律。这种高分辨率、长序列、多模态对齐的特性,使其成为推动下一代影视级音视频联合生成研究的关键资源。
使用方法
CineDance-1M数据集目前处于处理阶段,将通过门控访问机制在GitHub仓库中发布。用户可关注项目页面以获取最新进展。数据集主要面向基于LTX-2.3等基础模型的多镜头长形式音视频生成研究,其配套的CineBench基准(含1000个测试案例和六维度人类对齐指标)可用于评估生成效果。建议研究者在模型训练时采用视觉-时间参考支架策略,逐步去除辅助信息以保留模型在推理时的多镜头组织能力。完整的推理代码、模型检查点与训练代码也将在后续逐步开放。
背景与挑战
背景概述
CineDance-1M是由上海交通大学、南洋理工大学等机构的研究人员于2026年创建的面向下一代多镜头长格式电影级音视频生成的大规模数据集。该数据集旨在弥合商业系统与开源模型之间的鸿沟,核心研究问题在于解决电影级视频生成领域高质量训练数据严重匮乏的困境。CineDance-1M包含了超过100万条序列,每条序列均具备1080p分辨率、完整原生音频以及结构化双模态标注,为多镜头长格式音视频联合生成任务提供了坚实的数据基石。其发布对于推动开源社区在电影级视频生成方向的研究具有里程碑式的影响力,标志着该领域向更复杂、更贴近实际应用场景迈出了关键一步。
当前挑战
CineDance-1M所应对的核心领域挑战是复杂多镜头长格式音视频的联合生成,这要求模型同时理解叙事结构、镜头切换逻辑以及音画同步关系,远超传统单镜头视频生成任务的难度。在数据集构建过程中,面临的挑战极为严峻:首先,从海量电影级资源中高效收集并清洗出超80TB的原始素材,需设计复杂的三阶段数据治理管线;其次,对长格式视频进行精准的电影叙事解析是一项艰巨任务,需自动识别镜头边界与叙事单元;最后,构建多层次的双模态标注体系,确保文本描述与视觉、听觉特征的高阶对齐,这一过程对计算资源与算法设计提出了极高要求。
常用场景
经典使用场景
在影视级音视频生成领域,现有模型通常受限于短片段、单镜头的生成能力,难以满足长时长、多视角叙事的创作需求。CineDance-1M数据集应运而生,它以约100万条高质量序列、1080p分辨率和原生音频为核心,专门用于训练和评估多镜头长形式电影级音视频生成模型。研究者利用该数据集开展联合音频-视频生成任务,探索如何将视觉叙事与听觉元素在时间维度上有机融合,从而推动下一代沉浸式影视内容自动生成技术的发展。
衍生相关工作
CineDance-1M催生了多项经典的衍生研究。其提出的视觉-时间参考支架训练策略,被后续工作借鉴以增强模型在插帧和长视频预测中的时序一致性。基于该数据集训练的CineDance基线模型,在音频-视频联合生成任务上超越了LTX-2.3等同期开源方案,启发了多模态叙事生成网络的设计范式。此外,CineBench的六维评价体系被多篇顶会论文采纳,用于对比不同长视频生成模型在叙事流畅性、声画匹配度等方面的表现,成为该领域重要的评估工具。
数据集最近研究
最新研究方向
当前,多镜头、长格式、视听联合生成是视频生成领域的前沿挑战,而高质量训练数据的匮乏严重制约了技术进步。CineDance-1M数据集应运而生,它以高达1080p分辨率、包含完整原生音频和结构化双模态标注的百万级序列,为构建能够感知电影叙事逻辑的智能生成模型提供了关键基石。该数据集依托独创的三阶段数据治理流水线,实现了从海量素材到精标注叙事片段的自动化转化,显著降低了长视频生成对人工标注的依赖。在Sora等商业模型引领的生成式浪潮下,CineDance-1M的开源不仅推动了学术研究与工业水平的接轨,更通过配套的CineBench基准和参考支架训练策略,为评估和提升模型的多镜头连贯性与时空一致性设立了新标准,有望催生新一代叙事性视频生成应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务