CineDance-1M
收藏资源简介:
CineDance-1M是一个包含100万序列的电影级数据集,具有1080p分辨率、长形式多镜头序列、完整原生音频和结构化双模态注释。
CineDance-1M is a movie-grade dataset encompassing 1 million sequences, featuring 1080p resolution, long-form multi-shot sequences, complete native audio, and structured bimodal annotations.
数据集概述:CineDance
CineDance 是一个面向下一代多镜头长片电影级音视频生成的数据集与框架,旨在解决开源模型在电影级视频生成中高质量训练数据严重短缺的问题。
核心组件
| 组件 | 说明 |
|---|---|
| CineDance-1M | 一个包含100万序列的电影级数据集,具有1080p分辨率、长形式多镜头序列、完整原始音频和结构化双模态标注。 |
| CineBench | 一个包含1000个案例的评估基准,采用六维度人类对齐指标,用于评估多镜头长形式音视频生成。 |
| CineDance Model | 一个基于LTX-2.3适配的开源基线模型,用于多镜头长形式音视频生成。 |
| 三阶段数据治理流程 | 多样化收集与清洗 → 电影叙事解析 → 层级化双模态标注。 |
| 视觉-时间参考脚手架 | 一种训练策略,在推理时逐步移除脚手架以保留多镜头组织能力。 |
数据规模与质量
- 总序列数:1,000,000
- 分辨率:1080p
- 特点:包含长形式多镜头序列、完整原始音频、结构化双模态标注。
用途与场景
该数据集专为多镜头长形式音视频生成任务设计,可用于训练和评估能够生成电影级连续音视频内容的模型。
获取方式与状态
- 论文已发布(arXiv: 2606.09639)
- 项目页面已上线
- CineDance-1M 数据集尚未公开发布,计划通过门控访问机制发布(数据总量超过80 TB,正在处理中)
- 数据管理流程代码、推理代码、模型检查点、训练代码等相关资源将在后续发布
学术引用
bibtex @misc{chen2026cinedancenextgenerationmultishotlongform, title={CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation}, author={Yuheng Chen and Teng Hu and Yuji Wang and Qingdong He and Zhucun Xue and Qianyu Zhou and Xiangtai Li and Lizhuang Ma and Jiangning Zhang and Dacheng Tao}, year={2026}, eprint={2606.09639}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2606.09639}, }




