Cine250K
收藏资源简介:
Cine250K是一个包含250,000个视频-文本对的数据集,每个视频都有详细的镜头标签和分层注释。该数据集是从Vimeo上633,000个精心编辑的视频中筛选和标注而成的,旨在为视频扩散模型生成电影式的过渡和多镜头视频提供丰富的先验知识。Cine250K的特点是高质量的视频内容、精确的镜头标签和分层注释,这使得它非常适合用于生成具有真实电影编辑风格的视频。该数据集还提供了详细的视频描述和每个镜头的描述,为多镜头视频生成研究提供了丰富的资源和参考。
Cine250K is a dataset comprising 250,000 video-text pairs, with each video accompanied by detailed shot labels and hierarchical annotations. This dataset is constructed by screening and annotating 633,000 carefully edited videos sourced from Vimeo, and is intended to provide rich prior knowledge for generating cinematic transitions and multi-shot videos using video diffusion models. Featuring high-quality video content, precise shot labels and hierarchical annotations, Cine250K is highly suitable for generating videos with authentic cinematic editing styles. Additionally, the dataset offers detailed video-level descriptions and per-shot descriptions, serving as a valuable resource and reference for research on multi-shot video generation.
数据集概述:CineTrans
基本信息
- 标题: CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models
- 作者: Xiaoxue Wu, Bingjie Gao, Yu Qiao, Yaohui Wang, Xinyuan Chen
- 提交日期: 15 Aug 2025
- arXiv标识符: arXiv:2508.11484
- DOI: https://doi.org/10.48550/arXiv.2508.11484
- 领域: Computer Vision and Pattern Recognition (cs.CV)
数据集描述
- 数据集名称: Cine250K
- 特点: 包含详细的镜头注释的多镜头视频文本数据集
- 用途: 用于研究电影编辑风格和多镜头视频生成
方法概述
- 框架: CineTrans
- 技术: 基于掩码扩散模型的视频生成框架
- 创新点:
- 通过分析扩散模型中的注意力图与镜头边界的对应关系,设计了一种基于掩码的控制机制
- 支持在任意位置进行镜头转换,并在无需训练的情况下有效迁移
实验结果
- 性能:
- 生成具有电影风格转换的连贯多镜头视频
- 避免不稳定转换或简单拼接
- 评估指标: 专门针对转换控制、时间一致性和整体质量的评估指标
- 比较: 在所有标准上显著优于现有基线
相关资源
- 论文链接: https://arxiv.org/abs/2508.11484
- PDF链接: https://arxiv.org/pdf/2508.11484
- HTML链接: https://arxiv.org/html/2508.11484
- TeX源码: https://arxiv.org/format/2508.11484
其他信息
- 页数: 27页
- 图表: 20幅

- 1CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models复旦大学, 上海人工智能实验室, 上海交通大学 · 2025年



