SCoPE-Gallery
收藏资源简介:
SCoPE Project Gallery 数据集包含182个由SCoPE模型(Sightline-Coordinate Positional Encoding for Video Diffusion Transformers)生成的视频片段,用于项目展示页面。每个视频均由单个输入帧和一条目标相机轨迹生成,并采用画中画叠加方式可视化所指令的相机运动。数据集包含两个视频目录:videos/(原始质量)和videos_crf22/(CRF 22压缩的Web预览版本),两者使用相同的文件名。此外,还提供metadata.csv元数据文件,包含字段:file_name(MP4文件路径)、section(项目页面章节)、gallery(画廊/甲板标签)、motion(显示的相机运动标签)。该数据集主要用于研究可控相机运动在生成视频中的应用,以及复现SCoPE项目页面画廊,不作为训练数据使用。数据集规模小于1000个样本,采用CC BY-NC 4.0许可。
The SCoPE Project Gallery dataset contains 182 video clips generated by the SCoPE model (Sightline-Coordinate Positional Encoding for Video Diffusion Transformers) for the project gallery page. Each video is generated from a single input frame and a target camera trajectory, with a picture-in-picture overlay to visualize the commanded camera motion. The dataset includes two video directories: videos/ (original quality) and videos_crf22/ (CRF 22 compressed web preview versions), using the same file names. Additionally, a metadata.csv file is provided with fields: file_name (MP4 file path), section (project page section), gallery (gallery/deck label), and motion (camera motion label displayed). The dataset is primarily intended for research on controllable camera motion in video generation and for reproducing the SCoPE project page gallery, not as training data. The dataset size is less than 1000 samples, licensed under CC BY-NC 4.0.
数据集概述
SCoPE Project Gallery 是由 Michaelqaz 上传至 Hugging Face 的数据集,包含 182 个由 SCoPE 项目页面使用的生成结果视频。每个视频片段均由单个输入帧和指定的相机轨迹生成,并通过画中画叠加方式可视化所控制的相机运动。
基本信息
- 许可证:CC BY-NC 4.0(知识共享署名-非商业使用 4.0 国际许可)
- 任务类别:图像到视频(image-to-video)
- 数据集规模:n < 1K(样本数量小于 1000)
- 标签:视频、视频生成、相机控制、SCoPE、arXiv:2606.27345
数据集结构
数据集包含三个主要组成部分:
- videos/ 目录:存放原始质量的 MP4 视频文件,由灯箱(lightbox)加载
- videos_crf22/ 目录:存放 CRF 22 压缩的网页预览视频,由画廊卡片加载
- metadata.csv 文件:包含视频元信息
两个视频目录使用完全相同的文件名。项目页面在浏览时优先加载体积较小的 CRF 22 版本,当用户打开灯箱查看时才请求原始版本。
metadata.csv 字段说明
| 字段名 | 说明 |
|---|---|
file_name |
MP4 文件的路径 |
section |
项目页面的分区名称 |
gallery |
画廊/展示组的标签 |
motion |
展示的相机运动标签 |
预期用途
这些视频作为研究结果示例,用途包括:
- 研究生成视频中可控相机运动的效果
- 复现 SCoPE 项目页面的画廊展示
该数据集并非用于训练发布的 SCoPE 模型,不包含任何训练数据。
相关链接
- 项目页面:https://visual-ai.github.io/scope/
- 论文:https://arxiv.org/abs/2606.27345
- 代码:https://github.com/TencentARC/SCoPE
- 模型:https://huggingface.co/TencentARC/SCoPE
引用信息
如需引用,可使用以下 BibTeX 格式:
bibtex @article{yin2026scope, title={SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers}, author={Yin, Minghao and Lu, Jiahao and Hu, Wenbo and Zhao, Wang and Shan, Ying and Han, Kai}, journal={arXiv preprint arXiv:2606.27345}, year={2026} }




