遇见数据集

SCoPE-Gallery

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

SCoPE Project Gallery 数据集包含182个由SCoPE模型(Sightline-Coordinate Positional Encoding for Video Diffusion Transformers)生成的视频片段,用于项目展示页面。每个视频均由单个输入帧和一条目标相机轨迹生成,并采用画中画叠加方式可视化所指令的相机运动。数据集包含两个视频目录:videos/(原始质量)和videos_crf22/(CRF 22压缩的Web预览版本),两者使用相同的文件名。此外,还提供metadata.csv元数据文件,包含字段:file_name(MP4文件路径)、section(项目页面章节)、gallery(画廊/甲板标签)、motion(显示的相机运动标签)。该数据集主要用于研究可控相机运动在生成视频中的应用,以及复现SCoPE项目页面画廊,不作为训练数据使用。数据集规模小于1000个样本,采用CC BY-NC 4.0许可。

The SCoPE Project Gallery dataset contains 182 video clips generated by the SCoPE model (Sightline-Coordinate Positional Encoding for Video Diffusion Transformers) for the project gallery page. Each video is generated from a single input frame and a target camera trajectory, with a picture-in-picture overlay to visualize the commanded camera motion. The dataset includes two video directories: videos/ (original quality) and videos_crf22/ (CRF 22 compressed web preview versions), using the same file names. Additionally, a metadata.csv file is provided with fields: file_name (MP4 file path), section (project page section), gallery (gallery/deck label), and motion (camera motion label displayed). The dataset is primarily intended for research on controllable camera motion in video generation and for reproducing the SCoPE project page gallery, not as training data. The dataset size is less than 1000 samples, licensed under CC BY-NC 4.0.

创建时间:
2026-08-12
原始信息汇总

数据集概述

SCoPE Project Gallery 是由 Michaelqaz 上传至 Hugging Face 的数据集,包含 182 个由 SCoPE 项目页面使用的生成结果视频。每个视频片段均由单个输入帧和指定的相机轨迹生成,并通过画中画叠加方式可视化所控制的相机运动。

基本信息

  • 许可证:CC BY-NC 4.0(知识共享署名-非商业使用 4.0 国际许可)
  • 任务类别:图像到视频(image-to-video)
  • 数据集规模:n < 1K(样本数量小于 1000)
  • 标签:视频、视频生成、相机控制、SCoPE、arXiv:2606.27345

数据集结构

数据集包含三个主要组成部分:

  • videos/ 目录:存放原始质量的 MP4 视频文件,由灯箱(lightbox)加载
  • videos_crf22/ 目录:存放 CRF 22 压缩的网页预览视频,由画廊卡片加载
  • metadata.csv 文件:包含视频元信息

两个视频目录使用完全相同的文件名。项目页面在浏览时优先加载体积较小的 CRF 22 版本,当用户打开灯箱查看时才请求原始版本。

metadata.csv 字段说明

字段名 说明
file_name MP4 文件的路径
section 项目页面的分区名称
gallery 画廊/展示组的标签
motion 展示的相机运动标签

预期用途

这些视频作为研究结果示例,用途包括:

  • 研究生成视频中可控相机运动的效果
  • 复现 SCoPE 项目页面的画廊展示

该数据集并非用于训练发布的 SCoPE 模型,不包含任何训练数据。

相关链接

  • 项目页面:https://visual-ai.github.io/scope/
  • 论文:https://arxiv.org/abs/2606.27345
  • 代码:https://github.com/TencentARC/SCoPE
  • 模型:https://huggingface.co/TencentARC/SCoPE

引用信息

如需引用,可使用以下 BibTeX 格式:

bibtex @article{yin2026scope, title={SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers}, author={Yin, Minghao and Lu, Jiahao and Hu, Wenbo and Zhao, Wang and Shan, Ying and Han, Kai}, journal={arXiv preprint arXiv:2606.27345}, year={2026} }

搜集汇总
数据集介绍
SCoPE-Gallery 数据集图片
构建方式
SCoPE-Gallery数据集是为视频扩散Transformer模型SCoPE构建的演示性资源,收录了182个由单帧输入图像与目标相机轨迹联合生成的结果视频片段。每个视频均以画中画形式叠加了指令相机运动的可视化,直观呈现模型对视角变化的控制能力。数据集的MP4文件采用独立可寻址的存储方式,便于网页按需流式加载;同时提供原始画质与CRF 22网络预览两个版本,文件名保持一致,以适配不同浏览场景。元数据文件metadata.csv则记录了每个视频的文件路径、所属项目板块、画廊标签及展示的相机运动类型,为结果的分类与检索提供了结构化支持。
特点
该数据集的核心特点在于其专注于视频生成中的相机控制,每个视频均由单帧图像驱动,并带有明确的相机运动标注,如旋转、平移等,从而为研究相机轨迹对生成内容影响的学者提供了直观的对照样本。数据集的规模虽小,但视频内容多样性覆盖了项目展示所需的各类运动模式。此外,视频采用双版本保留策略,兼顾了网页浏览的流畅性与细节观察的完整性,而CC BY-NC 4.0许可允许非商业用途的二次使用,为复现项目画廊或进一步研究提供了便利。
使用方法
SCoPE-Gallery主要适用于两类场景:一是研究可控相机运动在视频生成中的表现,研究者可通过分析视频内容与运动标注的对应关系,评估SCoPE模型的动态控制能力;二是复现SCoPE项目页面的画廊展示,按metadata.csv中的section和gallery字段组织视频,并依据场景选择CRF 22预览版或原始版本进行播放。值得注意的是,此数据集并非训练数据,而是生成结果的示范样例,因而需避免将其用作模型训练的输入。使用时可通过版权许可条款,合规地引用或展示这些视频以支持学术交流。
背景与挑战
背景概述
SCoPE-Gallery数据集由腾讯ARC实验室的研究团队于2026年创建,核心研究人员包括Yin Minghao、Lu Jiahao、Hu Wenbo等人。该数据集旨在支撑视频扩散Transformer(Video Diffusion Transformers)中可控相机运动的研究,通过提供182个从单一输入帧和目标相机轨迹生成的视频片段,直观展示了SCoPE(视向坐标位置编码)方法在相机控制方面的成效。这些视频不仅验证了模型对相机运动的精确操控能力,也为后续研究提供了标准化示例,推动了视频生成领域在动态场景控制方向的发展。其配套论文发表于arXiv,项目页面和代码均已公开,为领域内学者提供了可复现的基准,影响力显著。
当前挑战
该数据集所应对的领域挑战在于视频生成中的相机运动控制,传统生成模型难以准确遵循用户指定的相机轨迹,导致生成视频的视角变化不自然或缺乏物理一致性。SCoPE通过创新的位置编码策略解决了这一问题,但构建过程中同样面临多重困难:确保生成的视频在保持内容连贯性的同时精确匹配复杂轨迹,需要大量调优;数据集的多样性覆盖了多种运动类型,但标注运动标签的准确性和一致性难以保证;此外,视频压缩(CRF 22版本)在保证网页流畅播放的同时,需尽量保留原始质量,以平衡存储与视觉保真度。这些挑战的克服,使得该数据集成为该领域技术验证与比较的重要工具。
常用场景
经典使用场景
SCoPE-Gallery数据集作为视频生成领域的一项精心构筑的实证资源,其核心用途在于为可控摄像机运动视频生成研究提供标准化的视觉验证平台。该数据集收录了182段由单一输入帧与指定摄像机轨迹生成的视频片段,并通过画中画叠加形式直观展示命令运动的执行效果。研究者可借助这一资源,对视频扩散 transformers 中的视点坐标位置编码机制进行定性评估与对比分析,从而深入探索摄像机运动控制策略对生成视频质量与一致性的影响。其合理设计的目录结构与元数据支持高效的批量检索与可视化呈现,为领域内学者搭建了一座连接理论创新与实验验证的坚实桥梁。
衍生相关工作
围绕SCoPE-Gallery数据集及其核心方法,已涌现出一系列衍生研究,主要集中于视频扩散 transformers 的架构优化与摄像机运动建模。后续工作一方面借鉴了其视点坐标位置编码的设计思想,尝试在更复杂的动态场景中引入多摄像机协同控制;另一方面,该数据集常被用作评估不同运动控制模块性能的标准测试床,衍生出诸如基于注意力机制的轨迹插值、自适应运动缩放等改良方案。此外,一些研究也将其视频样本用于半监督或自监督学习范式的预训练,以增强模型对新场景的泛化能力。这些工作共同推动了可控视频生成从单一运动控制向多维度交互合成的纵深发展。
数据集最近研究
最新研究方向
SCoPE-Gallery数据集聚焦于视频扩散Transformer中可控摄像机运动的前沿探索,通过单帧图像与目标轨迹的精准绑定,为生成视频的视角操控提供了全新范式。该数据集承载着182个由SCoPE模型生成的高质量视频样本,其画中画叠加视觉化呈现了摄像机运动指令,极大便利了研究者对运动控制机制的直观理解与复现。结合腾讯ARC实验室的最新成果,这一资源正助力推动视频生成领域从静态内容合成向动态视角操控的变革,为电影制作、虚拟现实及自动驾驶仿真等应用奠定了坚实基础,其CC BY-NC 4.0许可亦保障了学术研究的开放性与可重复性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务