遇见数据集

KlingTeam/CameraClone-Dataset

收藏
Hugging Face2026-03-25 更新2025-11-15 收录
官方服务:

资源简介:

Camera Clone Dataset是一个用于相机克隆学习的大规模合成数据集,包含多样化的场景、主题和相机运动。该数据集由三个视频组成:相机运动参考视频、内容参考视频和目标视频,目标视频使用与相机运动参考视频相同的运动方式重新捕捉内容参考视频的场景。数据集使用Unreal Engine 5渲染,并包含了40个3D场景、66个角色模型和93种动画,相机轨迹满足同时多视角捕捉和配对轨迹的要求。

The Camera Clone Dataset is a large-scale synthetic dataset designed for camera clone learning, encompassing diverse scenes, subjects, and camera movements. It consists of three videos: a camera motion reference video, a content reference video, and a target video, which recaptures the scene in the content reference video with the same camera movement as the camera motion reference video. The dataset is rendered using Unreal Engine 5 and includes 40 3D scenes, 66 character models, and 93 different animations. The camera trajectories meet the requirements of simultaneous multi-view capture and paired trajectories.

提供机构:
KlingTeam
搜集汇总
数据集介绍
KlingTeam/CameraClone-Dataset 数据集图片
构建方式
为应对视频生成中参考式相机控制的数据匮乏问题,研究者借助Unreal Engine 5构建了大规模合成数据集CameraClone-Dataset。数据集核心采用三元组视频结构:相机运动参考视频、内容参考视频与目标视频,其中目标视频以内容参考视频的场景为基底,复现相机运动参考视频的拍摄轨迹。为实现多视角同步捕获与跨场景轨迹配对,在单一场景内部署10台同步相机,分别沿10条预定义轨迹运行;同时将3D位置按四组聚合,确保同一组内各场景重复相同的10条轨迹。相机轨迹通过自动化规则生成,涵盖基本运动、圆弧路径及复杂随机样条线。最终数据集包含391K段来自39,100个不同位置的视频,共计1,155K个三元组。
使用方法
数据集以压缩包形式发布于HuggingFace,用户可通过git-lfs命令克隆仓库后解压使用。核心索引文件CamCloneDataset.csv明确记录了每个三元组的视频路径与对应文本描述,便于按需加载相机参考、内容参考及目标视频。用户可根据自身视频生成模型的输入要求,通过中心裁剪调整视频宽高比,如16:9或9:16,灵活适配不同任务。相关训练与推理代码均已在GitHub开源,配合论文中的方法描述,能够快速复现参考式相机控制实验,推动视频生成中运动迁移技术的研发。
背景与挑战
背景概述
在视频生成领域,精细的相机运动控制是提升生成内容真实感与可控性的核心挑战之一。现有方法多依赖隐式运动建模,难以实现基于参考视频的精确相机轨迹迁移。为突破这一瓶颈,快手科技VGI团队与多位学者在SIGGRAPH Asia 2025会议上提出了CamCloneMaster框架及配套的CameraClone-Dataset,旨在通过显式的相机运动迁移学习填补该领域空白。该数据集创建于2025年,由Yawen Luo、Xiaoyu Shi等研究人员主导开发,其核心研究问题是:如何让模型能够基于一段参考视频的相机运动,精准复刻至另一段内容视频中,从而生成视觉连贯、运动一致的新视频。该数据集采用虚幻引擎5大规模合成渲染,包含391K段高保真视频及115.5万组三元组,覆盖40个多样化场景与66个角色动画,为参考式相机控制研究提供了标准化的训练与评估基准。其发布极大推动了视频生成中相机运动可控性的研究进程,已成为该子领域的重要数据支撑。
当前挑战
CameraClone-Dataset所解决的领域问题是如何实现参考式相机控制,即在不依赖显式几何或深度信息的前提下,使生成模型精确模仿参考视频中的相机运动轨迹并应用于新场景,这对现有视频生成模型的运动理解与泛化能力提出了极高要求。此外,该数据集本身在构建过程中亦面临多重挑战:一方面,需要设计同时满足多视角同步拍摄与跨场景轨迹配对的相机路径生成策略,这要求在每个场景中部署10组相机并确保轨迹在不同位置间精确复制;另一方面,为缩小合成数据与真实视频的域差距,需精心筛选高写实度的3D场景与角色模型,同时兼顾数据多样性以覆盖室内外多种环境;再者,需避免相机轨迹与物体碰撞导致的渲染失效,通过动态调整最大移动距离确保视频质量。这些挑战的妥善解决,保证了数据集在规模、多样性与视觉真实性上的平衡。
常用场景
经典使用场景
在视频生成与计算机视觉的交叉领域中,相机运动的精准控制始终是生成逼真动态内容的核心挑战。CameraClone-Dataset作为一项大规模合成数据集,专门为参考式相机克隆学习而设计,其核心使用场景在于为视频生成模型提供可控的相机运动引导。该数据集组织为三元组视频结构,包含相机运动参考视频、内容参考视频以及目标视频,从而使得模型能够从参考视频中提取运动轨迹,并将其迁移至全新的场景与主体上。这一设计极大地推动了基于参考的相机控制技术的发展,为研究者提供了标准化的训练与评估基准。
解决学术问题
在学术研究中,缺乏大规模、多样化的配对视频数据长期以来制约着相机运动可控的视频生成方法的发展。CameraClone-Dataset通过基于虚幻引擎5的精心渲染流程,系统性地生成了包含39.1万个动态场景、超过115万组三元组视频的高质量数据集,有效解决了数据稀缺与多样性不足的问题。该数据集涵盖40种室内外场景、66个角色模型以及93种动画组合,为解耦场景内容与相机运动的研究奠定了坚实的数据基础。其发布显著促进了视频生成领域中相机控制机制、运动迁移算法以及参考式生成范式等方向的理论探索与实证验证。
实际应用
在实际应用层面,CameraClone-Dataset所支撑的相机克隆技术具有广泛的落地价值。在影视制作与动画工业中,它能够辅助创作者快速复现特定的镜头运镜风格,降低对专业摄影设备和人工经验的依赖。在虚拟现实与增强现实内容生成中,该数据集可用于开发能够将用户指定相机轨迹自动映射至虚拟场景的工具,提升沉浸式体验的创作效率。此外,在游戏开发、广告创意以及短视频平台的内容生产流程中,基于该数据集的模型能够实现基于参考视频的自动运镜迁移,显著节约人力成本并加速内容产出。
数据集最近研究
最新研究方向
CameraClone-Dataset的发布为视频生成领域带来了基于参考的相机控制新范式,标志着生成式AI从内容可控迈向运动可控的关键突破。该数据集通过虚幻引擎5合成大规模三元组视频(相机参考、内容参考与目标视频),实现了相机轨迹与视觉内容的解耦学习,为复杂相机运动克隆提供了海量高质量训练数据。当前前沿方向聚焦于将此类合成数据与扩散模型结合,推动视频生成在影视级运镜、虚拟拍摄、游戏CG等场景中的落地应用。CamCloneMaster作为奠基性工作,揭示了相机运动可控性的微调策略与轨迹表征机制,其引发的研究热潮正重塑视频生成的技术路线,为构建具身智能与空间感知生成系统奠定重要基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务