遇见数据集

celebv-HQ-raw-videos

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

CelebV-HQ Raw Videos 数据集提供了 CelebV-HQ 数据集中对应的原始源视频。目前广泛使用的 CelebV-HQ 版本主要由 512×512 的面部中心剪辑组成,背景内容有限。这些剪辑虽然适用于许多面部相关任务,但在训练需要更高分辨率或更大视野的模型时可能不够理想。因此,本仓库提供了原始源视频(如果公开可用),用户可以使用 CelebV-HQ 作者发布的官方 JSON 标注文件,按照所需分辨率和空间裁剪来提取剪辑。仓库内容包含从原始视频 URL 下载的源视频,以及一个列出无法下载的视频 ID 的文件(unavailable_ids.txt)。视频不可用的原因包括原视频被删除、设为私有或受地区限制。用户可以通过下载本仓库的原始视频,获取官方 JSON 标注文件,然后利用其中的开始/结束时间戳来提取对应视频片段。

CelebV-HQ Raw Videos dataset provides the original source videos corresponding to the CelebV-HQ dataset. These videos allow users to extract clips with desired resolution and spatial cropping, suitable for training models requiring higher resolution or larger field of view. The repository contains source videos downloaded from original URLs and a file listing unavailable video IDs.

创建时间:
2026-07-29
原始信息汇总

数据集概述

CelebV-HQ Raw Videos 提供了 CelebV-HQ 数据集的原始源视频。该数据集包含约 10K 到 100K 个视频样本,语言标注为英文。

背景与目的

目前网络上常见的 CelebV-HQ 版本主要由 512×512 的以人脸为中心的片段组成,背景内容有限。这些片段虽然适用于许多人脸相关任务,但不适合需要更高分辨率或更大视野的模型训练。本数据集通过提供原始源视频(在公开可获取的情况下),使用户能够根据 CelebV-HQ 作者发布的官方 JSON 标注文件,按所需分辨率和空间裁剪方式自行提取视频片段。

数据内容

  • 原始源视频:从原始视频 URL 下载。
  • unavailable_ids.txt:列出无法下载的视频 ID 列表。

不可用视频

部分视频因以下原因无法下载:

  • 原始视频已被删除。
  • 视频已被设置为私密。
  • 地区限制。

这些视频的 ID 记录在 unavailable_ids.txt 文件中。

使用官方标注

原始 CelebV-HQ 项目提供了包含每个片段时间边界的 JSON 标注文件。用户可按以下步骤生成所需片段:

  1. 从本仓库下载原始视频。
  2. 从 CelebV-HQ 原始发布中获取官方 JSON 标注文件。
  3. 利用 JSON 文件中的开始/结束时间戳提取对应的视频片段。

引用

使用本仓库时,请引用原始的 CelebV-HQ 论文(详见 README 中的 BibTeX 引用)。

声明

  • 本仓库仅重新分发在收集时公开可访问的视频。
  • 每个视频的版权归其原始所有者所有。
  • 若您是任何内容的版权所有者并希望移除,请联系作者,将及时处理请求。

致谢

感谢 CelebV-HQ 的作者收集并发布了这一宝贵的数据集。

搜集汇总
数据集介绍
celebv-HQ-raw-videos 数据集图片
构建方式
本数据集以CelebV-HQ为基础,针对其公开版本中常见的512×512人脸中心裁剪片段在分辨率与视野上的局限,重新汇集了原始源视频资源。构建过程严格遵循原始数据的可获取性,从公开的视频源URL下载,并辅以官方JSON标注文件,确保用户能依据自定义需求在任意分辨率与空间裁剪下提取视频片段。同时,对于因删除、私有化或区域限制而无法获取的视频,以unavailable_ids.txt文件明确记录,保障了数据集的透明性与完整性。
特点
该数据集的显著特点在于其原始性与灵活性。它突破了传统CelebV-HQ版本在分辨率和背景内容上的限制,为用户提供了高分辨率、大视野的视频源,极大拓展了适用场景。此外,数据集详尽标注了不可用视频的ID,便于用户识别数据缺失情况,优化训练策略。其与官方JSON标注的无缝结合,确保了时序边界的准确对应,使得数据提取既精准又高效,为面部属性分析、视频生成等前沿研究提供了坚实的数据基础。
使用方法
使用本数据集时,用户需先从此仓库获取原始视频,并同步获取CelebV-HQ官方发布的JSON标注文件。依据标注中的起始与结束时间戳,通过FFmpeg等工具精准切割对应片段,即可得到满足特定分辨率与裁剪要求的定制化训练数据。对于不可用视频,可参考unavailable_ids.txt文件进行筛选替代。此外,用户在使用时应遵循原始视频的版权规定,并引用CelebV-HQ原论文,以尊重原作者贡献,确保学术规范性。
背景与挑战
背景概述
CelebV-HQ Raw Videos数据集由新加坡南洋理工大学等机构的研究人员于2022年创建,旨在补充CelebV-HQ数据集在原始视频层面的缺失,为高分辨率、大视野的人脸视频分析研究提供基础数据。该数据集汇集了公开可获取的原始视频,并配套官方标注文件,支持用户按需裁剪,其发布为视频人脸属性识别、生成与编辑等任务提供了重要资源,推动了相关领域的发展。
当前挑战
该数据集面临的挑战包括:原始视频的不可用性,如视频被删除、设为私密或受地域限制,导致数据缺失;高分辨率视频的存储与传输成本高昂,对数据获取和应用构成限制;此外,视频版权归属复杂,需谨慎处理合法使用与再分发问题,同时原始视频解析度的不统一也为标注和模型训练带来一致性难题。
常用场景
经典使用场景
CelebV-HQ Raw Videos数据集作为CelebV-HQ原始视频源的集合,为面部属性分析研究提供了高分辨率、大视野的视频素材。其经典使用场景在于根据官方JSON注释文件中的时间戳,从原始视频中裁剪出特定片段,以满足不同任务对分辨率或空间裁剪的需求。该数据集尤其适用于训练需要更高分辨率或更广泛背景信息的生成模型,如高保真面部编辑、视频超分辨率以及动态面部动画合成等,为研究者提供了灵活的预处理基础。
解决学术问题
该数据集解决了现有CelebV-HQ公开版本因低分辨率和背景缺失而限制模型性能的问题。通过提供原始视频,研究者能够在自定义分辨率和裁剪方式下重建数据,从而支持更高精度的面部属性识别、视频生成以及时空一致性建模等学术探索。其开源性也促进了数据集的扩展与验证,推动了面部视频领域在复杂场景下的鲁棒性研究,为公平比较不同算法提供了重要基准。
衍生相关工作
该数据集的发布催生了一系列基于CelebV-HQ的衍生工作,涵盖面部属性编辑、视频驱动动画和语音驱动的说话头生成等方向。例如,研究者利用此原始视频资源改进了现有的视频生成框架,开发了更高质量的面部重演和表情迁移模型。同时,该数据集也被用于评估视频潜在空间的解耦性和连续性,促进了风格迁移、姿态控制以及3D面部重建等技术的发展,形成了丰富的学术生态链。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务