遇见数据集

Deepfake-Identity-Isolated-Dataset-PreP

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

Identity-Isolated Deepfake Face Images Dataset 是一个经过严格预处理、身份感知的深度伪造检测数据集,包含142,837张人脸图像,专为训练跨Face Swap(人脸交换)和Entire Face Synthesis(全脸合成)两大操纵类别的通用深度伪造检测器而构建。该数据集是DFDS项目(一个用于金融科技KYC身份验证的开源深度伪造检测API)的一部分。数据内容包含真实和伪造两类人脸图像,比例接近1:1(真实71,417张,伪造71,420张),所有图像均经过标准化预处理,统一分辨率为260×260像素,来源于多个公开数据集。数据集按70/15/15比例划分为训练集、验证集和测试集,每个样本包含image和label字段。核心特性包括严格的身份隔离、统一的预处理流程以及模型兼容性。适用于深度伪造检测模型的训练与评估,特别是在需要高泛化性和防止身份泄漏的严格研究环境中,如金融科技KYC身份验证。

创建时间:
2026-06-09
原始信息汇总

数据集概述

Identity-Isolated Deepfake Face Images Dataset 是一个经过严格预处理、关注身份隔离的深度伪造检测数据集,专门用于训练泛化能力强的深度伪造检测器,涵盖人脸交换(Face Swap)和全脸合成(Entire Face Synthesis)两类操作。

基本信息

属性
总图像数 142,837 张
真实/伪造比例 71,417 (49.998%) / 71,420 (50.001%)
图像分辨率 260 × 260 像素
人脸检测器 RetinaFace(置信度 ≥ 0.90)
训练/验证/测试划分 70% / 15% / 15%
身份泄露 零 — 基于图的严格身份隔离

数据集拆分

拆分 总图像数 真实 伪造
训练集 99,910 49,934 49,976
验证集 21,611 10,873 10,738
测试集 21,316 10,610 10,706

标签约定

  • 0 = 伪造(fake)
  • 1 = 真实(real)

数据来源

数据集整合自多个公开来源,涵盖两种深度伪造类别,且真实与伪造图像在各自领域内成对出现,防止模型学习来源特定的压缩或相机伪影。

  • 人脸交换(Face Swap, FS)

    • DF40 CDF Domain FS:基于Celeb-DF身份池的高质量换脸数据,包含成对的真实与伪造图像。涉及59名CDF演员,通过严格的身份图约束确保同一身份始终分配在同一数据拆分中。
    • DF40 FF++ Domain FS:基于FaceForensics++身份池的多种换脸方法(FSGAN、FaceSwap、SimSwap、InSwap、BlendFace、MobileSwap、E4S、FaceDancer)的数据,包含成对的真实与伪造图像。所有方法统一构建身份图。
  • 全脸合成(Entire Face Synthesis, EFS)

    • DF40 EFS FF++ Domain(伪造)与FFHQ(真实)配对:DF40 EFS子集(扩散模型方法,如VQGAN和DiT-XL2)完全由合成数据构成。为保持1:1的类别平衡,引入约20,000张来自FFHQ数据集的高分辨率自然面部照片作为真实图像。
    • OpenFake:来自ComplexDataLab OpenFake数据集的GAN时代面部图像,包含自身成对的真实与伪造图像。

预处理流程

所有来源的图像均经过一致的预处理流水线:

  1. RetinaFace人脸检测(置信度 ≥ 0.90,最小人脸尺寸30像素,选择边界框面积最大的面)
  2. 1080p旁路:源帧缩小50%进行检测,检测到的边界框放大回原始分辨率后再裁剪
  3. 25像素填充:在检测到的边界框四周各填充25像素
  4. 模糊过滤:拉普拉斯方差阈值25.0,舍弃低质量裁剪
  5. pHash去重:每个拆分-类别桶内通过BK-tree计算汉明距离 ≤ 2
  6. 双三次插值缩放至260 × 260像素(与EfficientNet-B2原生分辨率一致)
  7. BGR转RGB,JPEG格式保存(质量95)

身份感知拆分策略

为防止身份泄露(即同一人的面部出现在不同数据拆分中),数据集采用无向图方法强制身份隔离:

  • 每个节点代表一个唯一真实身份
  • 两个出现在同一段操作视频中的身份之间建立一条边
  • 图的连通分量被完整分配给同一个数据拆分
  • 跨方法统一构建身份图,实现跨方法和跨拆分的双重身份隔离

结果: 训练、验证和测试拆分之间身份零重叠。随机种子42用于确保完全可重现。

图像分辨率与模型兼容性

  • 原生支持(260×260):适用于EfficientNet-B2,无需插值训练
  • 无损缩小(224×224):可轻松中心裁剪或缩小至该分辨率,适用于ResNet-50、MobileNetV2、VGG-16及标准Vision Transformers(ViT)
  • 轻度放大(299×299):InceptionV3和Xception需要该输入大小,因仅增加15%分辨率,标准双线性插值可接受
  • 大型架构(384×384):对于大型ViT(如ViT-384),建议采用零填充而非插值,以确保高频伪造噪声信号完整。384×384被视为该数据集的硬上限兼容输入尺寸。

基准测试结果

基于EfficientNet-B2(第5次运行)在该数据集上训练获得的性能指标:

指标
测试准确率 96.00%
测试AUC 99.30%
测试F1 0.9597
金融科技相关跨数据集AUC 89.01%

跨数据集评估在DF40基准的8种完全未见过的操作方法上进行。

使用方式

可通过Hugging Face datasets 库直接加载数据集,Parquet格式自动处理,映射出训练、验证和测试拆分。

示例代码: python from datasets import load_dataset dataset = load_dataset("ThinothW/Deepfake-Identity-Isolated-Dataset-PreP") train_data = dataset[train] val_data = dataset[validation] test_data = dataset[test]

若需要按类别严格分离的原始源目录(如仅CDF换脸数据或原始FF++数据),可从Google Drive下载分类归档:下载链接

重要数据完整性警告

  • 原始FF++:因与DF40 FF FS源自同一批源视频,若同时包含两者会导致身份泄露,故仅在Google Drive归档中提供,供独立基准测试使用。
  • 原始FF++与DF40 FF FS不可混用:构建自定义数据加载器时,必须二选一以维持身份隔离。
  • DF40 EFS可安全混合:EFS数据为扩散模型生成的全新合成人脸,不包含源身份信息,与DF40 FF FS(或原始FF++)间不存在身份重叠。

许可证

数据集仅用于学术和研究目的。所有源数据集均受其原始许可证约束,用户需在使用前确保遵守各源数据集的使用条款。

引用

若使用本数据集,请引用其衍生自的源数据集:

  • Yan, Z. et al. (2024). DF40: Toward Next-Generation Deepfake Detection. NeurIPS 2024.
  • Rossler, A. et al. (2019). FaceForensics++. ICCV 2019.
  • Karras, T. et al. (2019). A Style-Based Generator Architecture for GANs. CVPR 2019.

作者

Thinod Wickramasinghe · 普利茅斯大学 · 2026 GitHub:https://github.com/thinothw 项目导师:Dr. Rasika Ranaweera

搜集汇总
数据集介绍
Deepfake-Identity-Isolated-Dataset-PreP 数据集图片
构建方式
该数据集通过精心设计的预处理流水线构建,涵盖人脸检测、质量控制与去重等步骤。首先,利用RetinaFace检测器以不低于0.90的置信度阈值提取人脸,并选取面积最大的面部区域。检测框四周均匀扩展25像素后,通过拉普拉斯方差阈值25.0进行模糊筛查,剔除低质量样本。随后,采用感知哈希算法在每类样本内基于汉明距离不大于2的标准执行去重,确保图像唯一性。最终,所有图像经双三次插值统一缩放至260×260像素分辨率,并转换为RGB色彩空间以JPEG质量95存储。为消除身份泄露风险,基于图论方法构建身份隔离策略:每个真实身份视为节点,同一操作视频中出现的身份间连边,连通分量被完整分配至训练、验证或测试集,确保三组间无任何身份重叠。
特点
该数据集总计包含142,837张人脸图像,正负样本严格均衡,各占约50%。图像分辨率统一为260×260像素,兼顾高保真伪影保留与GPU显存效率。数据集涵盖换脸与全脸合成两大深度伪造类别,来源包括DF40、FaceForensics++、FFHQ及OpenFake等公开数据源,伪造方法跨越传统GAN与扩散模型。其核心特性在于零身份泄露的划分策略:同一真实身份的所有图像被锁定在单一数据分区内,强制模型学习操纵伪影而非身份特征。此外,真实与伪造图像在各域内成对出现,避免模型利用源域特定的压缩或相机伪影。训练、验证与测试集按70%、15%、15%比例划分,最终分别包含99,910、21,611与21,316张图像。
使用方法
用户可通过Hugging Face的datasets库直接加载该数据集,自动获得已划分好的训练、验证与测试子集。加载后,每张图像以PIL格式呈现,标签采用二元分类:0代表伪造,1代表真实。由于图像分辨率为260×260,推荐适配EfficientNet-B2进行零插值训练;若需使用ResNet-50、MobileNetV2等标准224×224架构,可无损下采样或中心裁剪;对于InceptionV3或Xception(需299×299),适度双线性插值通常可行。当目标架构输入尺寸超过299×299时,强烈建议采用零填充而非插值,以保留高频伪影信息。研究者若需访问原始分类子目录(如仅CDF换脸数据),可从Google Drive下载压缩包,但需注意避免混用来源相同的数据子集以防止身份泄露。
背景与挑战
背景概述
Deepfake-Identity-Isolated-Dataset-PreP由普利茅斯大学的Thinod Wickramasinghe与Rasika Ranaweera博士于2026年创建,旨在解决金融科技KYC身份验证场景下的深度伪造检测问题。该数据集包含142,837张人脸图像,涵盖人脸交换与全脸合成两类伪造操纵,严格平衡真实与伪造样本各约50%。其核心创新在于采用图论方法构建身份隔离的数据划分,确保训练、验证和测试集之间无身份泄露,这为评估模型对未见身份与未知伪造方法的泛化能力提供了坚实基础。数据集依托DFDS开源项目,已在跨8种未见操纵方法的DF40基准测试中取得96%的测试准确率与99.30%的AUC值,影响力集中于推动金融安全场景下可部署的深度伪造检测系统发展。
当前挑战
该数据集所解决的领域核心挑战在于跨身份与跨伪造方法的泛化检测能力:传统数据集常因同一身份出现在不同划分中导致模型过度拟合身份特征而非伪造痕迹,进而高估真实泛化性能。为此,构建过程中面临多重技术挑战:统一来自DF40、FaceForensics++、FFHQ等多源异构数据,需解决分辨率、压缩伪影和检测管道差异;实施RetinaFace检测时需平衡置信度阈值与最小人脸尺寸,并设计1080p降采样策略以加速检测;采用pHash去重与拉普拉斯方差模糊过滤确保数据质量;最终通过图连通分量算法强制身份隔离,将涉及同一操纵视频的多个身份永久锁定至同一划分,并统一处理跨方法重叠身份,保障零泄露的可复现分割。
常用场景
经典使用场景
在数字媒体取证领域,深度伪造检测是近年来的研究热点,而构建高泛化能力的检测模型往往受限于训练数据中身份信息的泄露。该数据集通过严密的身份隔离图算法,保证了训练、验证与测试分片之间不存在任何身份重叠,为研究人员提供了一个鲁棒且无偏的基准平台。经典的检测任务场景包含人脸交换与全脸合成两大数据类别,研究者可基于其统一的260x260像素规格、平衡的正负样本分布以及预定义的划分方案,直接加载数据进行深度神经网络训练,适用于EfficientNet、ResNet、Vision Transformer等多种主流架构的迁移学习与性能评估。
解决学术问题
数据集有效解决了深度伪造检测研究中长期存在的身份泄露问题——即模型因在训练与测试集中识别到同一人的面部特征而获得虚高的准确率,从而丧失对未知伪造手法的泛化能力。通过构建跨越多种交换方法的统一身份图,并将同一连通分量严格锁定至单一分片,数据切分的随机性被彻底消除。这一设计首次在百万级人脸数据规模上实现了跨方法、跨域的身份完全隔离,使得基于该数据集训练的模型所报告的检测指标能够真实反映其对伪造痕迹的鉴别能力,推动了泛化深度伪造检测基准的科学性与可信度。
衍生相关工作
依托该数据集的构建方法与设计理念,相关的深伪检测研究已延伸至多个方向。例如,基于EfficientNet-B2的基准模型在测试集上实现了96.00%的准确率与99.30%的AUC值,其在8种未见过的DF40伪造方法上的跨数据集AUC达到89.01%,为后续泛化检测模型的设计提供了性能参照。同时,该数据集还衍生出对身份隔离图算法效率、零填充策略与分辨率匹配对artifact保留的影响等研究方向,进一步催生了面向金融KYC场景的轻量级检测模型、基于视觉Transformer的特征干预方法以及大规模身份图构建工具链的开发。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务