Deepfake-Identity-Isolated-Dataset-PreP
收藏资源简介:
Identity-Isolated Deepfake Face Images Dataset 是一个经过严格预处理、身份感知的深度伪造检测数据集,包含142,837张人脸图像,专为训练跨Face Swap(人脸交换)和Entire Face Synthesis(全脸合成)两大操纵类别的通用深度伪造检测器而构建。该数据集是DFDS项目(一个用于金融科技KYC身份验证的开源深度伪造检测API)的一部分。数据内容包含真实和伪造两类人脸图像,比例接近1:1(真实71,417张,伪造71,420张),所有图像均经过标准化预处理,统一分辨率为260×260像素,来源于多个公开数据集。数据集按70/15/15比例划分为训练集、验证集和测试集,每个样本包含image和label字段。核心特性包括严格的身份隔离、统一的预处理流程以及模型兼容性。适用于深度伪造检测模型的训练与评估,特别是在需要高泛化性和防止身份泄漏的严格研究环境中,如金融科技KYC身份验证。
数据集概述
Identity-Isolated Deepfake Face Images Dataset 是一个经过严格预处理、关注身份隔离的深度伪造检测数据集,专门用于训练泛化能力强的深度伪造检测器,涵盖人脸交换(Face Swap)和全脸合成(Entire Face Synthesis)两类操作。
基本信息
| 属性 | 值 |
|---|---|
| 总图像数 | 142,837 张 |
| 真实/伪造比例 | 71,417 (49.998%) / 71,420 (50.001%) |
| 图像分辨率 | 260 × 260 像素 |
| 人脸检测器 | RetinaFace(置信度 ≥ 0.90) |
| 训练/验证/测试划分 | 70% / 15% / 15% |
| 身份泄露 | 零 — 基于图的严格身份隔离 |
数据集拆分
| 拆分 | 总图像数 | 真实 | 伪造 |
|---|---|---|---|
| 训练集 | 99,910 | 49,934 | 49,976 |
| 验证集 | 21,611 | 10,873 | 10,738 |
| 测试集 | 21,316 | 10,610 | 10,706 |
标签约定
0= 伪造(fake)1= 真实(real)
数据来源
数据集整合自多个公开来源,涵盖两种深度伪造类别,且真实与伪造图像在各自领域内成对出现,防止模型学习来源特定的压缩或相机伪影。
-
人脸交换(Face Swap, FS)
- DF40 CDF Domain FS:基于Celeb-DF身份池的高质量换脸数据,包含成对的真实与伪造图像。涉及59名CDF演员,通过严格的身份图约束确保同一身份始终分配在同一数据拆分中。
- DF40 FF++ Domain FS:基于FaceForensics++身份池的多种换脸方法(FSGAN、FaceSwap、SimSwap、InSwap、BlendFace、MobileSwap、E4S、FaceDancer)的数据,包含成对的真实与伪造图像。所有方法统一构建身份图。
-
全脸合成(Entire Face Synthesis, EFS)
- DF40 EFS FF++ Domain(伪造)与FFHQ(真实)配对:DF40 EFS子集(扩散模型方法,如VQGAN和DiT-XL2)完全由合成数据构成。为保持1:1的类别平衡,引入约20,000张来自FFHQ数据集的高分辨率自然面部照片作为真实图像。
- OpenFake:来自ComplexDataLab OpenFake数据集的GAN时代面部图像,包含自身成对的真实与伪造图像。
预处理流程
所有来源的图像均经过一致的预处理流水线:
- RetinaFace人脸检测(置信度 ≥ 0.90,最小人脸尺寸30像素,选择边界框面积最大的面)
- 1080p旁路:源帧缩小50%进行检测,检测到的边界框放大回原始分辨率后再裁剪
- 25像素填充:在检测到的边界框四周各填充25像素
- 模糊过滤:拉普拉斯方差阈值25.0,舍弃低质量裁剪
- pHash去重:每个拆分-类别桶内通过BK-tree计算汉明距离 ≤ 2
- 双三次插值缩放至260 × 260像素(与EfficientNet-B2原生分辨率一致)
- BGR转RGB,JPEG格式保存(质量95)
身份感知拆分策略
为防止身份泄露(即同一人的面部出现在不同数据拆分中),数据集采用无向图方法强制身份隔离:
- 每个节点代表一个唯一真实身份
- 两个出现在同一段操作视频中的身份之间建立一条边
- 图的连通分量被完整分配给同一个数据拆分
- 跨方法统一构建身份图,实现跨方法和跨拆分的双重身份隔离
结果: 训练、验证和测试拆分之间身份零重叠。随机种子42用于确保完全可重现。
图像分辨率与模型兼容性
- 原生支持(260×260):适用于EfficientNet-B2,无需插值训练
- 无损缩小(224×224):可轻松中心裁剪或缩小至该分辨率,适用于ResNet-50、MobileNetV2、VGG-16及标准Vision Transformers(ViT)
- 轻度放大(299×299):InceptionV3和Xception需要该输入大小,因仅增加15%分辨率,标准双线性插值可接受
- 大型架构(384×384):对于大型ViT(如ViT-384),建议采用零填充而非插值,以确保高频伪造噪声信号完整。384×384被视为该数据集的硬上限兼容输入尺寸。
基准测试结果
基于EfficientNet-B2(第5次运行)在该数据集上训练获得的性能指标:
| 指标 | 值 |
|---|---|
| 测试准确率 | 96.00% |
| 测试AUC | 99.30% |
| 测试F1 | 0.9597 |
| 金融科技相关跨数据集AUC | 89.01% |
跨数据集评估在DF40基准的8种完全未见过的操作方法上进行。
使用方式
可通过Hugging Face datasets 库直接加载数据集,Parquet格式自动处理,映射出训练、验证和测试拆分。
示例代码: python from datasets import load_dataset dataset = load_dataset("ThinothW/Deepfake-Identity-Isolated-Dataset-PreP") train_data = dataset[train] val_data = dataset[validation] test_data = dataset[test]
若需要按类别严格分离的原始源目录(如仅CDF换脸数据或原始FF++数据),可从Google Drive下载分类归档:下载链接。
重要数据完整性警告
- 原始FF++:因与DF40 FF FS源自同一批源视频,若同时包含两者会导致身份泄露,故仅在Google Drive归档中提供,供独立基准测试使用。
- 原始FF++与DF40 FF FS不可混用:构建自定义数据加载器时,必须二选一以维持身份隔离。
- DF40 EFS可安全混合:EFS数据为扩散模型生成的全新合成人脸,不包含源身份信息,与DF40 FF FS(或原始FF++)间不存在身份重叠。
许可证
数据集仅用于学术和研究目的。所有源数据集均受其原始许可证约束,用户需在使用前确保遵守各源数据集的使用条款。
引用
若使用本数据集,请引用其衍生自的源数据集:
- Yan, Z. et al. (2024). DF40: Toward Next-Generation Deepfake Detection. NeurIPS 2024.
- Rossler, A. et al. (2019). FaceForensics++. ICCV 2019.
- Karras, T. et al. (2019). A Style-Based Generator Architecture for GANs. CVPR 2019.
作者
Thinod Wickramasinghe · 普利茅斯大学 · 2026 GitHub:https://github.com/thinothw 项目导师:Dr. Rasika Ranaweera




