awesome-deepfake-porn-detection
收藏官方服务:
资源简介:
该合集收集了与Deepfake生成、检测以及色情内容检测相关的多个数据集资源,涵盖深度学习在伪造视频和图像识别领域的应用。合集组织方式包括论文、代码仓库和数据集列表,主题覆盖人脸交换、GAN生成内容检测和NSFW内容识别等。
This collection compiles multiple dataset resources related to Deepfake generation, detection and NSFW content detection, covering the applications of deep learning in the field of forged video and image recognition. The collection includes papers, code repositories and dataset lists, with topics covering face swapping, GAN-generated content detection, NSFW content recognition and other related contents.
创建时间:
2019-05-16
原始信息汇总
数据集概述
该页面是一个关于“Deepfake / 色情内容检测”的精选资源列表,旨在促进相关领域的研究与开发。页面内容主要分为三大类:生成、检测和数据集。
生成(Part 1: Generate)
本部分聚焦于 Deepfake 生成技术(不限于色情内容),包含研究论文与代码仓库。
- 研究论文:共列出 9 篇相关论文,发表时间跨度为 2018 年 7 月至 2019 年 1 月,主要涉及利用深度学习进行人脸伪造与检测的技术,如人脸视频画像、紧凑型伪造检测网络(MesoNet)、GAN 检测、胶囊网络检测、基于瞳孔与眨眼检测等。
- 代码仓库:共列出 6 个相关项目,包括 Faceswap、DeepFaceLab、Faceswap-GAN 等主流人脸替换工具,以及用于生成逼真伪造图像的 DeepfakeCapsuleGAN。
- 关键词:Deepfake, Faceswap, GAN
检测(Part 2: Detect)
本部分侧重于通用的色情内容(Pornography/NSFW)检测技术,同样包含研究论文与代码仓库。
- 研究论文:共列出 6 篇论文,发表时间跨度为 2016 年 9 月至 2019 年 2 月,涵盖了基于视频时空信息、深度多实例学习、卷积与循环神经网络等方法。
- 代码仓库:共列出 4 个项目,包括 Yahoo 的 open_nsfw、miles-deep、NSFWDetector 以及基于 Tensorflow JS 的 nsfwjs。
- 关键词:Porn detection, NSFW
数据集(Part 3: Dataset)
本部分提供用于训练 NSFW(不适合工作场合)分类器的数据集资源。
- NPDI 数据集:Google 色情数据库,包含几乎 80 小时的 400 个色情视频和 400 个非色情视频。来源:Google Pornography Database(https://sites.google.com/site/pornographydatabase/)
- NSFW Data Scraper:用于聚合训练 NSFW 图像分类器所需图像数据的脚本集合。来源:GitHub(https://github.com/alexkimxyz/nsfw_data_scraper)
- NSFW data source URLs:用于训练 NSFW 图像分类器的 NSFW 图像 URL 集合。来源:GitHub(https://github.com/EBazarov/nsfw_data_source_urls)
搜集汇总
数据集介绍

构建方式
在数字媒体安全领域,深度伪造与色情内容的自动检测已成为亟待攻克的技术难关。该数据集并非传统意义上的单一数据集合,而是一个精心编纂的知识库与资源索引。其构建方式基于对大量开源文献与代码仓库的系统性梳理,按照“生成-检测-数据集”三大逻辑模块进行组织。生成模块收录了Faceswap、DeepFaceLab等主流人脸交换工具及其相关研究论文;检测模块则汇聚了如open_nsfw、nsfwjs等基于深度学习的色情内容识别框架;数据集模块则引用了NPDI等公开的色情与正常视频数据库。通过这种多维度、分层次的资源整合,为研究者提供了从技术原理到实践工具的完整参考链路。
特点
该资源库最鲜明的特质在于其高度的系统性与伦理导向性。它并非简单罗列工具,而是通过清晰的技术分类(生成与检测)和严谨的学术引用,构建了一个结构化的知识图谱。所有收录的论文均标注了发表年份、代码链接及官方项目页面,便于追溯原始研究。尤为值得称道的是,项目在开篇即强调了伦理使用原则,明确声明其目的在于促进研究与发展,而非助长恶意内容创作。这种对技术伦理的自觉审视,使得该资源库在学术价值之外,更彰显了负责任的研究态度。
使用方法
研究者可依据自身需求,通过该资源库的目录导航快速定位目标领域。若希望了解深度伪造视频的生成机制,可查阅Part 1中的研究论文与代码仓库,例如通过Faceswap项目学习人脸替换的基本流程。若专注于色情内容检测,则Part 2提供了从传统方法到深度学习模型的完整论文列表,以及可直接部署的检测工具如open_nsfw。对于需要训练数据的研究团队,Part 3明确列出了NPDI等公开数据集的获取方式。此外,所有资源均附有直接链接,用户可通过单击访问论文原文或代码仓库,实现从理论到实践的快速衔接。
背景与挑战
背景概述
随着深度学习技术的迅猛发展,尤其是生成对抗网络(GAN)和自编码器等模型的成熟,深度伪造(Deepfake)技术得以生成高度逼真的虚假人脸图像与视频,这一技术被滥用于制作色情内容,对个人隐私、社会伦理及网络安全构成了严峻威胁。在此背景下,该数据集资源列表于2018年至2019年间由研究人员Subinium等人整理并维护,旨在系统性地汇聚深度伪造与色情内容检测领域的前沿研究成果、开源代码及可用数据集。其核心研究问题聚焦于如何利用深度学习算法高效、准确地识别和抵御由AI生成的虚假视觉内容,特别是涉及人脸替换的合成媒体。该资源集成为学术界和工业界提供了关键的知识索引,推动了伪造检测技术的快速发展,对提升数字媒体取证能力与维护网络空间清朗具有重要影响力。
当前挑战
该领域面临的核心挑战在于:首先,深度伪造生成技术迭代迅速,新型伪造算法不断涌现,导致检测模型需持续更新以应对日益逼真的合成内容,存在检测精度与泛化能力不足的难题。其次,色情内容检测涉及高度敏感且多变的视觉特征,现有数据集如NPDI等虽包含大量样本,但标注标准不一、场景覆盖面有限,难以支撑模型在复杂真实环境下的鲁棒性。此外,构建过程中的挑战包括:搜集并清洗大规模、多样化的伪造与色情数据面临隐私与法律风险;协调不同研究团队的代码与论文资源,确保信息时效性与完整性;以及平衡技术开放与伦理约束,避免资源被逆向用于生成恶意内容,这些均对数据集的可持续维护与领域健康发展构成重大考验。
常用场景
经典使用场景
在深度伪造与色情内容检测领域,该数据集汇聚了生成与检测两大方向的前沿资源,为研究者提供了从人脸交换、生成对抗网络(GAN)到视频伪造识别、色情内容分类的完整工具链。其典型应用场景包括:利用MesoNet、Capsule Networks等模型对伪造面部视频进行细粒度鉴别,或借助Open NSFW、nsfwjs等框架构建实时、跨平台的色情图像分类系统。通过整合FaceForensics++等基准数据集,该资源成为评估伪造检测算法鲁棒性、泛化能力的标准测试平台。
解决学术问题
该数据集系统性地回应了数字内容真实性验证与内容安全治理中的核心挑战。在学术层面,它解决了深度伪造视频中面部扭曲伪影、生物信号异常(如眨眼频率)等可检测特征的理论建模问题,推动了基于时空特征与生理信号的伪造检测范式演进。同时,针对色情内容识别中运动信息融合、弱监督学习等难点,提供了多模态数据支撑,显著提升了模型在复杂场景下的分类精度。其意义在于构建了从技术对抗到伦理约束的完整研究框架,为后续可解释性检测、跨域泛化研究奠定了数据基础。
衍生相关工作
该数据集催生了多项具有里程碑意义的研究工作。在生成端,DeepFaceLab与Faceswap-GAN等技术推动了高保真面部替换的算法突破,其对抗训练策略被后续工作借鉴以提升伪造逼真度。在检测端,FaceForensics++与Exposing DeepFake系列方法建立了基于眨眼、头部姿态等生理信号的检测基线,启发了FakeCatcher等融合多生物特征的检测框架。此外,MesoNet的紧凑网络设计思路被扩展至移动端部署场景,而Capsule Networks的引入则为伪造检测提供了新的表征学习视角。这些衍生工作共同构成了深度伪造攻防对抗的持续演进生态。
以上内容由遇见数据集搜集并总结生成



