遇见数据集

OpenMMSec

收藏
github2026-06-06 更新2026-06-11 收录
官方服务:

资源简介:

OpenMMSec数据集聚合了19个公共取证数据集的数据,涵盖10个真实世界数据集,包含超过330K样本,覆盖所有4个子领域(Deepfake、AIGC、IMDL、Doc)和98种图像伪造类型。它具有全面覆盖、大规模多样性、平衡分布、丰富真实图像来源和定位支持等关键特征。

The OpenMMSec dataset aggregates data from 19 public forensic datasets, covering 10 real-world datasets with over 330K samples, and spanning all 4 sub-fields (Deepfake, AIGC, IMDL, Doc) as well as 98 types of image forgeries. It features key characteristics including comprehensive coverage, large-scale diversity, balanced distribution, abundant real-world image sources, and localization support.

创建时间:
2026-05-14
原始信息汇总

数据集概述:OpenMMSec

OpenMMSec 是一个大规模、多领域的伪造图像检测数据集,旨在支持统一的伪造图像检测模型研究。该数据集与 ICML 2026 论文《Can We Build a Monolithic Model for Fake Image Detection? SICA: Semantic-Induced Constrained Adaptation for Unified-Yet-Discriminative Artifact Feature Space Reconstruction》一同发布。

核心特性

  • 全面覆盖:涵盖图像取证领域的 4 个主要子领域:Deepfake(深度伪造)、AIGC(AI生成内容)、IMDL(图像篡改检测与定位)、Doc(文档伪造)。
  • 大规模与多样性:包含 333,583 张图像,覆盖 15 种主要伪造类型98 种细粒度伪造类型
  • 平衡分布:在不同伪造类型之间仔细调整数据量,确保公平比较。
  • 丰富的真实图像来源:真实图像来自 超过 10 个真实世界数据集
  • 定位支持:保留来自原始数据集(IMDL 和 Doc)的像素级掩码,以支持未来的定位研究。

数据集统计

数据分区 来源数据集数 主要类型数 细粒度类型数 真实图像数 伪造图像数 总计
Deepfake 6 4 45 29,000 65,636 94,636
AIGC 3 6 26 46,000 46,048 91,048
IMDL 7 3 9 47,914 51,000 98,914
Doc 3 2 18 6,388 42,597 48,985
总计 19 15 98 129,302 204,281 333,583
  • 泛化评估划分:将 98 种细粒度类型划分为 26 种用于训练(81,632 训练 / 8,240 验证),其余 72 种用于测试(243,711 测试)。

数据来源

OpenMMSec 汇聚了来自 19 个公开取证数据集 的数据,并跨越 超过 10 个真实世界数据集

许可证与下载

  • 许可证:Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0)。
  • 访问权限:仅限教育机构和非营利组织的研究人员。
  • 下载链接
    • 百度网盘:https://pan.baidu.com/s/1NYB7obv_1G-ECRvOA4zBeA?pwd=vhxy
    • Google Drive:https://drive.google.com/file/d/1_rQHxS8zlQlXZY_e_TbRPIPSQFMgCTOT/view?usp=sharing

相关资源

  • 论文:https://arxiv.org/pdf/2602.06676
  • 官方仓库:https://github.com/venus-guangjian/SICA_OpenMMSec
  • 预训练权重:https://drive.google.com/drive/folders/109nJHqK-REXj5rvgpUOnzF4e0YPMBZbP?usp=sharing
  • 训练框架:ForensicHub (https://github.com/scu-zjz/ForensicHub)

引用

如使用本数据集,请引用以下论文:

@article{du2026can, title={Can We Build a Monolithic Model for Fake Image Detection? SICA: Semantic-Induced Constrained Adaptation for Unified-Yet-Discriminative Artifact Feature Space Reconstruction}, author={Du, Bo and Ma, Xiaochen and Zhu, Xuekang and Yang, Zhe and Niu, Chaogun and Fang, Mingqi and Wang, Zhenming and Liu, Jingjing and Liu, Jian and Zhou, Ji-Zhe}, journal={arXiv preprint arXiv:2602.06676}, year={2026} }

搜集汇总
数据集介绍
OpenMMSec 数据集图片
构建方式
OpenMMSec数据集是通过聚合19个公开的法医数据集构建而成,覆盖了超过10个真实世界数据集,总计包含333,583个样本。数据集精心设计了四个主要子领域:Deepfake、AIGC、IMDL和Doc,涵盖了98种细粒度伪造类型。在构建过程中,特别注重了数据量的平衡分配,以确保各伪造类型间的公平比较。训练集、验证集和测试集的划分基于伪造类型的粒度,将26种类型用于训练和验证,其余72种类型用于测试,从而支持模型的泛化能力评估。
使用方法
使用OpenMMSec数据集时,研究人员可以首先从提供的百度网盘或Google Drive链接下载数据集。论文中配套的SICA模型提供了预训练权重,下载后可通过简单的Python脚本进行推理,命令格式为‘python inference.py --image path/to/your/image.jpg --weight path/to/your/weights.pth’。对于希望重新训练模型的用户,推荐使用ForensicHub框架,并参考原始论文中提供的超参数。数据集采用CC BY-NC 4.0许可协议,仅面向教育机构和非营利组织的研究人员开放。
背景与挑战
背景概述
随着生成式人工智能技术的迅猛发展,图像伪造手段日益多样化,涵盖深度伪造(Deepfake)、AI生成内容(AIGC)、图像篡改(IMDL)及文档伪造(Doc)等四大子领域,对数字取证构成了严峻挑战。现有检测方法多针对单一子领域,缺乏跨域泛化能力。为攻克这一难题,由Bo Du、Xiaochen Ma等研究者在2026年构建了OpenMMSec数据集。该数据集整合了19个公开取证数据集与10余个真实世界数据集,包含超过33万张样本,覆盖15种主要伪造类型与98种细粒度伪造类型,具备大规模、多样性与均衡分布等特性。其核心研究问题在于探索是否能够构建统一的单体模型实现跨子域的伪造图像检测,为后续的语义诱导约束自适应(SICA)算法提供了关键的训练与评估基准,在数字图像取证领域具有里程碑式的影响力。
当前挑战
OpenMMSec数据集所指向的核心挑战在于实现跨四大图像伪造子域的统一检测,即构建具备“统一判别性”的单体模型。不同子域间的伪造痕迹天然存在本质差异(即所谓“畸折现象”),导致特征空间塌缩,这是单体检测模型长期性能不佳的根源。此外,数据集的构建过程同样面临多重困难:需从19个来源数据集整合超过330K样本,并确保15种主要伪造类型在数据量上保持均衡分布,避免因数据偏差影响评测公平性;同时,还需保留像素级定位标注以支持未来研究,为数据清洗与标准化带来巨大挑战。最终,模型需要在包含72种未见伪造类型的测试集上展现强大的泛化能力,进一步加大了技术攻关的难度。
常用场景
经典使用场景
OpenMMSec数据集被广泛用作伪造图像检测领域的综合性基准测试平台。研究人员利用其涵盖深度伪造、AIGC、图像篡改与文档伪造四大子域、包含98种伪造类型的庞大规模,系统评估模型在跨域伪造图像上的泛化能力。该数据集精心设计了训练集与测试集的分割策略,确保训练集仅包含26种伪造类型而测试集涵盖剩余72种,从而严格检验模型对未知伪造手法的判别性能。通过提供像素级定位掩码,OpenMMSec还支持伪造区域的细粒度定位研究,为从全局二分类向局部篡改区域感知的范式延伸提供了关键数据支撑。
解决学术问题
OpenMMSec的构建深刻回应了学术界长期存在的‘统一伪造检测’难题。传统方法多针对单一子域设计,跨域表现欠佳,而该数据集首次系统地整合了四大子域的异构伪造痕迹,揭示了不同子域间伪影特征的内在差异性,即‘吉哲现象’,并指出统一模型性能低下的根源在于伪影特征空间的坍塌。通过对数据体积的精心均衡,它消解了类别不平衡对评估公正性的干扰,为验证‘语义引导的特征重构’这一核心假设提供了实验依据。该数据集推动了从多模型集成到单一模型‘统一且判别’的范式转型,重塑了伪造检测的理论框架。
实际应用
在实际应用场景中,OpenMMSec数据集支撑着面向真实世界网络内容审查的伪造图像检测系统研发。其丰富的真实图像来源覆盖了10余个现实数据集,模拟了社交媒体、新闻平台、法律取证等多样性真实环境中的图像分布。执法机构与网络安全公司可借助基于该数据集训练的统一检测模型,高效识别从AI生成的虚假人像到文档中拼接的篡改签名等各类伪造内容。此外,数据集对中文与英文混杂、打印与扫描等复杂工况的覆盖,使得模型具备应对跨国网络谣言治理与数字司法鉴定等紧迫需求的实战能力。
数据集最近研究
最新研究方向
OpenMMSec数据集聚焦于虚假图像检测领域,针对当前单体式检测模型在跨子域(Deepfake、AIGC、IMDL、Doc)泛化能力上的瓶颈,揭示了“伪影特征空间坍塌”这一核心障碍,并提出语义诱导约束自适应(SICA)范式,利用高层语义作为结构先验重构统一且具判别性的伪影特征空间。该数据集整合19个公开取证数据集与超10个真实世界数据源,涵盖98种图像伪造类型,共计33万余样本,其大规模、多层次与均衡分布特性为评估通用伪造检测模型提供了坚实基准,推动了面向现实复杂场景的鲁棒性假图检测研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务