遇见数据集

PRISM_Benchmark

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

PRISM(PhotoRealistic Image Synthesis and Manipulation)基准数据集是一个专门用于检测生成或合成图像的数据集,关联于研究论文《The PRISM benchmark: PhotoRealistic Image Synthesis and Manipulation to detect generated images》。该数据集主要用于图像分类任务,特别关注深度伪造检测、图像取证、AI生成图像和合成图像识别等领域。数据规模在1万到10万样本之间,其中真实图像部分来源于公开数据集COCO 2017(具体为验证集和训练集),需要用户自行下载。PRISM基准旨在为评估和推进照片级真实感图像合成与操纵的检测方法提供一个标准化的测试平台。

The PRISM(PhotoRealistic Image Synthesis and Manipulation)benchmark dataset is designed for detecting generated or synthetic images, associated with the research paper 《The PRISM benchmark: PhotoRealistic Image Synthesis and Manipulation to detect generated images》。It is primarily used for image classification tasks, with a focus on areas such as deepfake detection, image forensics, AI-generated image recognition, and synthetic image identification. The dataset size ranges from 10,000 to 100,000 samples. The real images in the dataset are sourced from the public COCO 2017 dataset (specifically the validation and training sets), which users need to download separately. The PRISM benchmark aims to provide a standardized testing platform for evaluating and advancing detection methods for photorealistic image synthesis and manipulation.

创建时间:
2026-06-03
原始信息汇总

PRISM Benchmark 数据集概述

  • 数据集名称:PRISM Benchmark
  • 许可协议:CC-BY-4.0
  • 任务类别:图像分类(image-classification)
  • 标签:深度伪造检测、图像取证、AI生成图像、合成图像
  • 样本规模:10K < n < 100K

数据集描述

该数据集源自论文《The PRISM benchmark: PhotoRealistic Image Synthesis and Manipulation to detect generated images》,专注于真实感图像合成与操作,用于检测生成图像。

数据集构成

  • 真实图像:需从COCO数据集单独下载:
    • 测试集:COCO 2017 Val(下载地址:http://images.cocodataset.org/zips/val2017.zip)
    • 训练集:COCO 2017 Train(下载地址:http://images.cocodataset.org/zips/test2017.zip)

引用信息

bibtex @article{BARTOLUCCI2026104826, title = {The PRISM benchmark: PhotoRealistic Image Synthesis and Manipulation to detect generated images}, journal = {Computer Vision and Image Understanding}, pages = {104826}, year = {2026}, doi = {10.1016/j.cviu.2026.104826}, url = {https://www.sciencedirect.com/science/article/pii/S1077314226001931}, author = {Filippo Bartolucci and Samuele Salti and Giuseppe Lisanti} }

搜集汇总
数据集介绍
PRISM_Benchmark 数据集图片
构建方式
PRISM_Benchmark数据集专为检测AI生成图像而设计,其构建基于对真实图像与合成图像的严格区分。真实图像来源于COCO数据集,具体采用COCO 2017验证集作为测试集,使用COCO 2017训练集作为训练集。合成图像则通过多种前沿的图像生成与操控技术生成,涵盖从完全合成到局部编辑的多种伪造形式,从而构建一个覆盖广泛伪造类型的基准测试平台。该数据集在构建过程中注重图像的逼真度与多样性,确保所包含的合成样本能够代表当前生成式模型的最先进水平,为深度伪造检测研究提供标准化的评估基础。
特点
PRISM_Benchmark的核心特点在于其聚焦于照片级真实感图像的合成与操控检测,填补了现有数据集在高质量合成图像识别方面的空白。该数据集包含约数万张图像,规模适中却极具挑战性,能够有效评估检测模型在应对高度逼真伪造图像时的鲁棒性。其合成图像涵盖从生成对抗网络到扩散模型等多种主流生成技术,使得数据集具有高度的技术覆盖面和时效性。此外,数据集采用CC-BY-4.0许可协议发布,促进了学术界的开放协作与公平比较。
使用方法
使用PRISM_Benchmark时,研究者需首先从COCO官方链接下载对应的真实图像,并依据数据集提供的划分方案将真实图像与合成图像配对,形成训练集与测试集。该数据集适用于图像分类任务,可基于标准的监督学习框架训练深度学习模型,以区分真实图像与合成图像。评估时,建议采用准确率、召回率及F1分数等指标,并与现有基准方法进行对比。由于合成图像来源多样,研究者可根据自身需求选择特定生成类型的子集进行针对性分析,或使用完整数据集进行综合性能评估。
背景与挑战
背景概述
随着生成式人工智能技术的飞速发展,照片级真实感图像的合成与篡改能力日益精进,如何有效区分真实图像与AI生成内容成为数字图像取证领域的关键课题。在此背景下,由Filippo Bartolucci、Samuele Salti与Giuseppe Lisanti等研究人员于2026年提出的PRISM Benchmark应运而生,其核心研究问题聚焦于构建一个全面、标准化的基准测试平台,以评估各类图像生成与篡改检测算法的性能。该数据集依托COCO数据集提供真实图像,并精心设计了涵盖多种合成与操纵策略的测试集,对推动深度伪造检测、图像取证等细分领域的研究进展具有重要影响力,已成为相关方法性能对比与验证的权威参考。
当前挑战
PRISM Benchmark所应对的领域挑战在于,现有检测方法多针对特定类型生成图像,难以泛化至多样化、高逼真度的合成场景,亟需一个统一、兼具挑战性的评估框架来揭示算法在复杂伪造手段下的鲁棒性边界。在构建过程中,研究者需克服数据平衡、真实与合成图像分布的语义对齐、以及生成策略的多样性与隐蔽性之间的权衡,确保基准能够真实反映算法在现实世界中的表现。此外,生成技术的持续迭代要求基准具备动态更新能力,以应对如扩散模型、对抗生成网络等新型合成范式带来的未至挑战,维持评估的有效性与前瞻性。
常用场景
经典使用场景
PRISM_Benchmark在图像取证与深度伪造检测领域独树一帜,其核心使命在于评估和提升模型对AI生成图像与真实图像之间的辨识能力。该数据集精心构建了高度逼真的合成图像,覆盖多种生成技术,为研究者提供了标准化且具有挑战性的测试平台。经典使用场景聚焦于区分真实照片与由生成对抗网络、扩散模型等先进技术创造的虚假图像。研究者利用该基准系统性地评估不同检测模型在复杂视觉场景下的鲁棒性和泛化能力,从而推动鉴别算法从实验室环境走向更严苛的现实应用。
实际应用
在实际应用层面,PRISM_Benchmark所推动的技术进步直接服务于信息安全与内容审核领域。例如,社交媒体平台可以部署基于该数据集训练的检测模型,自动识别并标记利用AI技术生成的人像、风景或新闻图片,有效遏制虚假信息的传播。在司法取证过程中,执法人员能够借助这些先进算法判断涉案图像的真实性,为案件审理提供关键证据。此外,金融与防欺诈系统也能借助此类鉴别技术,防止伪造身份证明或虚假广告图像的滥用,维护正常的商业秩序。
衍生相关工作
围绕PRISM_Benchmark,一系列经典研究工作应运而生。其奠基性论文《The PRISM benchmark: PhotoRealistic Image Synthesis and Manipulation to detect generated images》首次提出一个系统化、标准化的评测框架,激发了后续大量关于跨模型检测、无源鉴别以及可解释性分析的研究。在此基础上,学术界衍生出多项针对特定生成技术(如基于扩散模型与GAN)的对比研究,并推出了增强型数据集和评测协议。这些工作共同推动图像取证领域从碎片化评测走向统一基准,为未来构建更智能、更自适应的防御体系奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务