遇见数据集

wildfake-eval-subset

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

WildFake Eval Subset 是 WildFake 数据集的评估子集,专为 AI 生成内容(AIGC)检测任务设计,以 parquet 格式重新打包,便于一行代码加载。数据集包含多个配置,每个配置对应不同的图像来源、预处理方式和数据规模,全部仅提供验证集(validation split)。核心字段包括:image(图像)、label(类别标签,0 为真实,1 为虚假)、source(来源,如 coco_val2017、dalle3_advanced、laion5b、midjourney_v5、sdxl、gigagan 等)、orig_path(在原始 WildFake 存档中的路径)、id(唯一标识符,格式为 "{source}/{basename}")。部分配置(如 _transformed 后缀的配置)还包含 transform_chain、primary_transform、n_transforms 等字段,记录图像变换链信息。

The WildFake Eval Subset is an evaluation subset of the WildFake dataset, designed for AI-generated content (AIGC) detection tasks, repackaged in parquet format for easy loading with a single line of code. The dataset contains multiple configurations, each corresponding to different image sources, preprocessing methods, and data scales, all providing only the validation split. Core fields include: image, label (0 for real, 1 for fake), source (e.g., coco_val2017, dalle3_advanced, laion5b, midjourney_v5, sdxl, gigagan), orig_path (path in the original WildFake archive), and id (unique identifier in format "{source}/{basename}"). Some configurations (e.g., those with _transformed suffix) also include fields such as transform_chain, primary_transform, and n_transforms, recording image transformation chain information.

创建时间:
2026-08-29
原始信息汇总

WildFake Eval Subset 数据集详情

该数据集是 WildFake 基准数据集的一个子集,专为 AIGC(AI生成内容)检测赛道设计,从 ModelScope 重新打包为 parquet 格式。数据集仅供演示和验证模型性能使用,严禁用于训练,因为最终测试集来自同一语料库,训练会导致数据泄露。

核心配置

配置名称 样本数 内容构成 分辨率 用途
default 13,841 4,998 张 COCO val2017(真实)+ 8,843 张 DALL·E 3(虚假) 原始分辨率 匹配官方规范
normalized 13,841 与 default 相同图像 200x200 去除尺寸泄漏的基准
laion_matched 7,652 3,826 张 LAION-5B + 3,826 张 DALL·E 3 512x512 最具参考意义的评估配置
cross_generator 5,494 1,500 张 LAION 真实 + 多种生成器虚假图像 256x256 测试跨生成器泛化能力

关键警告与数据特征

  • default 配置存在严重尺寸泄漏:所有真实图像均为 200x200,所有虚假图像均非该尺寸,仅靠图像尺寸即可达到 AUC 1.000 的完美分类效果。
  • laion_matched 配置存在亮度泄漏:基于平均亮度可实现 AUC 0.734 的区分,这反映了网络图像与 AI 生成图像的真实风格差异。
  • 类别分布不均衡default 配置中真实图像占 36%,虚假图像占 64%,建议使用 AUC 或平衡准确率评估。

数据字段说明

所有配置共享以下字段:

  • image:嵌入在 parquet 文件中的图像数据
  • label:类别标签,0=真实1=虚假
  • source:来源标识(如 coco_val2017dalle3_advancedlaion5b 等)
  • orig_path:上游 WildFake 档案中的原始路径
  • id:格式为 "{source}/{basename}"

python

加载示例

from datasets import load_dataset ds = load_dataset("techjam-aigc/wildfake-eval-subset", "laion_matched", split="validation")

数据来源与许可

数据通过 HTTP 范围读取方式从 ModelScope 上的 WildFake 数据集构建,每个文件均经过 CRC 验证。数据来源包括 COCO、LAION-5B、DALL·E 3、Midjourney v5、SDXL 和 GigaGAN。使用需遵循上游 WildFake 的非商业研究条款,底层图像保留各自版权条款。

搜集汇总
数据集介绍
wildfake-eval-subset 数据集图片
构建方式
WildFake Eval Subset 是基于 WildFake 大规模数据集重打包而成的 AIGC 检测基准评估子集,专为评估 AI 生成图像检测器而设计。该子集通过 HTTP 范围读取上游 ModelScope 归档,解析 Zip64 中央目录并仅获取所需字节片段,从而避免了约 28 GB 的完整下载。每个提取的成员均经过 CRC 校验确保完整性。数据集提供了多个配置,包括 `default`(忠实于官方规格)、`normalized`(消除尺寸泄漏)、`laion_matched`(公平对比)、`cross_generator`(跨生成器泛化)等,每个配置包含图像、标签、来源等字段,且所有行均以固定种子打乱顺序。
特点
该数据集的核心特点在于其多维度配置设计,旨在解决 AIGC 检测中的基准泄漏问题。`default` 配置忠实于原始规格,但存在图像尺寸完全可分的严重伪影,使其成为琐碎可攻破的基准;`normalized` 和 `laion_matched` 移除了尺寸线索,后者着重于原生高分辨率图像,使得两类图片具有一致的预处理流程,且真实图像源自 LAION-5B,与生成模型的训练分布匹配;`cross_generator` 则涵盖多种生成器,评估检测器的跨生成器泛化能力。此外,所有配置均提供 AUC 和平衡准确率等稳健指标,以防止类别不平衡导致的误导性结果。
使用方法
使用方法简便,可通过 HuggingFace `datasets` 库直接加载,例如 `load_dataset("techjam-aigc/wildfake-eval-subset", "laion_matched", split="validation")`。用户可根据研究目的选择相应配置:若需严格对齐官方规范,选用 `default`;若要获得更有意义的评估结果,推荐使用 `laion_matched`;若要检验跨生成器泛化性,则采用 `cross_generator`。所有配置仅包含验证集,严禁用于训练,以免测试集信息泄漏。评估时应报告 AUC 或平衡准确率,避免仅依赖准确率,并需指明所使用的配置名称以增强结果的可比性和可解释性。
背景与挑战
背景概述
WildFake Eval Subset 是由 Yan Hong 和 Jianfu Zhang 于 2024 年构建的 WildFake 数据集的一个评估子集,专为 AI 生成图像(AIGC)检测任务设计。该数据集由 TechJam-AIGC 组织重新打包并托管于 HuggingFace,旨在提供一个标准化、便于加载的基准,用于评估检测模型对真实图像与伪造图像的区分能力。其核心研究问题在于,面对来自 DALL·E 3、Midjourney v5、SDXL、GigaGAN 等多样生成器的图像,检测算法能否有效泛化。该数据集包含多个配置,如 default、laion_matched 和 cross_generator,分别对应不同的挑战设置,为研究者提供了从规格遵循到跨生成器泛化的全面评估框架,对 AIGC 检测领域的算法开发和比较具有重要意义。
当前挑战
该数据集面临的挑战涵盖多个层面。首先,在领域问题层面,AIGC 检测的核心难点在于生成图像与真实图像的边界日益模糊,且不同生成器产生的图像在分辨率、色彩、纹理等方面存在显著差异,要求检测算法具备跨生成器泛化能力。其次,在数据集构建过程中,存在显著的捷径问题:default 配置中真实图像被统一缩放至 200x200,而伪造图像保持原始分辨率,导致仅凭图像尺寸即可完美区分,掩盖了检测器的真实性能。为缓解此问题,构建了 laion_matched 和 normalized 等配置,但即便如此,亮度、饱和度等统计特征仍可能成为潜在的捷径。此外,跨生成器配置中 GigaGAN 图像存在 5 个无法解码的样本,且不同生成器的原生分辨率不一致,增加了公平比较的难度。
常用场景
经典使用场景
在生成式人工智能图像检测领域,该数据集作为权威的参考基准,为评估AI生成图像检测器的泛化能力提供了多维度测试平台。其经典使用场景聚焦于对检测模型进行公正的鲁棒性验证,研究者可基于其多样化的配置(如laion_matched与cross_generator)对模型的跨域性能进行定量的严谨评估。特别是laion_matched配置,通过匹配LAION-5B真实图像与DALL·E 3生成图像的分布,剔除了图像尺寸等非语义线索,从而能够真实反映检测器对图像内容本质差异的辨识力。该基准的设计促使研究者不仅关注模型在单一数据集上的表现,更强调其在模拟真实世界复杂分布下的稳定性和可靠性。
衍生相关工作
该数据集的发布催生了若干重要的后续研究工作。首先,它启发了针对检测器泛化能力的新评估指标和实验设计,促使学者们探究不同图像预处理(如归一化、重压缩)对检测性能的干扰,并开发相应的抗干扰技术。其次,其揭示的“捷径学习”问题推动了去偏检测模型的研究,如基于对比学习或因果推理的检测架构,旨在剥离非语义的虚假线索。再者,该基准也促进了跨生成器检测方法的发展,例如通过域自适应或元学习策略,使得单一模型能够在面对未见过的生成模型时保持稳健。此外,围绕其数据的分析催生了关于训练数据泄露影响的系统性研究,为建立更加严格无泄漏的评测协议奠定了理论基础。
数据集最近研究
最新研究方向
在深度伪造检测领域,WildFake数据集的评估子集正推动研究范式从规格合规性向鲁棒泛化性转变。最新研究聚焦于消除数据预处理引入的捷径(如分辨率差异),并强调跨生成器(如DALL·E 3、Midjourney、SDXL)的泛化能力。通过laion_matched和cross_generator配置,研究者开始关注模型在真实世界分布下的表现,避免对特定分辨率的过度拟合。这一趋势反映了AIGC检测从实验室理想条件向实际应用场景的迁移,对构建可信赖的检测系统具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务