遇见数据集

ArenaBench

收藏
github2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

ArenaBench是一个综合性的评估基准,旨在推进深度伪造检测的研究。该数据集包含4.6万个高质量人脸样本,包括四个评估级别:跨模型、跨操作、商业模型和真实世界场景。它涵盖了各种先进的生成模型、人脸操作方法以及商业模型生成的人脸。

ArenaBench is a comprehensive evaluation benchmark dedicated to advancing deepfake detection research. This dataset contains 46,000 high-quality human facial samples, and encompasses four evaluation categories: cross-model, cross-manipulation, commercial model, and real-world scenarios. It covers a diverse set of advanced generative models, face manipulation methods, as well as facial samples generated by commercial models.

创建时间:
2026-08-26
原始信息汇总

ArenaBench 数据集概述

ArenaBench 是一个面向深度伪造检测研究的大规模综合评估基准数据集,包含约 46k 张高质量人脸样本。数据集通过四个评估层级设计,覆盖多种先进生成模型、人脸操控方法和商业模型生成的人脸,旨在推动深度伪造检测技术的全面评估与发展。

数据集结构与内容

总体构成

  • images/ 目录:存放所有图像样本,分为训练集(train)和测试集(test)。
    • 训练集:包含 real(真实)和 fake(伪造)两类子目录。
    • 测试集:按四个评估层级组织多个子目录,每个子目录下包含 0_real 和 1_fake 两类图像。
  • annotations/ 目录:存放训练和测试对应的 JSON 格式标注文件,具体标注格式将在后续版本发布时详细说明。

四个评估层级

  1. In-Domain(域内):涵盖 FaceForensics++、stylegan3、SDXL 等模型生成的人脸样本。
  2. Cross-Model(跨模型):涵盖 FLUX.2、GRN 等模型生成的人脸样本。
  3. Cross-Manipulation(跨操控):涵盖 EchoMimic、OSDFace 等人脸操控方法生成的样本,包括换脸、面部重演、视频驱动合成等。
  4. Commercial-Model(商业模型):涵盖 GPT-Image-2、NanoBananaPro 等商业模型生成的人脸样本。
  5. Real-world-Scenarios(真实世界场景):涵盖 ScaleDF、MFFI 等真实场景下的样本。

覆盖的生成模型与操控方法

  • 生成模型:stylegan2、styleganXL、SDXL、FLUX.2、GRN、GPT-Image-2、NanoBananaPro、Qwen-Image 等。
  • 操控方法:人脸交换(face swapping)、面部重演(reenactment)、视频驱动合成(video-driven synthesis)等。

下载与使用

下载方式

数据集托管于 Hugging Face,可通过以下命令下载:

bash hf download ceil2/ArenaBench --repo-type dataset

使用声明

该数据集仅用于科学研究目的,严格禁止任何商业用途,违者将自行承担全部责任。

联系方式

如有疑问,可通过 GitHub issue 或邮箱联系维护者:

  • Bytebender3:1546655154@qq.com
  • XinjueH:xinjueh@126.com
搜集汇总
数据集介绍
ArenaBench 数据集图片
构建方式
ArenaBench 数据集构建于深度伪造检测研究的前沿,旨在响应生成模型飞速演进带来的新挑战。其构建过程精细而系统,囊括了约46,000张高质量人脸样本,并精心设计了四个递进的评估层级,即跨模型、跨操作、商业模型及真实世界场景。数据来源极为多元,整合了诸如StyleGAN2、StyleGANXL、SDXL等先进生成模型,覆盖换脸、表情重演、视频驱动合成等多种篡改手段,同时亦收入GPT-Image-2、NanoBananaPro、Qwen-Image等商业模型产物。训练集与测试集分层明晰,测试集内细分为五个子集,每个子集均配有真实的伪造样本对,并附有标准化的JSON标注文件,确保了评估的严谨性与一致性。
特点
ArenaBench 的显著特点在于其规模宏大且覆盖面广,评测维度极具层次感。它不仅仅是一个静态的图像集合,而是构建了从领域内到跨领域、从传统技术到前沿商业模型的递进式挑战框架。该基准不仅检验模型对已知生成痕迹的识别能力,更致力于模拟真实世界中多样化的伪造场景,如通过FLUX.2、GRN等模型生成的图像,以及EchoMimic、OSDFace等操作手法,从而深刻揭示检测器的泛化瓶颈与实际部署潜力。此外,数据集结构规划得清晰有序,每一层级子集均配有对应的真实/伪造标识,为细粒度性能剖析提供了坚实基础,是推进深度伪造检测技术迈向实用化的关键资源。
使用方法
ArenaBench 数据集的使用便捷直观,主要通过Hugging Face平台分发。研究人员可通过命令行工具`hf download ceil2/ArenaBench --repo-type dataset`一键获取全部数据。数据组织遵循严格的目录结构,图像按训练/测试分割,并在测试部分细分为五个不同场景的独立文件夹,每张图像均归属于相应的真实或伪造子集。配套的JSON标注文件详细记录了样本元信息,便于研究者自定义评价协议。该数据集专供科学研究使用,严禁任何商业用途,引用时需注明出处,以确保学术规范。利用这一基准,可对深度伪造检测算法进行多维度、多场景的系统性评估与比较,从而有力推动该领域的科学发展。
背景与挑战
背景概述
随着生成式对抗网络与扩散模型的迅猛发展,深度伪造技术已从实验室走向现实应用,其逼真度与易用性对数字内容安全构成严峻挑战。在此背景下,ArenaBench数据集于2026年由Bytebender3与XinjueH等研究人员构建,旨在为深度伪造检测提供一个大规模、多维度、高难度的综合评测基准。该数据集精心汇聚了46,000余张高质量人脸样本,覆盖StyleGAN2、StyleGANXL、SDXL等先进生成模型,囊括换脸、面部重演、视频驱动合成等多种篡改手段,并纳入GPT-Image-2、NanoBananaPro、Qwen-Image等商业模型生成的内容。通过设计跨模型、跨篡改方式、商业模型及真实世界场景四个递进式评测层次,ArenaBench不仅推动了伪造检测算法的泛化能力研究,也为领域树立了更具挑战性的评估标准,其发布对数字取证与内容认证领域具有重要参考价值。
当前挑战
ArenaBench设计所面临的挑战源于深度伪造技术本身的快速发展与评测体系的滞后。领域内现有基准多集中于单一或少数生成模型,难以应对新型扩散模型及商业工具涌现带来的分布偏移,导致检测模型在跨模型场景下性能急剧下降。此外,篡改方法的多样性(如换脸与重演)要求检测算法具备细粒度判别力,而真实世界场景中的低质量、压缩与混合篡改进一步加剧了检测难度。在构建过程中,团队须确保数据样本的代表性与平衡性,需从广泛来源收集并严格筛选以覆盖多类生成器与操作类型,同时兼顾标注的一致性。大规模数据的管理、生成模型版本的控制以及隐私与伦理合规也构成实际障碍,这些挑战共同要求ArenaBench在评测设计上实现层次化与动态更新,以维持其作为基准的先进性与有效性。
常用场景
经典使用场景
ArenaBench数据集作为深伪检测领域的综合性基准,其经典使用场景在于对检测模型进行多维度、多层次的性能评估。研究者可利用其包含的46k高质量人脸样本,在交叉模型、交叉操作、商业模型及现实世界场景四个评估层级上,系统性地测试和比较不同深伪检测算法的泛化能力与鲁棒性。该基准覆盖了StyleGAN2、SDXL等先进生成模型,以及换脸、表情重演、视频驱动合成等多种操作类型,为模型在未知生成源上的表现提供了严苛的检验平台。
解决学术问题
该数据集直面深伪检测领域中模型泛化能力不足与评估标准不统一的学术难题。通过引入跨模型、跨操作和商业模型等评估维度,它解决了传统基准仅限于域内测试、难以反映真实世界分布的问题,促进了检测算法向更通用、更稳健的方向发展。ArenaBench的系统化划分和广泛覆盖,为建立可比较的学术研究基线提供了依据,推动了深伪检测领域理论框架和评估体系的完善。
衍生相关工作
基于ArenaBench的丰富层次和细粒度标注,衍生出了一系列相关研究工作。例如,利用该基准对现有检测器进行压力测试,分析其在不同生成器下的性能瓶颈,进而推动更鲁棒的骨干网络或域自适应方法的设计。此外,该数据集也为训练跨模态、跨协议的深伪检测模型提供了数据基础,并催生了对生成模型指纹、伪影痕迹等深层特征的研究。围绕ArenaBench,学界已开始探索可解释性深伪检测和基于大模型的伪影鉴别等工作,拓展了该领域的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务