遇见数据集

VendorBench-100

收藏
arXiv2026-07-07 更新2026-07-09 收录
官方服务:

资源简介:

VendorBench-100是由贝拉内政大学等研究团队构建的跨范式深度伪造图像检测基准数据集,包含100张精心挑选的对抗性图像(79张伪造、21张真实),旨在评估商业API、零样本视觉语言模型和开源检测器的性能。该数据集通过八种边缘案例家族(如人脸交换、文本到视频静态帧、AI照片编辑等)构建,强调真实世界挑战性场景而非规模,数据来源包括FaceForensics++和DF40等二十余种溯源渠道,并采用基于文件名的防泄漏协议。数据集主要用于深度伪造检测领域的模型评估与比较,旨在解决不同检测范式在统一协议下缺乏直接对比的问题,揭示模型排名能力与操作点质量之间的关键差异。

VendorBench-100 is a cross-paradigm deepfake image detection benchmark dataset constructed by research teams including Bella Interior University and other collaborating institutions. It contains 100 carefully curated adversarial images, with 79 forged samples and 21 authentic ones, designed to evaluate the performance of commercial APIs, zero-shot vision-language models, and open-source deepfake detectors. Built upon eight edge case families such as face swapping, text-to-video still frames, AI photo editing, and more, the dataset prioritizes real-world challenging scenarios rather than focusing on sheer dataset size. Its data sources cover over 20 provenance channels including FaceForensics++ and DF40, and it adopts a filename-based anti-leakage protocol. Primarily utilized for model evaluation and comparison in the deepfake detection domain, this dataset aims to address the gap where different detection paradigms lack direct head-to-head comparison under a unified protocol, and to uncover the critical discrepancies between model ranking capabilities and operating point quality.

创建时间:
2026-07-07
原始信息汇总

VendorBench-100:统一跨范式深度伪造图像检测基准

作者: Sharayu N. Deshmukh(贝拉内务大学)· Nilesh K. Deshmukh(SRTMU,南德)

概述

VendorBench-100 评估了跨三种范式的 36 个检测器——5 个商业 API、7 个零样本视觉大语言模型和 24 个开源检测器——在一个共享的对抗性语料库(100 张图像,79 张伪造 / 21 张真实)上,采用单一输出模式和单一指标引擎。模型根据 Matthews 相关系数进行排名,ROC-AUC 作为无阈值平局决胜指标。

数据集

语料库位于 Source/ 目录中,包含于本仓库(仅限研究/基准测试用途)。

  • 100 张图像 —— 79 张伪造 / 21 张真实(刻意设计的 79:21 偏斜,使原始准确率不可靠,因此 MCC 是主要指标)。
  • 8 个边缘案例系列,涵盖 21 个来源组(15 个已验证 / 4 个部分验证 / 2 个不透明)。
  • 防泄漏协议 —— 模型接收到中性的数字文件名;fake_<GROUP>_NNN 标签仅为事后键。完整按图像溯源信息位于 Source/Provenance/
边缘案例系列 伪造图像数量
AI 头像“剪切光晕”(HeyGen) 15
不透明/未知来源 14
全合成文本到图像 14
带信箱黑边的文生视频帧(Sora/Veo) 13
近似重复换脸自拍 12
研究数据集帧(DF40, FF++) 5
实时/虚拟换脸伪影 5
设备端AI对真实场景的照片编辑 1

结果

排名依据:MCC(主要)、ROC-AUC(平局决胜);正类 = 伪造。完整的 36 模型排行榜及所有图表:docs/RESULTS.md

| 轨道 | 模型数 | 最佳 MCC | 中位数 MCC | 最佳 ROC-AUC | 中位数 ROC-AUC | |---|---|---|---:|---:|---:|---:| | 商业 API | 5 | 0.876 (neural_defend) | 0.290 | 0.915 (truthscan) | 0.890 | | 视觉大语言模型 | 7 | 0.389 (gemini) | 0.199 | 0.791 (claude_opus48) | 0.632 | | 开源 | 24 | 0.289 (ntire2026) | 0.062 | 0.866 (drct) | 0.566 |

关键发现: 最佳运行点:neural_defend(MCC 0.876)。最佳排序器:truthscan(ROC-AUC 0.915,但因默认阈值校准不当,MCC 为 -0.130)。最佳开源排序器 drct(0.866)胜过所有视觉大语言模型。按中位数 MCC 的范式排序:商业 > 大语言模型 > 开源。

仓库结构

benchmark_nd/ ├── benchmark/ 核心包:运行器、指标、共享模式、各轨道适配器 │ ├── commercial_apis/ 5个供应商HTTP客户端 │ ├── llms/ 7个视觉-大语言模型适配器 + 共享判定归一化 │ └── opensource_models/ 24个检测器加载器(A/B/C级)+ 注册表 ├── scripts/ 轨道驱动 + 聚合(运行、导入、导出、比较) ├── Source/ 100张图像语料库 + 溯源注册表(数据集) ├── results/ 每轨道的聚合summary.json + per-image.csv ├── images/ 发布图表(架构图 + F01–F14) ├── docs/ RESULTS.md(完整排行榜+图表)、MODELS.md、LLMS.md ├── requirements.txt 商业API + 报告依赖 └── requirements-research.txt 开源 + 大语言模型依赖(torch, transformers)

设置与使用

环境配置:

  • requirements.txt:用于商业API轨道和报告。
  • requirements-research.txt:用于开源和大语言模型轨道(需CUDA GPU)。

使用示例:

  • 商业API:python -m benchmark.main runpython -m benchmark.main report
  • 开源检测器:scripts/download_models.pyscripts/run_research.pyscripts/report_research.py
  • 视觉大语言模型:scripts/import_llms.pyscripts/report_llms.py
  • 跨范式比较:scripts/export_results.pyscripts/report_compare.py

数据与工件

聚合结果(results/*/summary.jsonper-image.csv)及所有图表已提交。大型原始工件附于 v1.0.0 发布版中:

  • logs.zip:所有 36 个模型在各轨道上的逐图像 APIResult JSON 证据。
  • raw_llm_dumps.zip:原始带外视觉-大语言模型输出。

模型权重未提交,由 scripts/download_models.py 获取。

引用

bibtex @misc{deshmukh2026vendorbench100, author = {Deshmukh, Sharayu N. and Deshmukh, Nilesh K.}, title = {VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection}, year = {2026} }

许可

代码以 MIT 许可证发布。图像语料库仅供研究和基准测试使用。

搜集汇总
数据集介绍
构建方式
VendorBench-100是一个跨越不同范式的深度伪造图像检测基准测试集。其构建方式基于一个精心设计的对抗性图像语料库,包含100张固定图像,其中79张伪造图像与21张真实图像,以79:21的比例构成类别不平衡。语料库并非追求规模庞大,而是强调挑战性:所有图像均经过手工挑选,以探测八种独特的边缘情况类别,包括实时面部交换、在线面部交换、文本转视频静止帧、AI照片编辑、头像合成、不透明来源图像以及压缩的研究数据集帧。这些图像涵盖超过20个来源,以确保无单一生成器或分辨率主导,从而迫使模型在多样化的真实世界场景中展现其检测能力。
使用方法
VendorBench-100的使用方法围绕一个统一的三轨评估框架展开。所有36个模型均在相同的100张图像语料库上运行,图像以中性数字命名以避免标签泄露。每个模型的输出被标准化为统一的预测记录,包括硬标签和置信度分数。评估主要依据马修斯相关系数进行排名,并以ROC-AUC作为阈值无关的排名能力指标。对于商业API,通过HTTP实时查询并测量延迟;视觉语言模型使用共享法医判决模式进行零样本提示;开源检测器则本地运行。所有模型都遵循相同的拒绝政策,并分别报告覆盖率,以确保公平比较。
背景与挑战
背景概述
VendorBench-100是一个由Universidade da Beira Interior与Shri Guru Buddhi Swami College等机构的研究人员在2026年共同创建的跨范式深度伪造图像检测基准。该数据集的核心研究问题在于,商业API、零样本视觉语言模型与开源检测器这三种根本不同的检测范式长期缺乏统一的评估协议,使得直接比较困难。VendorBench-100通过构建一个仅含100张对抗性图像的语料库、统一输出模式与共同评价框架,对36个代表性模型进行了系统评估。其重要性在于揭示了排名能力与工作点质量之间的持续分歧,这一发现对当前依赖单一指标评价检测系统的实践构成了根本性挑战,有望推动该领域向更可靠的标准化评估演进。
当前挑战
VendorBench-100面临的核心挑战在于,现有检测范式长期缺乏共同评价基础,导致商业营销指标与独立验证结果之间存在显著差距。具体而言,数据集构建中遇到的挑战包括:需要涵盖八种难以处理的边缘案例家族(如实时换脸、视频帧信函框化、设备端AI编辑等),并确保模型无法依赖文件名或元数据泄露标签信息。此外,79:21的故意类不平衡使得准确率与F1分数容易被虚高,因此该基准采用马修斯相关系数为主要排序指标,以揭示单纯依靠ROC-AUC排名可能掩盖的固有陷阱。
常用场景
经典使用场景
VendorBench-100 作为一个跨范式的深度伪造图像检测基准数据集,其最经典的使用场景是对比评估三种截然不同的检测范式:商业 API、零样本视觉语言模型(大语言模型)以及开源检测器。该数据集精心构建了一个包含 100 张具有挑战性的对抗性图像语料库,覆盖八种边缘案例家族,包括实时换脸涂抹、近重复在线换脸、带黑边的文本转视频帧、AI 头像合成接缝、设备端 AI 照片编辑、不透明来源操作等,旨在模拟真实世界中最困难的检测场景。研究人员利用统一的输出模式和评估框架,在同一个语料库上同时评测多达 36 个代表性模型,从而获得跨范式的、可直接对比的性能度量。这使得 VendorBench-100 成为衡量不同检测方案在对抗性与非理想条件下真正能力的理想平台。
解决学术问题
VendorBench-100 解决了当前深度伪造检测领域中一个长期存在的核心学术困境:不同范式——商业 API、零样本视觉语言模型和开源检测器——几乎从未在统一的协议下被直接比较,导致研究者与从业人员无法基于客观证据选择最合适的检测策略。该数据集通过构建一个共享的、固定大小的对抗性语料库,结合标准化输出架构与通用的双度量评估体系(以马修斯相关系数为主,以 ROC-AUC 为辅助),有效消除了因数据集差异、输出格式不一致、以及类别分布不均衡而导致的评价偏差。其核心发现在于揭示了排名能力(ROC-AUC)与操作点质量(MCC)之间存在系统性分歧:一个模型可能具备出色的类间分离能力,但其默认决策阈值却缺乏可靠性。这一结论超越了传统单一排行榜排序的价值,为学术界理解检测器在真实部署中的表现提供了更加深刻的洞察。
实际应用
在实际应用领域,VendorBench-100 的直接价值在于为不同规模与预算的机构提供可复现的检测方案对比依据。金融、社交媒体、内容审核、公共安全等机构在面临合成媒体威胁时,需要决定是否采购商业 API、是否利用已有的通用视觉语言模型进行即时检测,抑或自行部署免费的开源检测器。该数据集通过统一的评测协议,清晰展示了每种方案在对抗性条件下的真实表现与权衡:商业 API 在典型操作点质量上表现最佳,但部分开源检测器在排名能力上甚至可以超越所有视觉大语言模型。此外,该数据集还暴露了延迟与检测性能之间的非单调关系——最强操作点质量的供应商同时也是响应最快的,揭示了性能与部署成本之间的复杂关联,支持更明智的采购与技术选型。
数据集最近研究
最新研究方向
当前针对深度伪造图像检测的研究已从单一范式内部的模型竞赛,转向跨越商业API、零样本视觉语言模型与开源检测器三大范式的统一评估体系构建。VendorBench-100 正是在这一前沿方向上的关键突破,它通过一个精心设计、富含边缘案例的对抗性图像语料库,揭示了不同范式在真实世界挑战下的性能差异。该基准的核心贡献在于发现了模型排序能力(ROC-AUC)与决策阈值质量(MCC)之间的系统性背离,这一关键发现警示,仅依赖单一指标衡量检测器存在巨大风险,为未来评估标准的建立提供了更严谨、更贴近实战的指导框架。
相关研究论文
  • 1
    VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection贝拉内政大学; 什里古鲁布迪斯瓦米学院·计算机科学系; 斯瓦米拉曼南德提尔塔马拉特瓦达大学·计算科学学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务