VendorBench-100
收藏资源简介:
VendorBench-100是由贝拉内政大学等研究团队构建的跨范式深度伪造图像检测基准数据集,包含100张精心挑选的对抗性图像(79张伪造、21张真实),旨在评估商业API、零样本视觉语言模型和开源检测器的性能。该数据集通过八种边缘案例家族(如人脸交换、文本到视频静态帧、AI照片编辑等)构建,强调真实世界挑战性场景而非规模,数据来源包括FaceForensics++和DF40等二十余种溯源渠道,并采用基于文件名的防泄漏协议。数据集主要用于深度伪造检测领域的模型评估与比较,旨在解决不同检测范式在统一协议下缺乏直接对比的问题,揭示模型排名能力与操作点质量之间的关键差异。
VendorBench-100 is a cross-paradigm deepfake image detection benchmark dataset constructed by research teams including Bella Interior University and other collaborating institutions. It contains 100 carefully curated adversarial images, with 79 forged samples and 21 authentic ones, designed to evaluate the performance of commercial APIs, zero-shot vision-language models, and open-source deepfake detectors. Built upon eight edge case families such as face swapping, text-to-video still frames, AI photo editing, and more, the dataset prioritizes real-world challenging scenarios rather than focusing on sheer dataset size. Its data sources cover over 20 provenance channels including FaceForensics++ and DF40, and it adopts a filename-based anti-leakage protocol. Primarily utilized for model evaluation and comparison in the deepfake detection domain, this dataset aims to address the gap where different detection paradigms lack direct head-to-head comparison under a unified protocol, and to uncover the critical discrepancies between model ranking capabilities and operating point quality.
VendorBench-100:统一跨范式深度伪造图像检测基准
作者: Sharayu N. Deshmukh(贝拉内务大学)· Nilesh K. Deshmukh(SRTMU,南德)
概述
VendorBench-100 评估了跨三种范式的 36 个检测器——5 个商业 API、7 个零样本视觉大语言模型和 24 个开源检测器——在一个共享的对抗性语料库(100 张图像,79 张伪造 / 21 张真实)上,采用单一输出模式和单一指标引擎。模型根据 Matthews 相关系数进行排名,ROC-AUC 作为无阈值平局决胜指标。
数据集
语料库位于 Source/ 目录中,包含于本仓库(仅限研究/基准测试用途)。
- 100 张图像 —— 79 张伪造 / 21 张真实(刻意设计的 79:21 偏斜,使原始准确率不可靠,因此 MCC 是主要指标)。
- 8 个边缘案例系列,涵盖 21 个来源组(15 个已验证 / 4 个部分验证 / 2 个不透明)。
- 防泄漏协议 —— 模型接收到中性的数字文件名;
fake_<GROUP>_NNN标签仅为事后键。完整按图像溯源信息位于Source/Provenance/。
| 边缘案例系列 | 伪造图像数量 |
|---|---|
| AI 头像“剪切光晕”(HeyGen) | 15 |
| 不透明/未知来源 | 14 |
| 全合成文本到图像 | 14 |
| 带信箱黑边的文生视频帧(Sora/Veo) | 13 |
| 近似重复换脸自拍 | 12 |
| 研究数据集帧(DF40, FF++) | 5 |
| 实时/虚拟换脸伪影 | 5 |
| 设备端AI对真实场景的照片编辑 | 1 |
结果
排名依据:MCC(主要)、ROC-AUC(平局决胜);正类 = 伪造。完整的 36 模型排行榜及所有图表:docs/RESULTS.md。
| 轨道 | 模型数 | 最佳 MCC | 中位数 MCC | 最佳 ROC-AUC | 中位数 ROC-AUC |
|---|---|---|---:|---:|---:|---:|
| 商业 API | 5 | 0.876 (neural_defend) | 0.290 | 0.915 (truthscan) | 0.890 |
| 视觉大语言模型 | 7 | 0.389 (gemini) | 0.199 | 0.791 (claude_opus48) | 0.632 |
| 开源 | 24 | 0.289 (ntire2026) | 0.062 | 0.866 (drct) | 0.566 |
关键发现: 最佳运行点:neural_defend(MCC 0.876)。最佳排序器:truthscan(ROC-AUC 0.915,但因默认阈值校准不当,MCC 为 -0.130)。最佳开源排序器 drct(0.866)胜过所有视觉大语言模型。按中位数 MCC 的范式排序:商业 > 大语言模型 > 开源。
仓库结构
benchmark_nd/ ├── benchmark/ 核心包:运行器、指标、共享模式、各轨道适配器 │ ├── commercial_apis/ 5个供应商HTTP客户端 │ ├── llms/ 7个视觉-大语言模型适配器 + 共享判定归一化 │ └── opensource_models/ 24个检测器加载器(A/B/C级)+ 注册表 ├── scripts/ 轨道驱动 + 聚合(运行、导入、导出、比较) ├── Source/ 100张图像语料库 + 溯源注册表(数据集) ├── results/ 每轨道的聚合summary.json + per-image.csv ├── images/ 发布图表(架构图 + F01–F14) ├── docs/ RESULTS.md(完整排行榜+图表)、MODELS.md、LLMS.md ├── requirements.txt 商业API + 报告依赖 └── requirements-research.txt 开源 + 大语言模型依赖(torch, transformers)
设置与使用
环境配置:
requirements.txt:用于商业API轨道和报告。requirements-research.txt:用于开源和大语言模型轨道(需CUDA GPU)。
使用示例:
- 商业API:
python -m benchmark.main run→python -m benchmark.main report - 开源检测器:
scripts/download_models.py→scripts/run_research.py→scripts/report_research.py - 视觉大语言模型:
scripts/import_llms.py→scripts/report_llms.py - 跨范式比较:
scripts/export_results.py→scripts/report_compare.py
数据与工件
聚合结果(results/*/summary.json,per-image.csv)及所有图表已提交。大型原始工件附于 v1.0.0 发布版中:
logs.zip:所有 36 个模型在各轨道上的逐图像APIResultJSON 证据。raw_llm_dumps.zip:原始带外视觉-大语言模型输出。
模型权重未提交,由 scripts/download_models.py 获取。
引用
bibtex @misc{deshmukh2026vendorbench100, author = {Deshmukh, Sharayu N. and Deshmukh, Nilesh K.}, title = {VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection}, year = {2026} }
许可
代码以 MIT 许可证发布。图像语料库仅供研究和基准测试使用。
- 1VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection贝拉内政大学; 什里古鲁布迪斯瓦米学院·计算机科学系; 斯瓦米拉曼南德提尔塔马拉特瓦达大学·计算科学学院 · 2026年



