遇见数据集

SYNCRED-Bench

收藏
github2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

SYNCRED-Bench研究合成可信度:AI生成的图像因模仿权威视觉形式和真实传播痕迹而显得可信。该基准包含600张AI生成的错误信息图像,涵盖六个可信形式类别和七种传播风格,并引入了FP450真实图像负样本集用于误报测量。

SYNCRED-Bench focuses on synthetic credibility: AI-generated images appear credible by mimicking authoritative visual formats and real dissemination traces. This benchmark contains 600 AI-generated misinformation images, covering six credible format categories and seven dissemination styles, and introduces the FP450 real image negative sample set for false positive measurement.

创建时间:
2026-06-02
原始信息汇总

数据集概述:SYNCRED-Bench

SYNCRED-Bench 是一个用于评估 AI 生成图像合成可信度的基准测试集。它研究那些模仿权威视觉形式与现实传播痕迹、看似可信的 AI 生成图像,例如虚假通知、证件、新闻版面、平台截图、分析图表及评估材料。

核心内容

  • 数据集规模:包含 600 张 AI 生成的可信形式虚假信息图像。
  • 分类体系
    • 6 种可信形式类别(Credible-form categories):涵盖模仿权威视觉形式的各类图像。
    • 7 种传播风格(Circulation styles):模拟图像在不同传播路径下的呈现方式。
  • 负样本集(FP450):包含 450 张真实图像,用于评估误报率。

评测结果摘要

  • 5% 的假阳性率 约束下:
    • 15 个多模态大语言模型(MLLM)平均真阳性率(TPR)为 10.5%
    • 开源 AIGC 检测器平均 TPR 低于 5%
    • 商业 API 检测器平均 TPR 达到 57.6%
    • 人类多数投票(majority voting)TPR 为 63.0%,同时假阳性率(FPR)为 27.0%

数据集使用

  • 安装:依赖 requirements.txt,可通过 pip install -r requirements.txt 安装。
  • 配置:提供 .env.exampleapi.txt.example 模板,用于设置 API 密钥与端点。
  • 图像组织:图像文件名遵循 CONTENT_STYLE_INDEX.png 命名规则,例如 AD_CC_50.png 表示内容类别为“分析图表”、传播风格为“相机副本”、索引为 50。
  • 评估脚本:提供 MLLM 作为评判者的评估脚本 scripts/evaluate_mllm.py 及 Bash 封装 scripts/run_mllm.sh
    • 支持指定多个模型进行批量评估。
    • 输出包含每个图像的预测结果 JSONL 文件、整体及按类别/风格汇总的 CSV 文件,以及运行元数据。
    • 支持对负样本集(如 FP450)进行评估,需使用 --ground-truth real 参数。

引用信息

bibtex @misc{yang2026syncredbench, title = {SYNCRED-BENCH: Benchmarking Synthetic Credibility in AI-Generated Visual Misinformation}, author = {Yang, Junxiao and Zhang, Minghao and Wang, Xiaoce and Liu, Haoran and Cui, Shiyao and Wang, Hongning and Huang, Minlie}, year = {2026}, eprint = {2606.03348}, archivePrefix = {arXiv}, primaryClass = {cs.CV} }

责任使用声明

SYNCRED-Bench 仅用于合成图像检测、来源推理及视觉虚假信息安全的科研用途。禁止将数据、提示或示例用于欺骗、冒用机构、操纵政治或滥用可信形式合成图像等目的。

搜集汇总
数据集介绍
SYNCRED-Bench 数据集图片
构建方式
SYNCRED-Bench数据集聚焦于人工智能生成图像的可信度评估,即所谓的“合成可信度”现象。这些图像通过模仿权威视觉形式(如通知、证件、新闻布局、平台截图、分析图表及评估材料)与现实传播痕迹,呈现出令人信赖的外观。该数据集的构建基于六种可信形式类别与七种传播样式的系统分类,共包含600张AI生成的虚假信息图像。此外,研究团队引入了FP450真实图像负样本集,用于测量模型的误报率,从而构建出结构严谨的评估框架。
特点
该数据集的核心特点在于其对“合成可信度”这一新兴概念的深入刻画,涵盖伪造通知、凭证、新闻排版等多样化的可信形式,以及摄像头复制、官方发布等传播样式。实验揭示当前检测器的脆弱性:在5%误报率约束下,15种多模态大语言模型判断器的平均真阳率仅10.5%,开源AIGC检测器不足5%,商业API可达57.6%,而人工多数投票虽达63.0%但误报率高达27.0%。这一结果凸显了视觉虚假信息检测领域的严峻挑战。
使用方法
使用者可通过Hugging Face获取完整图像集,并利用提供的评估脚本快速开展实验。首先安装依赖并配置API密钥,随后将图像存放于指定文件夹,其命名规则采用“内容类别_传播样式_索引”的格式(如“AD_CC_50.png”)。运行evaluate_mllm.py脚本时,可指定多个模型(如gpt-4o、qwen-vl-max)及数据路径,输出结果包括每个图像的预测JSON文件、按内容和样式汇总的统计表格以及运行时元数据。对于真实图像测试,需额外设置--ground-truth real参数,以支持对误报情况的精确测量。
背景与挑战
背景概述
在人工智能生成内容泛滥的当下,视觉虚假信息呈现出高度拟真化的趋势,尤其是那些模仿权威视觉形式与真实流通痕迹的图像,正悄然侵蚀公众对数字内容的信任。为应对这一挑战,清华大学计算机科学与技术系的研究团队于2026年构建了SYNCRED-Bench基准数据集,由Junxiao Yang、Minghao Zhang等学者主导。该数据集聚焦“合成可信度”(Synthetic Credibility)这一核心概念,精心收录了600幅AI生成的虚假信息图像,涵盖六种可信形式与七种传播风格,并附有FP450真实图像负样本集用于假阳性评估。通过系统性评测,研究揭示当前先进检测器在低假阳性率约束下性能堪忧——15种多模态大语言模型平均真阳性率仅10.5%,主流开源AIGC检测器不足5%,即便商业API与人类多数投票也分别仅达57.6%与63.0%的真阳性率。该工作不仅填补了可信形式虚假信息的基准空白,更为视觉信息真实性验证领域提供了重要的评测工具与研究范式。
当前挑战
SYNCRED-Bench所面对的挑战多重交织。在领域问题上,现有检测器对“合成可信度”图像识别能力极度匮乏,典型表现为在5%的假阳性率约束下,多模态大语言模型与开源检测器的真阳性率分别低至10.5%与5%以下,表明从权威形式与流通痕迹中鉴别虚假内容仍是技术盲区。数据构建过程中,团队需精心设计六类可信形式(如公告、证书、新闻排版等)与七类传播风格(如平台截图、分析展示等)的组合,确保覆盖现实虚假信息的典型外观,同时需平衡正负样本分布以规避偏置。此外,为评估假阳性风险而引入FP450真实图像集,要求精确定义“可信”与“真实”的边界,避免语义歧义。评测协议本身亦构成挑战——需标准化多模态大语言模型的提示模板与输出格式,确保跨模型结果可比较,并设计兼顾整体性能与细粒度类别分析的评估指标,方能使基准有效揭示检测能力的深层短板。
常用场景
经典使用场景
在生成式人工智能迅猛发展的今天,视觉 misinformation 的传播形态日趋复杂,尤其当 AI 生成的图像模仿权威视觉形式(如官方通知、证书截图、新闻版面、平台快照、分析图表及评估材料)时,其“合成可信度”极易误导公众。SYNCRED-Bench 数据集精心构建了 600 幅涵盖六种可信形式类别与七种流通风格的 AI 生成虚假图像,并配套引入了 FP450 真实图像负例集以评估误报率,为研究者提供了一个标准化的评测平台。该数据集最经典的用途在于系统性地评估多模态大语言模型(MLLM)及各类 AIGC 检测器在面对高仿真、高可信度虚假图像时的检测能力,尤其关注在极低误报率约束下的真实阳性率表现。
解决学术问题
SYNCRED-Bench 精准回应了当前视觉 misinformation 检测领域的两大核心困境:其一,现有检测基准多聚焦于低质量或明显伪造的图像,缺乏对模仿权威视觉形式的“可信虚假图像”的系统性评估;其二,真实场景中检测器需在极低误报率下保持高召回率,而常规评测指标往往忽略这一严苛约束。该数据集通过精细化的类别划分与标准化评估协议,首次揭示了当前最先进的 MLLM 与开源检测器在此类高仿真场景下的显著脆弱性——在 5% 误报率限制下,多数模型的表现远未达到安全部署要求。这一发现不仅填补了合成可信度评测的空白,更从方法论层面推动了虚假信息检测研究从“泛化识别”向“低误报率下的稳健识别”转型,具有重要的学术引领意义。
衍生相关工作
围绕 SYNCRED-Bench 数据集,多个研究方向已衍生出系列经典工作。在检测器增强方面,研究者尝试基于该数据集训练专用特征提取网络,以提升对“可信形式”虚假图像的敏感度;同时,涌现了大量针对 MLLM 推理逻辑的改进工作,探索如何通过提示工程或视觉-语言对齐策略增强模型对环境痕迹与形式异常的关注。此外,该数据集催生了关于虚假图像传播溯源的研究,利用其丰富的流通风格分类探索生成图像在传播过程中留下的数字指纹。这些衍生工作共同构建了一个从检测、溯源到风险评估的完整研究生态,显著拓展了合成内容治理的技术边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务