遇见数据集

Syncred-Bench

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

Syncred-Bench是一个图像数据集,包含两个子集配置:syncred_600(包含600行样本)和fp_450(包含450行样本)。数据以Parquet格式存储,图像字节直接嵌入在image列中,实现了自包含,不依赖外部文件路径。syncred_600子集保留了来自源文件SynCred_600/meta.json的注释信息;fp_450子集则仅包含可从文件名可靠推导出的元数据。在数据导出过程中,源元数据中存在的subtyoe拼写错误已被规范化为subtype。该数据集适用于需要图像及其关联元数据的任务,例如图像分类、元数据分析和计算机视觉研究。数据规模在1,000到10,000个样本之间,采用Apache 2.0许可证。

Syncred-Bench is an image dataset comprising two subset configurations: syncred_600 (containing 600 sample rows) and fp_450 (containing 450 sample rows). The dataset is stored in Parquet format, with image bytes directly embedded in the `image` column, making it self-contained without relying on external file paths. The syncred_600 subset retains the annotation information from the source file SynCred_600/meta.json; the fp_450 subset only includes metadata that can be reliably inferred from filenames. During the data export process, the spelling error of "subtyoe" present in the source metadata has been standardized to "subtype". This dataset is suitable for tasks requiring images and their associated metadata, such as image classification, metadata analysis, and computer vision research. The dataset has a scale between 1,000 and 10,000 samples and is released under the Apache 2.0 license.

创建时间:
2026-06-03
原始信息汇总

数据集概述

名称:Syncred-Bench
许可协议:Apache-2.0
数据集规模:1K < n < 10K 行

配置与子集

  • syncred_600:包含 600 行数据,保留了来自 SynCred_600/meta.json 的原始标注信息。
  • fp_450:包含 450 行数据,仅包含可从文件名可靠推导出的元数据。

说明

  • 导出的 Parquet 文件是自包含的:图像字节已嵌入到 image 列中,而非指向本地文件系统路径。
  • 源元数据中存在的拼写错误 subtyoe 在导出过程中已被规范化为 subtype

加载示例

python from datasets import load_dataset

syncred = load_dataset("thu-coai/Syncred-Bench", "syncred_600", split="train") fp = load_dataset("thu-coai/Syncred-Bench", "fp_450", split="train")

搜集汇总
数据集介绍
Syncred-Bench 数据集图片
构建方式
Syncred-Bench数据集由清华大学计算机科学与技术系构建,旨在为图像合成与伪造检测领域提供标准化的评测基准。该数据集从本地文件夹中导出两个图像子集:syncred_600包含600条样本,忠实保留了SynCred_600/meta.json中的原始标注信息;fp_450包含450条样本,仅保留可从文件名可靠推导的元数据。导出过程中,所有图像字节均嵌入至Parquet文件的image列中,消除了对本地文件系统路径的依赖,并修正了部分源数据中存在的subtyoe拼写错误,统一规范为subtype。
使用方法
使用Syncred-Bench数据集时,研究者可通过HuggingFace的datasets库便捷加载。具体而言,调用load_dataset函数并指定配置名称syncred_600或fp_450,即可获取对应子集的训练分割。例如,syncred = load_dataset("thu-coai/Syncred-Bench", "syncred_600", split="train")将加载包含完整标注的600条样本;类似地,fp = load_dataset("thu-coai/Syncred-Bench", "fp_450", split="train")可获取450条轻量元数据样本。加载后的数据集可直接用于模型训练、验证或推理,其嵌入的图像列简化了数据流流程。
背景与挑战
背景概述
Syncred-Bench是由清华大学计算机科学与技术系(THU CoAI)研究团队于近年构建的基准数据集,旨在推动合成图像可信度评估领域的发展。随着生成式人工智能技术的迅猛发展,合成图像的逼真度已大幅提升,但判别其真实性与来源成为计算机视觉与安全领域的重要课题。该数据集包含两个子集:syncred_600(600张图像,附有详细元数据)和fp_450(450张图像,仅含文件名衍生信息),为研究合成图像的可信度评估提供了标准化测试平台。其简洁且自包含的Parquet格式设计,降低了模型加载与复现的门槛,为后续研究奠定了坚实的基础设施支持。Syncred-Bench的出现填补了合成图像评估基准的空白,对推动可信人工智能技术的发展具有深远影响。
当前挑战
Syncred-Bench的核心挑战在于解决合成图像可信度评估这一交叉领域难题。一方面,当前生成模型(如扩散模型、GANs)产出的图像质量日趋精细,传统基于统计特征的检测方法面临失效风险,亟需开发能捕捉生成痕迹与语义一致性的新型评估指标。另一方面,数据集的构建过程本身遭遇标注质量与元数据一致性的挑战:源标注中存在“subtyoe”拼写错误需在导出时修正,且fp_450子集仅能从文件名可靠提取有限元数据,限制了可获得的监督信号。此外,如何确保图像字节嵌入的存储方式不引入压缩失真,并维持评估结果的鲁棒性,也是数据集设计中的关键难点。
常用场景
经典使用场景
Syncred-Bench数据集精心汇集了600条带有丰富标注的图像样本,涵盖合成图像与真实图像的二元判别任务,同时也包含450条专注于伪造图像检测的子集。在图像取证领域,该数据集被广泛用于训练和评估深度学习模型对合成图像(如由生成对抗网络或扩散模型生成的图像)的鉴别能力,尤其适用于判别图像真伪、定位篡改区域以及分析图像生成痕迹等经典研究场景。
解决学术问题
在学术界,Syncred-Bench致力于解决图像真伪鉴别这一核心难题,为验证算法在面对高质量合成图像时的鲁棒性与泛化能力提供了标准化评估基准。该数据集弥补了现有基准在合成图像多样性及标注规范性方面的不足,推动了图像取证领域从传统手工特征向端到端深度学习方法的转型。其发布促进了合成图像检测的可复现研究,并深刻影响了数字影像证据在司法、新闻传播及社会科学中的可信度评估体系。
实际应用
在实际应用中,Syncred-Bench可助力社交媒体平台构建自动化的虚假图像筛查系统,有效遏制利用Deepfake技术生成的误导性内容传播。亦可用于金融领域验证身份证件、票据等关键图像文件的真实性,防范欺诈行为。新媒体行业可借此训练内容审核模型,快速识别由AI生成的误导性新闻配图与商业广告,维护信息生态环境的秩序与可信度。
数据集最近研究
最新研究方向
Syncred-Bench数据集聚焦于合成图像与真实图像的可信度评测,当前前沿研究方向围绕多模态大模型的视觉真实性判别能力展开。该数据集通过精细化的元数据标注与图像子集划分(如syncred_600与fp_450),为评估模型在图像内容真实性与细粒度属性识别(如子类型标准化)方面提供了基准。结合近期生成式AI伪造图像泛滥的热点事件,该数据集在打击深度伪造、提升多模态模型可信度领域具有关键意义,推动了图像溯源与真实性验证技术的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务