遇见数据集

TextRich

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

TextRich是一个用于检测由GPT-Image-2生成的人工智能富含文本图像的多领域基准数据集,旨在为评估和开发针对文本密集视觉内容的AI生成图像检测方法提供标准化测试平台。数据集由两个互补的子集构成:虚假(Fake)子集包含6,109张由GPT-Image-2模型生成的合成图像,生成提示词覆盖多样化领域和页面布局,不直接复制真实世界图像;真实(Real)子集包含5,986张从六个公开数据集采样的真实世界图像,分别来自PosterSum(学术海报)、Crello(商业海报)、ChartGalaxy(信息图表)、SROIE(收据)、PubTables-1M(表格)和Enrico(用户界面截图)数据集,并遵循原始许可证。总计12,095张图像,按图像类别和真实性标签层次化组织,涵盖六个具体领域类别:学术海报、商业海报、信息图表、收据、表格和用户界面截图,每个类别下设有0_real(真实)和1_fake(虚假)文件夹。适用于计算机视觉和多媒体安全领域研究,特别是开发和评估针对AI生成的、包含大量文本元素的图像(如海报、图表、表格、收据等)的检测与鉴别算法。

创建时间:
2026-07-19
原始信息汇总

数据集概述

TextRich 是一个多领域基准数据集,用于检测由 GPT-Image-2 生成的 AI 文本丰富图像。

数据集构成

数据集包含两个互补子集:

  • 伪造子集(Fake subset):6,109 张由 GPT-Image-2 基于精心设计的提示生成的图像,覆盖多种领域和布局,避免复制特定真实图像。
  • 真实子集(Real subset):5,986 张从六个公开数据集中采样的真实图像,作为文本丰富视觉内容的自然示例。

最终数据集共有 11,095 张图像

数据集结构

数据按图像类别和真实性标签进行层级组织:

Data/ ├── AcademicPosters/ │ ├── 0_real/ │ └── 1_fake/ ├── CommercialPosters/ │ ├── 0_real/ │ └── 1_fake/ ├── InfographicCharts/ │ ├── 0_real/ │ └── 1_fake/ ├── Receipts/ │ ├── 0_real/ │ └── 1_fake/ ├── Tables/ │ ├── 0_real/ │ └── 1_fake/ └── UIScreenshots/ ├── 0_real/ └── 1_fake/

真实子集来源

真实子集的图像来自以下六个公开数据集(每个数据集仅包含部分图像,未完整重新分发):

子集类别 源数据集 许可证
Real/AcademicPosters PosterSum --
Real/CommercialPosters Crello CDLA-Permissive-2.0
Real/InfographicCharts ChartGalaxy Apache 2.0
Real/Receipts SROIE CC BY 4.0
Real/Tables PubTables-1M CDLA-Permissive-2.0
Real/UIScreenshots Enrico MIT

纳入的真实图像仍受其源数据集的原始许可证约束,用户应查阅原始数据集以获取许可证条款和使用条件。

相关论文

  • 论文地址:https://arxiv.org/abs/2606.19259
搜集汇总
数据集介绍
TextRich 数据集图片
构建方式
TextRich数据集是一个用于检测GPT-Image-2生成的富含文本图像的跨领域基准测试集。其构建过程精心设计,包含两个互补的子集:虚假子集由GPT-Image-2根据特定提示生成,提示内容覆盖多样化的领域与布局,同时避免复制真实世界的图像;真实子集则从六个公开数据集中采样,包括PosterSum、Crello、ChartGalaxy、SROIE、PubTables-1M和Enrico,分别对应学术海报、商业海报、信息图表、收据、表格和用户界面截图等类别。最终数据集包含6109张合成图像和5986张真实图像。
特点
该数据集最显著的特点在于其层次化的组织结构和多领域覆盖。图像按类别和真实性标签分层排列,形成六个主要领域,每个领域下均包含真实与伪造图像子文件夹。这种结构便于研究者针对特定领域进行训练或评估。此外,虚假图像由最先进的图像生成模型GPT-Image-2产生,具有高度的逼真度,而真实图像来自经过验证的公开数据集,确保了数据的真实性和多样性。数据集总体规模均衡,为开发鲁棒的检测方法提供了坚实基础。
使用方法
使用TextRich数据集时,用户可直接从HuggingFace仓库下载整个数据集,其目录结构清晰,便于加载和探索。推荐的做法是利用分层结构,按类别或整体进行模型训练与评估。例如,可以使用图像分类或二分类框架,将文件夹路径作为标签依据。研究者在应用时应留意真实子集中图像的原始许可证,尤其是来自Crello和PubTables-1M等具有CDLA-Permissive-2.0许可的数据,需遵守相应使用条款。详细技术细节和基线实验结果可参考配套发表于arXiv的论文。
背景与挑战
背景概述
随着生成式人工智能技术的迅猛发展,尤其是GPT-Image-2等模型的出现,合成图像的真实性已达到前所未有的高度。在此背景下,如何有效区分AI生成图像与真实图像,特别是那些包含丰富文本信息的富文本图像,成为视觉内容安全领域亟待解决的关键问题。TextRich数据集由Wang等人于2026年创建,旨在构建一个多领域基准,专门用于检测GPT-Image-2生成的AI富文本图像。该数据集涵盖学术海报、商业海报、信息图表、收据、表格和界面截图六大领域,包含6109张合成图像与5986张真实图像,为AI生成图像检测研究提供了标准化评估平台,对推动视觉内容真实性验证技术的发展具有重要影响力。
当前挑战
TextRich数据集所解决的领域问题核心在于富文本图像的AI生成检测。传统图像伪造检测方法多聚焦于自然场景,而文本区域中微小的文字形变、排版异常或语义矛盾对检测算法提出了更高要求。构建过程中,挑战主要来自两个方面:其一,合成图像需通过精心设计的提示词覆盖多样领域与布局,同时避免复制真实世界图像,这要求生成策略具有高度可控性与多样性;其二,真实图像需从六个不同来源的公开数据集采样,确保涵盖不同类型的富文本内容,但各数据集的许可协议、格式差异极大,数据整合与合规使用增加了构建复杂度。
常用场景
经典使用场景
TextRich数据集的核心用途在于为多领域文本丰富型图像中AI生成内容的检测任务提供一个标准化、高覆盖的基准测试平台。该数据集精心构建了包含学术海报、商业广告、信息图表、收据、表格及用户界面截图在内的六大视觉领域,每个领域均涵盖由GPT-Image-2生成的合成图像与来自公开数据集的真实图像。研究者可基于此数据集对图像进行二分类任务,即区分图像是由AI生成还是来源于真实世界,从而衡量不同检测算法在多样文本布局与语义背景下的泛化能力与鲁棒性。该数据集特别强调文本区域的复杂性与领域多样性,因此成为评估和比较新型深度伪造检测模型性能的不可或缺的基准资源。
实际应用
在实际应用层面,TextRich数据集为多个高敏感性场景中的内容安全监管提供了技术验证工具。例如,新闻出版行业可利用基于该数据集训练的模型自动识别由AI生成的虚假学术海报或商业广告,防止学术欺诈与虚假营销信息的传播。在金融和政务领域,检测伪造的收据和合同表格是防范经济诈骗的关键环节,该数据集恰好涵盖了此类单据场景。同时,用户界面截图鉴别技术可被集成到应用商店审核流程中,过滤由AI生成的虚假APP截图以保护消费者权益。此外,社会信息平台可部署基于此数据集衍生的检测模块,识别和标记由GPT-Image-2生成的误导性信息图表,从而维护数字内容生态的可信度。
衍生相关工作
TextRich数据集的出现催生了多个方向的相关研究工作。首先,在此数据集基础上,研究者开发了面向文本丰富图像的专用伪造检测网络,通过引入OCR特征融合模块与文本-视觉交叉注意力机制,显著提升了对细小文字伪影的感知能力。其次,该数据集推动了多领域联合训练策略的研究,例如领域对抗性训练方法被用于增强模型在不同视觉领域间的迁移表现。此外,一些工作基于TextRich进行了细粒度伪造溯源分析,试图从文字排布、字体风格等维度定位AI生成图像的具体伪造类型。该数据集还为对比学习框架在伪造检测中的应用提供了实验平台,衍生出基于正负样本对构造策略的新颖自监督预训练方法,进一步拓展了无监督与半监督伪造检测方向的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务