TextRich
收藏资源简介:
TextRich是一个用于检测由GPT-Image-2生成的人工智能富含文本图像的多领域基准数据集,旨在为评估和开发针对文本密集视觉内容的AI生成图像检测方法提供标准化测试平台。数据集由两个互补的子集构成:虚假(Fake)子集包含6,109张由GPT-Image-2模型生成的合成图像,生成提示词覆盖多样化领域和页面布局,不直接复制真实世界图像;真实(Real)子集包含5,986张从六个公开数据集采样的真实世界图像,分别来自PosterSum(学术海报)、Crello(商业海报)、ChartGalaxy(信息图表)、SROIE(收据)、PubTables-1M(表格)和Enrico(用户界面截图)数据集,并遵循原始许可证。总计12,095张图像,按图像类别和真实性标签层次化组织,涵盖六个具体领域类别:学术海报、商业海报、信息图表、收据、表格和用户界面截图,每个类别下设有0_real(真实)和1_fake(虚假)文件夹。适用于计算机视觉和多媒体安全领域研究,特别是开发和评估针对AI生成的、包含大量文本元素的图像(如海报、图表、表格、收据等)的检测与鉴别算法。
数据集概述
TextRich 是一个多领域基准数据集,用于检测由 GPT-Image-2 生成的 AI 文本丰富图像。
数据集构成
数据集包含两个互补子集:
- 伪造子集(Fake subset):6,109 张由 GPT-Image-2 基于精心设计的提示生成的图像,覆盖多种领域和布局,避免复制特定真实图像。
- 真实子集(Real subset):5,986 张从六个公开数据集中采样的真实图像,作为文本丰富视觉内容的自然示例。
最终数据集共有 11,095 张图像。
数据集结构
数据按图像类别和真实性标签进行层级组织:
Data/ ├── AcademicPosters/ │ ├── 0_real/ │ └── 1_fake/ ├── CommercialPosters/ │ ├── 0_real/ │ └── 1_fake/ ├── InfographicCharts/ │ ├── 0_real/ │ └── 1_fake/ ├── Receipts/ │ ├── 0_real/ │ └── 1_fake/ ├── Tables/ │ ├── 0_real/ │ └── 1_fake/ └── UIScreenshots/ ├── 0_real/ └── 1_fake/
真实子集来源
真实子集的图像来自以下六个公开数据集(每个数据集仅包含部分图像,未完整重新分发):
| 子集类别 | 源数据集 | 许可证 |
|---|---|---|
| Real/AcademicPosters | PosterSum | -- |
| Real/CommercialPosters | Crello | CDLA-Permissive-2.0 |
| Real/InfographicCharts | ChartGalaxy | Apache 2.0 |
| Real/Receipts | SROIE | CC BY 4.0 |
| Real/Tables | PubTables-1M | CDLA-Permissive-2.0 |
| Real/UIScreenshots | Enrico | MIT |
纳入的真实图像仍受其源数据集的原始许可证约束,用户应查阅原始数据集以获取许可证条款和使用条件。
相关论文
- 论文地址:https://arxiv.org/abs/2606.19259




