遇见数据集

Synthetically Engineered Evaluation Data (SEED)

收藏
github2026-07-15 更新2026-07-16 收录
官方服务:

资源简介:

SEED是一个基于AI的合成文档生成管道,使用代理AI创建合成文档数据。它从JSON模式生成逼真的PDF文档,通过多阶段批评循环进行验证,并可选择应用图像增强来模拟真实世界的扫描/传真伪影。每个文档都配有一个真实JSON标签,因此输出是一个现成的基准集。该数据集专为构建文档理解系统(如OCR、关键信息提取和文档分类)的评估数据集而设计。

SEED is an AI-powered synthetic document generation pipeline that utilizes AI Agents to create synthetic document datasets. It generates realistic PDF documents from JSON schemas, validates the generated content through multi-stage critique loops, and optionally applies image augmentation to simulate real-world scanning and faxing artifacts. Each document is accompanied by a ground-truth JSON label, thus the output constitutes a ready-to-use benchmark dataset. This dataset is specifically tailored as an evaluation benchmark for developing document understanding systems including OCR, key information extraction, and document classification.

创建时间:
2026-07-11
原始信息汇总

数据集概述

数据集名称: Synthetically Engineered Evaluation Data (SEED)

数据集定位: 一个基于AI的合成文档生成管道,专门用于构建文档理解系统的评估数据集。该管道并非生产就绪解决方案,而是一项价值验证资产。

核心功能: 根据JSON Schema生成逼真的PDF文档,并通过多阶段评论循环进行验证。可选地对输出文档应用图像增强,以模拟真实世界的扫描/传真伪影。每个生成的文档都配有一个地面真相JSON标签,可直接用作基准测试集。

应用场景: 主要用于评估以下文档理解系统:

  • 光学字符识别(OCR)
  • 关键信息提取(KIE)
  • 文档分类

使用方式: 作为一个Python模块(python -m seed_data)调用,或通过提供的批量和数据包脚本调用。

架构与流程

单文档生成管道: 采用多阶段流水线,包含多个AI代理,并具备重试机制。

data_generator → data_critic → doc_generator → doc_critic → [augmentor → aug_critic] ↑ (reject) ↑ (reject) └─────────┘ └──────────┘

批量生成管道: 支持并行处理,通过--extra参数传入高级主题描述,由场景生成器(LLM)据此创建多样化的文档场景,然后并行执行单文档管道。

数据包管道: 用于生成由多种相关文档类型组成的文档包(例如,包含信用报告、工资单和意向书的贷款申请包)。管道先生成共享上下文,然后为每种文档类型运行单文档管道,最后将所有PDF合并为一个多文档PDF文件。

关键特性

  • 多样性与可控性
    • --extra 参数: 通过传入高级主题描述(例如,“中西部的包装食品公司的FCC广播发票”),由场景生成器创建多样化的文档场景,避免生成雷同的输出。
    • 生成选项(Generation Choices): 通过Schema中的x-probability字段控制可选字段的包含与否,以及在generation_guidance.md中声明表格/内联字段的表示方式,增加文档间的差异性。
  • 图像增强: 使用augraphy库模拟扫描/传真伪影(如老化效果),增强数据的真实感。
  • 多渲染器支持: 支持xhtml2pdfweasyprintreportlab三种PDF渲染后端。其中xhtml2pdf为纯Python实现,开箱即用。
  • 参考文档: 可选的samples/目录用于存放真实PDF,仅作为文档质量评论家的视觉风格参考,生成阶段不会看到这些文件,且内容不会被复制到输出中。

代理角色与模型

管道包含7个AI代理,每个代理有特定的角色和默认模型:

代理名称 角色 默认模型
Scenario Generator 根据摘要和Schema指导创建多样化场景 gpt-oss
Data Generator 从Schema生成JSON数据,具备计算器工具用于数学验证 nova2-lite
Data Critic 根据Schema和领域规则验证数据,具备计算器工具,结构化输出 sonnet
Doc Generator 编写HTML/CSS并渲染为PDF,具备编辑工具进行针对性修复 gpt-oss
Doc Critic 视觉模型评估PDF质量(布局、字体、截断、数学等),自由文本输出 sonnet
Augmentor 选择augraphy增强配置并应用文档老化效果 gpt-oss
Aug Critic 评估增强后文档的可读性和真实感,结构化输出 sonnet

Schema目录结构

每个文档类型占用独立的目录,如schemas/fcc-invoice/

schemas/fcc-invoice/ ├── schema.json # JSON Schema文件——必需 ├── generation_guidance.md # 视觉风格、数据范围、数学规则等可选指导文件 └── samples/ # 参考PDF目录——可选,本地使用,被git忽略 ├── README.md └── *.pdf # 不提交至仓库

输出结构

输出目录(./output/<batch-name>/)包含:

output/<batch-name>/ ├── pdfs/ # 干净的PDF文件 ├── data/ # 每个文档对应的源数据JSON文件 ├── generation_scripts/ # 用于渲染PDF的HTML文件 ├── augmented/ # 增强后的PDF文件(启用--augment时) ├── config/ # Schema和指导文件的副本,用于可复现性 │ └── batch_manifest.json # 完整运行元数据,包括场景、时间等信息

快速开始

使用pip安装并生成第一个文档:

bash pip install seed-data export AWS_PROFILE=your-profile-name seed-data clone-schema-library ./schemas seed-data --schema-dir ./schemas/fcc-invoice --output ./output

性能与预期

  • 单个文档生成耗时约60-100秒。
  • 批量生成(--count 10 --workers 3)约需5-7分钟。
  • 并发工作线程数(--workers)建议不超过4-5个,以避免AWS Bedrock速率限制。
  • 部分失败是正常现象,失败的文档不会影响其他文档的生成。
搜集汇总
数据集介绍
Synthetically Engineered Evaluation Data (SEED) 数据集图片
构建方式
SEED数据集基于Strands Agents SDK构建,是一个AI驱动的合成文档生成管道。其核心流程从用户提供的JSON Schema与多样化指令开始,经场景生成器依据架构文档的生成指南产出独特场景描述,再由数据生成器依据Schema生成JSON数据,经过数据评论家的多阶段质量验证与迭代修正后,文档生成器将数据渲染为PDF文档,最终由文档评论家利用视觉模型评估布局与内容质量。管道支持可选的图像增强模块,通过Augraphy模拟真实世界中的扫描与传真伪影,并由增强评论家确保增强文档的可读性与真实感。所有生成结果均附带对应的真实标签JSON,形成可直接使用的基准测试集。
特点
SEED数据集具备显著的结构化多样性与模块化可扩展性。其多样性源于两方面:一是通过可选的`x-probability`字段概率独立控制每个文档实例中字段的包含或省略,二是通过在生成指南中声明表格与行内字段的呈现方式变化。管道内嵌多级质量反馈循环,数据评论家与文档评论家分别对数据符合Schema的程度和文档视觉质量进行评分,低于阈值的输出将被拒绝并触发重新生成。此外,管道支持数据增强、并行批量生成以及多文档包生成,能够模拟如贷款申请等需要共享上下文的复杂文档集合,输出的结构化目录清晰区分原始PDF、增强版本、配置与元数据,便于后续模型评估。
使用方法
使用SEED数据集需先通过pip安装`seed-data`包,并配置具有Bedrock访问权限的AWS凭证。用户可通过命令行接口快速生成单个文档,指定`--schema-dir`参数指向预定义的Schema目录(如fcc-invoice),并使用`--extra`参数注入多样性描述以控制生成内容的主题与变化范围。为构建大规模评估集,推荐使用并行批处理脚本`batch_generate.py`,通过`--count`和`--workers`参数控制数量与并行度,并启用`--augment`模拟真实世界退化。对于多文档场景,可利用`packet_generate.py`生成包含共享上下文的文档包,输出中`classes.yaml`与按章节划分的`result.json`文件可直接用于文档分类与关键信息提取任务的基准测试。
背景与挑战
背景概述
Synthetically Engineered Evaluation Data (SEED) 数据集由亚马逊云科技(AWS)实验室于2024年创建,旨在解决文档理解系统中评估数据匮乏的难题。该数据集基于Strands Agents SDK构建,通过AI驱动的合成文档生成管线,从JSON Schema出发,历经多阶段批评循环验证,并可选地施加图像增强以模拟真实世界的扫描或传真伪影,最终生成与真实标注(ground-truth JSON)一一对应的PDF文档。SEED专注于为OCR、关键信息提取(KIE)及文档分类等任务提供现成的基准测试集,其研究核心在于利用大语言模型与审阅代理的协同,自动化产出高质量、多样化的合成文档。该数据集的影响力体现在为文档智能领域提供了可复现、可定制的评估工具,填补了真实标注数据难以大规模获取的空白,尤其在隐私敏感场景下,其生成的虚构内容避免了数据泄露风险,成为推动相关研究标准化的重要资源。
当前挑战
SEED数据集所面临的挑战首先源于文档理解领域的核心难题:真实世界文档的多样性、噪声及布局复杂性使得现有模型难以泛化,而合成数据虽能可控生成,却可能缺乏真实文档的细微特征(如手写标记、污渍),导致评估偏差。其次,构建过程中面临技术挑战:多代理协作的管线需平衡生成效率与输出质量,尽管设计了数据生成器、批评器与增强器,但代理间的迭代反馈可能引入不稳定性,例如批评器对质量评估的阈值设定(1-10分)直接影响接受率,高阈值虽提纯数据却增加计算开销。此外,调度平行批次生成时,需应对底层模型(如Bedrock)的速率限制,且不同LLM(如GPT-OSS、Claude Sonnet)在文档生成与审阅中的表现差异突显了模型选择与调优的复杂性。最后,安全性挑战不容忽视——代理拥有执行代码与读写文件的权限,恶意Schema或引导文件可能引发提示注入攻击,而隐私保护要求确保样本目录中不包含真实个人信息,这些都为数据集的可靠构建与安全使用设下了严格约束。
常用场景
经典使用场景
在文档理解与智能文档处理领域,SEED数据集的核心价值体现为一种高度可控的合成数据生成方案,专为评估和训练OCR系统、关键信息提取模型以及文档分类算法而设计。通过其多级代理流水线,研究者能够从JSON模式出发,自动化生成带有真实标签的PDF文档,并辅以模拟扫描和传真伪影的图像增强模块。这一过程不仅确保了每份文档与对应接地真值标签的严格对齐,更提供了批次生成和文档包生成机制,使得构建大规模、多样化的评估基准集变得高效且可重复。该数据集尤其适用于需要精细控制变量(如布局变化、噪声水平、字段缺失概率)的消融实验,为评估模型在真实世界文档噪声下的鲁棒性提供了理想平台。
衍生相关工作
SEED数据集的出现催生了一系列在文档智能领域中具有里程碑意义的衍生工作。在其框架启发下,研究者相继提出了针对表格结构识别、签名验证和手写文本分割等专项任务的增强型合成数据生成方案。更有工作将其多代理批评-修正架构迁移至低资源语言文档的生成,显著缓解了小语种文档理解系统训练数据匮乏的瓶颈。同时,该数据集开创性地引入的文档包生成模式,直接引发了关于多页文档分割与上下文关联信息抽取的系列研究,推动了文档分析从单页处理向多页联合理解的方向演进。此外,其公开的架构设计与开源工具链,也为工业界探索规模化合成数据在文档自动化流水线中的集成应用提供了坚实的理论基石和实践范本。
数据集最近研究
最新研究方向
SEED数据集代表了文档理解评估基准构建的前沿方向,通过融合大语言模型驱动的合成数据生成管线与多阶段批评循环验证机制,解决了真实标注数据获取成本高昂、隐私受限及场景覆盖不足的核心困境。当前研究聚焦于利用该管线的AGENT架构实现高保真文档合成,涵盖OCR、关键信息提取(KIE)及文档分类任务,其创新性体现在场景生成器与批判模型协同工作,能模拟真实世界扫描、传真等图像退化效应,从而提升模型在复杂工业环境中的鲁棒性。特别是packet管线支持跨文档类型的一致性上下文生成,为文档分割与分类研究提供了标准化测试床,有力推动了AI文档理解系统从实验室迈向实际部署的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务