相关数据集
qinchuanhui/UDA-QA
UDA(非结构化文档分析)是一个用于现实世界文档分析中检索增强生成(RAG)的基准套件。UDA数据集中的每个条目都组织为*文档-问题-答案*三元组,其中问题从文档中提出,并附有相应的真实答案。文档以其原始文件格式保留,未进行解析或分段;它们包括文本和表格数据,反映了现实世界分析场景的复杂性。
Hugging Face2024-06-13 更新2201
National Archives Forms Dataset
该数据集包含来自美国国家档案馆的表格图像,这些图像被标注了文本边界框、类别、关系和转录。数据集旨在捕捉表格图像中文本/手写实体之间的关系。
github2024-05-15 更新470
asoria/pdf_bench-docling
该数据集的结构详细描述了文档处理相关的特征及其数据类型。数据集包含页面、行、单词、图像、表格等文档中常见的元素。数据以结构化形式存储,具有嵌套字段,表明文档元素的分层组织。特征包括图像和文本的边界框(bbox)、文本内容、分数以及对文档中其他元素的引用。数据集还包含元数据,如页码、大小和模式信息。
Hugging Face2024-12-11 更新170
Fetch-A-Set (FAS)
Fetch-A-Set (FAS) 是一个专为立法历史文档分析系统设计的大型基准,旨在解决大规模历史文档检索的挑战。该数据集包含从17世纪至今的文档,总计约40万样本,来源于西班牙的立法文档,覆盖三个世纪。FAS数据集的创建过程涉及使用Mask-RCNN模型识别文档区域,并通过sentencebert编码匹配查询与OCR文本。该数据集主要应用于历史文档分析领域,特别是在文本到图像的检索任务中,旨在
arXiv2024-06-11 更新830



