遇见数据集

data-snapshot

收藏
arXiv2026-06-04 更新2026-06-08 收录
官方服务:

资源简介:

该数据集由世界银行发展数据组创建,旨在为机构文档中的数据快照提取任务提供基准评估资源。数据集包含来自联合国难民署人道主义报告、世界银行政策研究工作报告和难民项目评估文档的476个PDF文件,共计7,717页,其中标注了3,908个包含可重用分析信息的图形和表格数据快照。数据集的构建过程涉及从公开门户检索文档,并人工筛选和标注具有语义意义的分析性视觉区域。该数据集主要应用于文档智能领域,用于评估和提升布局检测模型在操作型机构文档中识别和定位关键分析内容的能力,以解决通用文档分析与实际有用信息提取之间的差距。

This dataset was created by the Development Data Group of the World Bank, aiming to provide benchmark evaluation resources for the task of data snapshot extraction from institutional documents. It comprises 476 PDF documents sourced from humanitarian reports of the United Nations High Commissioner for Refugees (UNHCR), World Bank Policy Research Working Papers, and refugee project evaluation documents, totaling 7,717 pages. Among these, 3,908 graphical and tabular data snapshots containing reusable analytical information have been annotated. The construction process of this dataset involves retrieving documents from public portals, followed by manual screening and annotation of semantically meaningful analytical visual regions. This dataset is primarily applied in the field of Document Intelligence, to evaluate and enhance the capability of layout detection models in identifying and locating key analytical content within operational institutional documents, so as to bridge the gap between general document analysis and practical useful information extraction.

创建时间:
2026-06-04
原始信息汇总

数据集概述:data-snapshot

核心目的:一个用于评估和开发从PDF文档中提取数据快照(data snapshot)的模型标注语料库。数据快照定义为包含来自统计数据、指标或结构化数据源的定量数据的图形或表格。

许可证:未知(待定)。

任务类别:目标检测、图像分割。

标签:PDF、文档布局分析、数据提取。

语言:英语、法语、西班牙语。

数据集规模:n < 1K。


数据集结构与组成

数据集按来源和配置项组织。目录结构如下:

ai4data/data-snapshot/ ├── annotations/<source>/.json ├── documents/<source>/.pdf ├── metadata/<source>/.json ├── schemas/.json ├── snapshots/<source>/*.png └── README.md

配置项 (Configs) 及其数据文件

  1. annotations:标注文件,每个文档一个JSON文件。
    • 分片unhcrprwprefugee
    • 数据路径annotations/unhcr/*.json 等。
  2. metadata:文档级元数据文件,每个文档一个JSON文件。
    • 分片unhcrprwprefugee
    • 数据路径metadata/unhcr/*.json 等。
  3. documents:原始PDF文档文件。
    • 分片unhcrprwprefugee
    • 数据路径documents/unhcr/*.pdf 等。
  4. snapshots:从文档中提取的PNG图像文件,对应标注的边界框。
    • 分片unhcrprwprefugee
    • 数据路径snapshots/unhcr/*.png 等。

数据来源 (Sources)

  • UNHCR:联合国难民署
  • PRWP:政策研究工作论文
  • Refugee:难民相关

数据子集详情

1. 标注 (Annotations)

  • 格式:JSON文件。
  • 内容:指示数据快照的对象类别(图形/表格)及其边界框位置。
  • 坐标系统:归一化 [x1, y1, x2, y2] 格式,原点为左上角。
  • 模式:遵循 schemas/data-snapshot-eval-v1.3.schema.json 模式。
  • 特性:即使文档没有数据快照,也会存在标注文件,但边界框列表为空。
  • 关键字段
    • label_map:类别名称到整数ID的映射 (1: Figure, 2: Table)。
    • info:文件级元数据,包括模式版本、类型(ground_truth)、坐标系统等。
    • documents:引用的文档列表。
    • predictions:包含实际标注(注意:虽字段名为predictions,实为人类标注的ground truth),每个页面下的对象包含 id, label, bbox (归一化坐标), score (ground truth为null)。

2. 文档 (Documents)

  • 格式:原始PDF文件。
  • 内容:被标注的实际PDF文档。

3. 元数据 (Metadata)

  • 格式:JSON文件。
  • 模式:遵循世界银行文档元数据标准。
  • 特性:所有来源的文件共享统一的模式(相同键和类型)。
  • 顶级字段type, metadata_information, document_description, provenance, tags, schematype, additional(包含来源特定字段)。

4. 快照 (Snapshots)

  • 格式:PNG图像文件。
  • 内容:根据文档和边界框位置提取的图像。

数据加载示例 (使用 HuggingFace datasets 库)

  • 加载标注: python from datasets import load_dataset annotations = load_dataset("ai4data/data-snapshot", name="annotations", split="unhcr")

  • 加载元数据: python metadata = load_dataset("ai4data/data-snapshot", name="metadata", split="unhcr")

  • 加载文档: python docs = load_dataset("ai4data/data-snapshot", data_dir="documents/unhcr")

  • 加载快照: python snapshots = load_dataset("ai4data/data-snapshot", data_dir="snapshots/unhcr")

数据集创建与引用

  • 创建:标注通过人类使用 Label Studio 工具标注生成。
  • 许可证:(待定)
  • 引用信息:(待定)
搜集汇总
数据集介绍
data-snapshot 数据集图片
构建方式
在机构文档智能领域,现有布局检测系统难以区分具有分析价值的视觉内容与无关装饰性元素。为弥合这一差距,本研究构建了首个面向语义数据快照提取的基准数据集。该数据集整合了三大语料库:联合国难民署/ReliefWeb的人道主义报告、世界银行政策研究工作论文以及难民项目评估文件,共计476份PDF文档、7717个页面。数据的构建采用半辅助人工标注流程:首先利用DocLayout-YOLO和YOLOv11分别生成图形与表格的初始预标注,随后由作者使用Label Studio逐页人工审核与校正,确保每个边界框均经过人工验证。最终涵盖3908个数据快照,包括2599个图形和1309个表格,并确保标注结果反映的是经过验证的人类判断而非模型预测。该数据集已公开在Hugging Face上,并附带原始PDF、元数据及源代码。
特点
该数据集的核心特性在于其对语义相关性的严格界定。传统布局数据集将所有图形和表格视为同等对象,而本数据集明确定义“数据快照”为包含可复用分析信息的视觉区域(如统计图表、融资矩阵、监测仪表盘),并明确排除徽标、封面图片、目录等无分析价值的视觉元素。这使得数据集从单纯的对象检测任务跃升为语义鉴别任务。另一个显著特点是其跨领域的多样性:人道主义报告包含复合型仪表盘与信息图,政策论文呈现密度高的学术图表,而项目评估文件则包含融资表与实施矩阵。这种异构性使得数据快照在页面上占据中位数仅31.3%的面积,且通常仅出现在约五分之一页面上,凸显了精准定位的需求。此外,数据集不仅提供边界框,还强调上下文完整性,要求标注包括标题、图例、脚注等必要元素。
使用方法
该数据集主要用于评估开放源代码文档布局模型在机构文档上的数据快照提取能力。使用方式分为两步:首先,采用基于IoU=0.5的固定阈值进行目标检测评估,计算精确率和召回率,以衡量模型识别语义相关快照的准确性;其次,引入空间提取质量评估,分别计算区域召回率、区域精确率和IoU三项指标,以衡量预测框是否完整捕捉了包括标题、图例在内的语义范围。建议用户在使用前应用面积为0.008的归一化过滤阈值以去除小元素噪声。该数据集支持在UNHCR、PRWP和PAD三个子语料库上分别评估,以测试模型的跨领域泛化能力。此外,由于数据快照仅占文档小部分,该数据集也可用于验证预处理系统是否能有效筛选出需高成本多模态处理的少数页面。
背景与挑战
背景概述
在发展与公共政策领域,世界银行、联合国难民署等机构持续产出包含丰富统计表格、监测可视化图表、资金分配矩阵及地理空间地图等视觉元素的大量机构文档。这些视觉信息中蕴含大量可操作的分析性内容,却往往因嵌入图表而难以被下游处理流程有效访问。为弥合通用文档版面分析与实际可用数据快照抽取之间的鸿沟,世界银行发展数据组的Carl P. Dy与Aivin V. Solatorio于2026年构建了data-snapshot基准数据集,涵盖人道主义报告、政策研究论文及项目评估文件三大语料库。该数据集首次将语义上有意义的分析性视觉区域定义为“数据快照”,并提供了经人工验证的图、表标注,共计3908个数据快照,为机构文档智能研究奠定了重要基础,推动了领域内对操作级文档信息抽取能力的系统化评估。
当前挑战
当前面临的挑战主要源自两类问题。就领域任务本身而言,现有版面检测模型难以区分具有分析价值的图表与装饰性图像、目录表等无关视觉对象,导致假阳性率居高不下;同时,复合分析性视觉对象如仪表板式监测摘要常被碎片化为多个独立检测,丢失了整体语义。在数据集构建过程中,挑战亦十分严峻:机构文档结构多样、排版密集,使得人工标注需同时权衡语义完整性边界与矩形框的近似表达,尤其是非矩形或由多组件构成的分析性对象难以精确框取;此外,跨文档类型泛化能力不足、图文混排中上下文要素易被遗漏等问题,均揭示了当前基准数据与真实操作场景之间的显著差距。
常用场景
经典使用场景
data-snapshot数据集最经典的使用场景在于评估和提升开源布局检测模型从机构文档中提取数据快照的能力。该数据集聚焦于人道主义报告、世界银行政策研究工作论文和项目评估文档,通过精细标注的图表区域,为衡量模型在识别具有语义意义的分析性视觉内容方面的表现提供了标准化基准。研究者常利用该数据集测试模型能否在复杂的文档布局中准确区分分析性图表与装饰性元素,并评估其对复合型分析工件的检测完整性。
衍生相关工作
该数据集衍生了一系列重要的后续研究工作,主要包括两个方面:一是基于该基准开发专用于机构文档的数据快照提取模型,例如改进YOLO架构以适应复杂复合工件的检测任务,或设计融合视觉语言模型的语义边界识别方法;二是扩展该基准覆盖范围的工作,如构建包含更多国际组织文档类型(如联合国开发计划署、世界卫生组织报告)的跨领域数据集,以及引入多边形掩膜标注以解决矩形框在表示不规则分析工件时的局限性。这些工作共同推动了操作文档智能领域从通用布局分析向语义导向化提取的演进。
数据集最近研究
最新研究方向
在机构文档智能化领域,前沿研究方向正从通用的文档布局分析转向语义驱动的数据快照抽取,即关注那些承载可重用分析信息的视觉片段(如图表、统计表格、融资矩阵等),而非将所有图形与表格视为同等提取目标。本研究构建的基准数据集覆盖人道主义报告、政策研究工作论文及项目评估文档,揭示了当前开源模型在区分分析性与装饰性内容、完整捕捉复合视觉工件的语义边界方面存在显著短板。这一工作凸显了学术基准向操作性文档迁移时的领域鸿沟,并推动了面向低资源、高异构场景的文档理解范式革新,为后续开发轻量化且能保留上下文关联的抽取系统奠定了评估基础。
相关研究论文
  • 1
    Benchmarking Open-Source Layout Detection Models for Data Snapshot Extraction from Institutional Documents世界银行·发展数据组 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务