遇见数据集

oag-nepal-audit-reports

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

该数据集是尼泊尔审计长办公室(OAG)发布的6,234份年度审计报告、公报、期刊及财务报表的机器可读转录本。原始PDF文本层大多使用旧式非Unicode的天城文编码(如Preeti和Fontasy Himali字体),导致常规提取器产生乱码。本数据集通过解码、页面锚定文本,并提取了规则审计表格的单元格网格,包括逐项审计发现、凭证编号和卢比金额。数据集包含338,257页、532,924,813个天城文字符、443,344个规则表格(含28,348,869个单元格,其中5,630,523个为可解析数值)。提供多个子集:documents(6,234行,每行对应一份出版物,含来源URL、PDF和转录的SHA-256哈希及页面/表格汇总)、pages(338,257行,每页的Markdown文本及出处)、tables(443,344行,每个规则表格块及其引入句和形状)、table_cells(28,348,869行,每个单元格的位置及解析数值)、quality(6,234行,11个质量审计轴及底层计数)、figures(181,920行,每页上的光栅图像分类)。此外还包含原始PDF文件(19.36 GiB)和完整转录的Markdown文件。数据集适用于文本检索、表格问答、文档问答、特征提取等任务,特别关注低资源语言尼泊尔语。注意:此为研究用制品,转录准确性基于与独立视觉OCR在390页样本上的词级一致率76.2%(清洁页面约93%);部分页面内容可能重复;数字区分天城文与ASCII数字;约11,551页来自视觉OCR,置信度较低;17份文档不含天城文字符;部分文档存在重复发布;未进行个人数据脱敏。数据集以CC BY-NC 4.0许可发布,用于研究、新闻和公民问责。

This dataset is a machine-readable transcription of 6,234 annual audit reports, bulletins, journals, and financial statements published by the Office of the Auditor General (OAG) of Nepal. The original PDF text layers mostly use legacy non-Unicode Devanagari encodings (e.g., Preeti and Fontasy Himali fonts), causing conventional extractors to produce garbled output. The dataset decodes, anchors text to pages, and extracts cell grids from regular audit tables, including line-item audit findings, voucher numbers, and rupee amounts. It contains 338,257 pages, 532,924,813 Devanagari characters, 443,344 regular tables (with 28,348,869 cells, of which 5,630,523 are parseable numeric values). Multiple subsets are provided: documents (6,234 rows, one per publication, with source URL, PDF and transcription SHA-256 hashes, and page/table summaries), pages (338,257 rows, Markdown text per page and provenance), tables (443,344 rows, each regular table block with its introductory sentence and shape), table_cells (28,348,869 rows, each cells position and parsed numeric value), quality (6,234 rows, 11 quality audit axes and underlying counts), figures (181,920 rows, raster image classification per page). Additionally, raw PDF files (19.36 GiB) and full transcription Markdown files are included. The dataset is suitable for tasks such as text retrieval, table question answering, document question answering, and feature extraction, with a focus on the low-resource language Nepali. Note: This is a research artifact; transcription accuracy is based on word-level agreement of 76.2% with an independent visual OCR on a 390-page sample (about 93% on clean pages); some page content may be duplicated; digits distinguish Devanagari and ASCII digits; approximately 11,551 pages come from visual OCR with lower confidence; 17 documents contain no Devanagari characters; some documents are republished; no personal data has been anonymized. The dataset is released under CC BY-NC 4.0 for research, journalism, and citizen accountability.

创建时间:
2026-08-18
原始信息汇总

OAG Nepal 审计报告数据集 (OAG Nepal Audit Reports)

数据集概述

该数据集提供了尼泊尔审计长办公室(OAG)发布的 6,234 份出版物的机器可读转录文本和结构化表格数据。这些出版物包括地方政府、省级和中央机构的年度审计报告,以及 OAG 自身的公报、期刊和财务报表。数据集解决了原始 PDF 中遗留的非 Unicode 天城文字体(如 Preeti、Fontasy Himali)导致的文本提取乱码问题,提供了解码后、按页面锚定的文本和规则审计表格的单元格网格。

数据规模与构成

  • 总量: 338,257 页,532,924,813 个天城文(Devanagari)字符,443,344 个规则表格,28,348,869 个表格单元格(其中 5,630,523 个为解析后的数字)。
  • 数据集大小: 21.68 GiB,共 12,478 个文件。

数据配置(Configs)

数据集包含以下配置,每个配置对应一个 Parquet 文件:

配置名称 行数 内容说明
documents 6,234 每个出版物一行,包含来源 URL、PDF 和转录文本的 SHA-256 哈希、页/表汇总
pages 338,257 逐页 Markdown 文本,每行对应一个源页面,包含逐页来源信息
tables 443,344 每个规则表格块一行,包含其引入句和形状
table_cells 28,348,869 长格式,每个(行、列)槽位一行,包含解析后的数值
quality 6,234 每份文件的 11 个审计轴结果,包含底层计数
figures 181,920 页面上的每个光栅图像一行,已分类(见下文)

额外资源: 数据集中还包含 markdown/(6,234 份转录文本)、pdf/(6,236 份源 PDF,19.36 GiB)以及 MANIFEST.json(列出所有文件及其大小和 SHA-256)。

数据分布

按出版物类型(部分):local-level-report(6,007 份)、report_province-report(56 份)、publication_audit-bulletin(29 份)、publication_right-to-information(22 份)等共 17 类。

省级报告(地方级):Koshi Province(1,101)、Madhesh Province(1,067)、Bagmati Province(951)、Lumbini Province(873)、Sudurpashchim Province(702)、Gandaki Province(681)、Karnali Province(632)。

按财政年度(BS)(部分):2077(796 份)、2075(776 份)、2078(775 份)、2082(764 份)等。

数据质量与限制

  1. 准确性为一致性比率:语料库与独立的视觉 OCR 读取(390 页样本)进行比较,语料库加权词一致性为 76.2%;在双方产出可比文本量的 171 页中,“干净”判定页的一致性约为 93%。这些指标是在早期版本树上测量的,可能不反映当前构建。
  2. 少数页面内容重复:338,257 页中有 1 页(0.000%)包含自身内容两次。
  3. 数字不跨脚本折叠:数据集中保留 45,725,582 个天城文数字14,746,219 个 ASCII 数字,它们保持独立,value_num 仅在单元格解析为纯标量时填充。
  4. 逐页来源:326,706 页来自 PDF 文本层(text_layer),11,551 页因文本层字符不足而通过 300 DPI 渲染后由视觉模型读取(vision_ocr),后者置信度较低。
  5. 部分文档未解码:有 17 份文档包含零天城文字符,其中 13 份评分为 clean。其中大部分是英文翻译,0 份为 likhit 解码失败。建议过滤 engine_fallback == False 以获取实际解码的文本。

审计判定分布clean(5,759 份)、suspect(463 份)、garbled(12 份)。clean 判定仅表示所有内部格式检查(如规范词、重复、乱码、数字损坏、结构等 11 个轴)均未触发,并不保证内容正确

图表数据说明

figures 配置包含 181,920 行(每个页面上的光栅图像),但大多数并非真正的图表

kind 类别 行数 含义
inline_image 15,585 真正的图表候选(照片、图表)
page_scan 11,071 整页扫描图像
template_furniture 66,980 办公室印章、徽章或重复出现的规则
glyph_or_fragment 88,284 亚可见矢量填充或光栅化字形(中位面积约 150 像素)

kind 是由阈值派生的,原始输入(page_fracn_documents_sharing_image)也已提供,可自行重新划分。

重复文档处理

documents 配置中的 duplicate_role 字段标识重复文档:unique(6,136)、canonical(39)、unindexed(39)、conflict(20)。可使用 work_id 对底层相同工作的文档进行去重。

数据加载示例

python from datasets import load_dataset

pages = load_dataset("damo-da/oag-nepal-audit-reports", "pages", split="train") cells = load_dataset("damo-da/oag-nepal-audit-reports", "table_cells", split="train")

获取某省所有报告的数字单元格

docs = load_dataset("damo-da/oag-nepal-audit-reports", "documents", split="train") karnali = {d["doc_id"] for d in docs if d["province"] == "Karnali Province"} amounts = [c for c in cells if c["doc_id"] in karnali and c["is_numeric"]]

来源与许可

  • 版本: 19-rc2 (2026-08-29 构建)
  • 转录工具: likhit(开源尼泊尔语 PDF 文本提取器)
  • 许可: CC BY-NC 4.0(非商业使用),适用于研究、新闻和公民问责工作
  • 个人数据警告: 本数据集未进行任何脱敏处理,转录文本可能包含个人姓名、公民身份证书号码、出生日期、手机号码、个人 PAN 和电子邮件地址。

重要注意事项

  • 该数据集是解码遗留字体语料库,并非干净的数字化文本,使用前请阅读质量限制部分。
  • 数据集是研究产物,不是官方记录。重要数字应核对源 PDF(可通过 source_urlpdf_sha256 验证)。
  • 数据集包含 2 份无转录文本的 PDF(均为扫描件,无文本层)。
搜集汇总
数据集介绍
oag-nepal-audit-reports 数据集图片
构建方式
该数据集源自尼泊尔审计长办公室(OAG)发布的6,234份年度审计报告及相关出版物,涵盖了地方、省级和中央机构的审计文件。原始PDF大多采用旧式非Unicode天城文编码(如Preeti和Fontasy Himali字体),常规提取工具无法正确解码。为构建此数据集,研究者开发了开源提取工具likhit,对PDF文本层进行解码,并在文本层不足时采用视觉OCR进行补充,最终生成了338,257页的逐页Markdown文本、443,344个带规则表格的单元格网格(共28,348,869个单元格),以及180余万张图像分类记录。整个构建过程严格记录了来源URL、PDF的SHA-256校验和及每页的提取方式,确保可追溯性和透明性。
使用方法
使用者可通过HuggingFace Datasets库轻松加载不同配置:如pages配置提供逐页的Markdown文本,table_cells配置提供表格单元格的长格式数据,documents配置包含出版物元数据。例如,可按省份筛选文档,并提取所有数值单元格进行财务分析。数据集附带的PDF源文件与转录文本通过SHA-256校验码关联,便于核验关键数据。建议在使用前过滤engine_fallback为False的文档,以确保文本来自实际解码而非回退。对于质量要求高的应用,应依据quality帧中的详细计数自行设定阈值,而非直接采用内置判定。数据集采用CC BY-NC 4.0许可,仅限非商业用途,且未做个人隐私脱敏处理,使用时需注意个人信息保护。
背景与挑战
背景概述
该数据集由达摩研究院(DAMO Academy)等机构于2026年构建,围绕尼泊尔审计长办公室(OAG)发布的6,234份年度审计报告,系统性地解决了低资源语言(尼泊尔语)文档数字化与结构化难题。其核心研究问题在于,面对遗留的Preeti等非Unicode天城体字体,如何实现高保真文本提取与复杂表格单元格级解析,从而释放公共财政数据的分析潜力。通过提供338,257页带页面锚点的Markdown转录、28,348,869个表格单元格及多维度质量审计框架,该数据集为自然语言处理、文档理解及公共财政透明化研究提供了规模化、可验证的基础资源,显著推动了低资源语言场景下的学术探索与社会应用。
当前挑战
该数据集面临的挑战多维且深具代表性。在领域层面,它直面低资源语言文档理解中字体编码混乱、数字跨脚本混杂(天城体与ASCII数字并存)及复杂有界表格结构解析等长期痛点,为模型鲁棒性设定了更高门槛。在构建层面,解码精度受限于协议率(词级一致性仅76.2%),且存在页面内容重复、视觉OCR字符隐形替换等噪声;更甚者,部分英文文档与受损转录被误判为‘干净’,迫使研究者必须依赖细粒度质量轴计数而非简单标签。此外,数据集含个人敏感信息且未脱敏,以及PDF文件与转录间的完整对应管理,均为后续复用与隐私保护带来持续性挑战。
常用场景
经典使用场景
该数据集为尼泊尔审计长办公室(OAG)发布的年度审计报告提供了机器可读的转录文本及规整表格,覆盖地方、省和中央机构的审计发现、凭证编号和金额数据。其经典使用场景包括低资源语言下的文档解析、表格结构识别与信息抽取,尤其针对尼泊尔语天城体文书中的非Unicode旧字体解码问题。研究者可基于页面锚定的Markdown文本、单元格级表格数据及质量标注,开展文档理解、表格问答和关键词检索等任务,为南亚语种公共财政文献的自动化处理提供基准资源。
解决学术问题
该数据集解决了尼泊尔语审计报告数字化中的关键学术难题:传统PDF文本层因非Unicode字体(如Preeti)导致提取内容乱码,而视觉OCR在低资源环境下准确率受限。通过提供解码后的文本、结构化表格单元格及质量审计轴(如重复、缺失、数字损坏),数据集支持开发鲁棒的文档解码算法、表格解析模型和质控方法,并推动低资源语言NLP研究。其细粒度的质量标注(如逐页来源、数值解析难度)使研究者能量化误差传播,为数字人文、公共财政透明度和自动化审计分析奠定数据基础。
实际应用
在实际应用中,该数据集助力公共财政监督、反腐败调查和新闻调查报道。记者和公民组织可利用其搜索审计报告中的具体金额、凭证编号或违规记录,追踪地方政府资金使用情况;研究机构可基于其构建审计知识图谱,实现跨年份、跨地区的财政异常检测。此外,数据集的PDF源文件和SHA-256校验支持溯源验证,确保合规性。其CC BY-NC许可适用于非商业研究,为发展中国家的政府透明度工具和问责平台(如开放预算门户)提供关键数据支撑。
数据集最近研究
最新研究方向
该数据集聚焦于低资源语言文档理解与审计报告自动化的前沿探索,首次系统性地将尼泊尔语非Unicode旧字体PDF解码为大规模结构化语料,涵盖了338,257页、逾5.3亿天城体字符及44万+规则表格单元格的精细标注。研究热点在于通过字体解码与视觉OCR的混合策略解决遗留字体转换难题,并引入多维度质量审计框架以量化转录可靠性,为政府透明度、公共财政问责及南亚低资源自然语言处理树立了基准。其意义在于打破了语言障碍与文档形态的限制,推动跨语种信息抽取、表格问答及审计智能分析的研究进程,为全球类似非英文字档的数字化提供了可复制的范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务