oag-nepal-audit-reports
收藏资源简介:
该数据集是尼泊尔审计长办公室(OAG)发布的6,234份年度审计报告、公报、期刊及财务报表的机器可读转录本。原始PDF文本层大多使用旧式非Unicode的天城文编码(如Preeti和Fontasy Himali字体),导致常规提取器产生乱码。本数据集通过解码、页面锚定文本,并提取了规则审计表格的单元格网格,包括逐项审计发现、凭证编号和卢比金额。数据集包含338,257页、532,924,813个天城文字符、443,344个规则表格(含28,348,869个单元格,其中5,630,523个为可解析数值)。提供多个子集:documents(6,234行,每行对应一份出版物,含来源URL、PDF和转录的SHA-256哈希及页面/表格汇总)、pages(338,257行,每页的Markdown文本及出处)、tables(443,344行,每个规则表格块及其引入句和形状)、table_cells(28,348,869行,每个单元格的位置及解析数值)、quality(6,234行,11个质量审计轴及底层计数)、figures(181,920行,每页上的光栅图像分类)。此外还包含原始PDF文件(19.36 GiB)和完整转录的Markdown文件。数据集适用于文本检索、表格问答、文档问答、特征提取等任务,特别关注低资源语言尼泊尔语。注意:此为研究用制品,转录准确性基于与独立视觉OCR在390页样本上的词级一致率76.2%(清洁页面约93%);部分页面内容可能重复;数字区分天城文与ASCII数字;约11,551页来自视觉OCR,置信度较低;17份文档不含天城文字符;部分文档存在重复发布;未进行个人数据脱敏。数据集以CC BY-NC 4.0许可发布,用于研究、新闻和公民问责。
This dataset is a machine-readable transcription of 6,234 annual audit reports, bulletins, journals, and financial statements published by the Office of the Auditor General (OAG) of Nepal. The original PDF text layers mostly use legacy non-Unicode Devanagari encodings (e.g., Preeti and Fontasy Himali fonts), causing conventional extractors to produce garbled output. The dataset decodes, anchors text to pages, and extracts cell grids from regular audit tables, including line-item audit findings, voucher numbers, and rupee amounts. It contains 338,257 pages, 532,924,813 Devanagari characters, 443,344 regular tables (with 28,348,869 cells, of which 5,630,523 are parseable numeric values). Multiple subsets are provided: documents (6,234 rows, one per publication, with source URL, PDF and transcription SHA-256 hashes, and page/table summaries), pages (338,257 rows, Markdown text per page and provenance), tables (443,344 rows, each regular table block with its introductory sentence and shape), table_cells (28,348,869 rows, each cells position and parsed numeric value), quality (6,234 rows, 11 quality audit axes and underlying counts), figures (181,920 rows, raster image classification per page). Additionally, raw PDF files (19.36 GiB) and full transcription Markdown files are included. The dataset is suitable for tasks such as text retrieval, table question answering, document question answering, and feature extraction, with a focus on the low-resource language Nepali. Note: This is a research artifact; transcription accuracy is based on word-level agreement of 76.2% with an independent visual OCR on a 390-page sample (about 93% on clean pages); some page content may be duplicated; digits distinguish Devanagari and ASCII digits; approximately 11,551 pages come from visual OCR with lower confidence; 17 documents contain no Devanagari characters; some documents are republished; no personal data has been anonymized. The dataset is released under CC BY-NC 4.0 for research, journalism, and citizen accountability.
OAG Nepal 审计报告数据集 (OAG Nepal Audit Reports)
数据集概述
该数据集提供了尼泊尔审计长办公室(OAG)发布的 6,234 份出版物的机器可读转录文本和结构化表格数据。这些出版物包括地方政府、省级和中央机构的年度审计报告,以及 OAG 自身的公报、期刊和财务报表。数据集解决了原始 PDF 中遗留的非 Unicode 天城文字体(如 Preeti、Fontasy Himali)导致的文本提取乱码问题,提供了解码后、按页面锚定的文本和规则审计表格的单元格网格。
数据规模与构成
- 总量: 338,257 页,532,924,813 个天城文(Devanagari)字符,443,344 个规则表格,28,348,869 个表格单元格(其中 5,630,523 个为解析后的数字)。
- 数据集大小: 21.68 GiB,共 12,478 个文件。
数据配置(Configs)
数据集包含以下配置,每个配置对应一个 Parquet 文件:
| 配置名称 | 行数 | 内容说明 |
|---|---|---|
documents |
6,234 | 每个出版物一行,包含来源 URL、PDF 和转录文本的 SHA-256 哈希、页/表汇总 |
pages |
338,257 | 逐页 Markdown 文本,每行对应一个源页面,包含逐页来源信息 |
tables |
443,344 | 每个规则表格块一行,包含其引入句和形状 |
table_cells |
28,348,869 | 长格式,每个(行、列)槽位一行,包含解析后的数值 |
quality |
6,234 | 每份文件的 11 个审计轴结果,包含底层计数 |
figures |
181,920 | 页面上的每个光栅图像一行,已分类(见下文) |
额外资源: 数据集中还包含 markdown/(6,234 份转录文本)、pdf/(6,236 份源 PDF,19.36 GiB)以及 MANIFEST.json(列出所有文件及其大小和 SHA-256)。
数据分布
按出版物类型(部分):local-level-report(6,007 份)、report_province-report(56 份)、publication_audit-bulletin(29 份)、publication_right-to-information(22 份)等共 17 类。
省级报告(地方级):Koshi Province(1,101)、Madhesh Province(1,067)、Bagmati Province(951)、Lumbini Province(873)、Sudurpashchim Province(702)、Gandaki Province(681)、Karnali Province(632)。
按财政年度(BS)(部分):2077(796 份)、2075(776 份)、2078(775 份)、2082(764 份)等。
数据质量与限制
- 准确性为一致性比率:语料库与独立的视觉 OCR 读取(390 页样本)进行比较,语料库加权词一致性为 76.2%;在双方产出可比文本量的 171 页中,“干净”判定页的一致性约为 93%。这些指标是在早期版本树上测量的,可能不反映当前构建。
- 少数页面内容重复:338,257 页中有 1 页(0.000%)包含自身内容两次。
- 数字不跨脚本折叠:数据集中保留 45,725,582 个天城文数字和 14,746,219 个 ASCII 数字,它们保持独立,
value_num仅在单元格解析为纯标量时填充。 - 逐页来源:326,706 页来自 PDF 文本层(
text_layer),11,551 页因文本层字符不足而通过 300 DPI 渲染后由视觉模型读取(vision_ocr),后者置信度较低。 - 部分文档未解码:有 17 份文档包含零天城文字符,其中 13 份评分为
clean。其中大部分是英文翻译,0 份为 likhit 解码失败。建议过滤engine_fallback == False以获取实际解码的文本。
审计判定分布:clean(5,759 份)、suspect(463 份)、garbled(12 份)。clean 判定仅表示所有内部格式检查(如规范词、重复、乱码、数字损坏、结构等 11 个轴)均未触发,并不保证内容正确。
图表数据说明
figures 配置包含 181,920 行(每个页面上的光栅图像),但大多数并非真正的图表:
kind 类别 |
行数 | 含义 |
|---|---|---|
inline_image |
15,585 | 真正的图表候选(照片、图表) |
page_scan |
11,071 | 整页扫描图像 |
template_furniture |
66,980 | 办公室印章、徽章或重复出现的规则 |
glyph_or_fragment |
88,284 | 亚可见矢量填充或光栅化字形(中位面积约 150 像素) |
kind 是由阈值派生的,原始输入(page_frac、n_documents_sharing_image)也已提供,可自行重新划分。
重复文档处理
documents 配置中的 duplicate_role 字段标识重复文档:unique(6,136)、canonical(39)、unindexed(39)、conflict(20)。可使用 work_id 对底层相同工作的文档进行去重。
数据加载示例
python from datasets import load_dataset
pages = load_dataset("damo-da/oag-nepal-audit-reports", "pages", split="train") cells = load_dataset("damo-da/oag-nepal-audit-reports", "table_cells", split="train")
获取某省所有报告的数字单元格
docs = load_dataset("damo-da/oag-nepal-audit-reports", "documents", split="train") karnali = {d["doc_id"] for d in docs if d["province"] == "Karnali Province"} amounts = [c for c in cells if c["doc_id"] in karnali and c["is_numeric"]]
来源与许可
- 版本: 19-rc2 (2026-08-29 构建)
- 转录工具: likhit(开源尼泊尔语 PDF 文本提取器)
- 许可: CC BY-NC 4.0(非商业使用),适用于研究、新闻和公民问责工作
- 个人数据警告: 本数据集未进行任何脱敏处理,转录文本可能包含个人姓名、公民身份证书号码、出生日期、手机号码、个人 PAN 和电子邮件地址。
重要注意事项
- 该数据集是解码遗留字体语料库,并非干净的数字化文本,使用前请阅读质量限制部分。
- 数据集是研究产物,不是官方记录。重要数字应核对源 PDF(可通过
source_url和pdf_sha256验证)。 - 数据集包含 2 份无转录文本的 PDF(均为扫描件,无文本层)。





