遇见数据集

govinfo-documents

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

Govinfo Documents 数据集收录了美国政府出版办公室(GPO)在 govinfo.gov 上发布的官方文档,包括国会听证会、委员会报告、国会文件、政府问责局(GAO)报告、机构出版物和总统文件等。所有文档均为PDF格式,且与GPO原始文件字节完全一致,未做任何修改。数据集包含元数据文件 metadata.parquet,每行对应一份文档,记录来源、机构、标题、发布日期、原始URL、链接页面、文件大小(字节)、页数以及SHA-256校验和。文档数量在1千到1百万之间,英文语言,适用于文本检索任务。该数据集旨在解决政府文件因网站迁移、重编号或删除而无法引用的问题,支持批量处理和分析。所有文档均为美国联邦政府作品,属于公共领域。

Govinfo Documents dataset contains official documents published by the U.S. Government Publishing Office (GPO) on govinfo.gov, including congressional hearings, committee reports, congressional documents, Government Accountability Office (GAO) reports, agency publications, and presidential documents. All documents are in PDF format, byte-identical to the original GPO files, with no modifications. The dataset includes a metadata file metadata.parquet, with each row corresponding to a document, recording source, agency, title, publication date, original URL, link page, file size (bytes), number of pages, and SHA-256 checksum. The number of documents ranges from 1,000 to 1,000,000, in English, suitable for text retrieval tasks. The dataset aims to address the problem of government documents being unreferenceable due to website migration, renumbering, or deletion, and supports batch processing and analysis. All documents are U.S. federal government works and are in the public domain.

创建时间:
2026-09-05
原始信息汇总

数据集概述

Govinfo Documents 是一个由美国政府印刷局(GPO)在 govinfo.gov 上发布的官方文档集合,包含多种类型的政府出版物,均为与 GPO 原始文件字节一致的 PDF 格式。

数据内容

  • 文档类型:国会听证会、委员会报告与印刷品、国会文件、政府问责局(GAO)报告、机构出版物及总统文件
  • 语言:英语
  • 规模:1,000 至 1,000,000 条记录之间
  • 任务类别:文本检索(text-retrieval)
  • 许可:美国联邦政府作品(US Government Work),可自由使用

数据来源与完整性

  • 所有文档均由美国联邦机构发布,属于美国政府作品
  • 文件未做任何修改,与机构发布的原始版本字节一致
  • metadata.parquet 中存储了原始字节的校验和(checksum),确保数据完整性

数据集结构

数据集的布局如下:

documents/<source>/<doc_id>.pdf metadata.parquet

metadata.parquet 文件包含每个文档的一行记录,字段包括:

  • 来源(source)
  • 机构(agency)
  • 标题(title)
  • 发布日期(posted date)
  • 原始 URL
  • 链接来源页面
  • 字节大小
  • 页数
  • 文件 SHA-256 哈希值

创建目的

该数据集解决了政府机构网站中文档经常被移动、重新编号或删除的问题(尤其是 SAM.gov 附件在通知归档后会消失)。通过保留文档副本,使得这些政府文件可被引用,并允许用户以批量方式处理整个语料库,而无需逐一下载 PDF。

采集方式

  • 数据收集自 GPO 在 govinfo.gov 上发布的按集合分类的站点地图(sitemaps)
  • 遵循其 robots.txt 协议
  • 无需 API 密钥
  • 使用开源工具 govdocs 进行采集
搜集汇总
数据集介绍
govinfo-documents 数据集图片
构建方式
本数据集收录了美国政府出版局(GPO)在govinfo.gov平台上发布的一系列官方文献,涵盖国会听证会、委员会报告与印刷品、国会文件、政府问责署(GAO)报告、机构出版物及总统文件等。所有文档均以与GPO原始发布逐字节一致的PDF格式存储,并通过校验和验证确保未作任何改动。数据采集遵循GPO发布的站点地图及robots.txt规范,无需API密钥,数据源自各机构官方网页及其归档链接,保证了来源的权威性与可追溯性。
特点
该数据集的核心特质在于其完整性与可引用性。由于联邦机构常会移动、重新编号或删除其网站上的文件,尤其是SAM.gov附件在公告归档后会消失,本数据集通过永久保存这些文件,确保其可被稳定引用。同时,数据集以批量形式提供,便于用户进行大规模文本处理而非逐一访问。元数据文件(metadata.parquet)记录了每一文档的来源机构、标题、发布日期、原始URL、字节大小、页数及SHA-256校验值,为后续验证与追踪提供了详尽信息。
使用方法
使用者可通过HuggingFace平台直接访问数据集,其布局清晰:PDF文档按来源组织存放于documents/<source>/<doc_id>.pdf路径下,配套的metadata.parquet文件则以表格形式汇总了所有文档的元数据。用户可根据检索需求(如文本检索任务)利用元数据字段进行筛选,或直接加载PDF进行自然语言处理、信息提取等应用。数据集规模在1千至1百万文档之间,适用于学术研究、政策分析及透明度监督等场景,且所有文档均为美国政府作品,可自由使用无需额外授权。
背景与挑战
背景概述
govinfo-documents数据集由美国政府出版局(GPO)于近期构建,旨在系统化收集并保存联邦政府发布的官方文档,包括国会听证会、委员会报告、政府问责署报告及总统文件等,以PDF格式原样保留,确保与GPO发布内容逐字节一致。该数据集的创建源于政府网站文档频繁迁移、重新编号或删除的问题,特别是SAM.gov附件在通知归档后易丢失,导致引用困难。其核心研究问题在于为政府信息提供持久、可引用的公共知识库,支持大规模语料分析。作为开放资源,它对公共记录保存、政府透明度研究及自然语言处理领域具有重要影响力,为学者、记者和公众提供了便捷的批量访问通道,推动了政府文档的可及性与可计算性。
当前挑战
该数据集面临的挑战涵盖多个维度。在领域问题层面,首要挑战是政府文档的零散与易逝性,原始来源网页的频繁变动常致链接失效,而数据集需确保已保存内容的长期稳定访问。其次,文档格式多样性(如PDF内部布局差异)及元数据的一致性也构成标注与检索的难题。在构建过程中,需严格遵循robots.txt与版权法规,平衡自动化抓取与网站负载;同时,对海量PDF需进行逐字节校验和计算以验证完整性,确保副本质量无瑕。此外,元数据字段(如来源、日期、大小)的准确映射与跨部门命名标准的统一亦颇具挑战,要求数据处理流程具备高度鲁棒性与可持续更新机制,以应对不断增加的文档种类与数量。
常用场景
经典使用场景
Govinfo Documents数据集汇聚了美国政府出版局发布的各类官方文献,涵盖国会听证会、委员会报告、政府问责局报告及总统文件等。在信息检索与自然语言处理领域,该数据集常被用作大规模文本检索基准,评估检索模型在处理长篇幅、多主题、多源文档时的性能。研究者可借此构建针对政府文件的语义检索系统,探索跨文档信息抽取、主题建模及事实验证等任务。其PDF与元数据的完整对应关系,亦支持文档分类、自动摘要及实体识别等经典场景的深入研究。
解决学术问题
该数据集有效解决了政府文献分散、易失且难以批量获取的学术困境,为公共记录研究提供了稳定、可引用的语料基础。学术上,它支撑了关于政府信息透明度的计量分析,使研究者能够追溯政策议题的演变轨迹。同时,数据集的权威来源与细粒度元数据(如发布日期、来源机构)助力于新闻传播学中的议程设置研究,以及公共管理学中关于行政效率的实证检验。通过提供字节级一致的原始文件,它保障了可复现性,推动了法律文献学、历史学等交叉领域的量化研究。
衍生相关工作
该数据集的发布催生了多项基础性工作。最直接的是配套的开源爬虫工具govdocs,其设计推动了联邦电子政务资源的规范化采集。后续研究基于此语料,衍生出专门针对政府文本的语言模型微调方案,以及多源政府文件与SAM.gov合同数据的交叉分析方法。在档案学领域,它促成了关于政府网络资源保存策略的讨论,提出了应对链接失效的稳定性复制框架。此外,若干研究利用其元数据开发了行政时间线可视化系统,为政府决策过程的历史重构提供了新的分析范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务