遇见数据集

foia-reading-room-documents

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集包含来自美国联邦机构FOIA阅览室和监察长报告库的文档,包括审计、检查、调查摘要以及根据《信息自由法》(FOIA)发布的记录。所有文档均为美国政府工作成果,属于公共领域,且文件内容与机构发布的原始版本字节一致,未做任何修改。数据集旨在解决机构网站上文档频繁移动、重新编号或删除的问题,特别是SAM.gov附件在通知归档后容易消失,保存副本可使文档可引用,并支持批量处理。数据集的目录结构为:documents/<source>/<doc_id>.pdf,以及一个元数据文件metadata.parquet。元数据文件每行对应一个文档,包含来源、机构、标题、发布日期、来源URL、链接页面、字节大小、页数和文件的SHA-256校验和。数据来源是通过遵循各站点robots.txt规则,从机构FOIA图书馆和监察长报告列表收集而来,使用了govdocs工具。数据集规模在1千到1百万个文档之间,语言为英语,适用于文本检索等任务。

This dataset contains documents from U.S. federal agency FOIA reading rooms and Inspector General report libraries, including audits, inspections, investigation summaries, and records released under the Freedom of Information Act (FOIA). All documents are works of the U.S. government and are in the public domain, with file contents byte-identical to the original versions released by the agencies, without any modifications. The dataset is designed to address the frequent moving, renumbering, or deletion of documents on agency websites, especially SAM.gov attachments that tend to disappear after notice archiving. Saving copies makes documents citable and supports batch processing. The dataset directory structure is: documents/<source>/<doc_id>.pdf, along with a metadata file metadata.parquet. Each row in the metadata file corresponds to a document and includes source, agency, title, publication date, source URL, link page, byte size, number of pages, and SHA-256 checksum. The data was collected by following each sites robots.txt rules, from agency FOIA libraries and IG report listings, using the govdocs tool. The dataset size ranges from 1 thousand to 1 million documents, the language is English, and it is suitable for tasks such as text retrieval.

创建时间:
2026-09-05
原始信息汇总

Foia Reading Room Documents 数据集详情

该数据集收录了来自美国联邦机构FOIA(信息自由法)阅览室及监察长办公室报告库的公开文件,涵盖审计报告、检查报告、调查摘要及依据《信息自由法》发布的记录。所有文件均由美国联邦机构发布,属于美国政府作品,内容未经任何修改,与机构原始发布文件逐字节一致,metadata.parquet 中记录了原始字节的校验值。

数据来源与动机

  • 来源:数据收集自各机构FOIA资料库及监察长办公室的报告列表,遵循各网站 robots.txt 协议,通过 govdocs 工具采集。
  • 用途:由于机构常会移动、重新编号或删除其公开文件(例如SAM.gov附件会在公告存档后消失),本项目旨在保留副本,使文件可被引用,并支持批量处理语料库,免于逐份PDF下载。

数据目录结构

  • documents/<source>/<doc_id>.pdf:存放PDF原始文件。
  • metadata.parquet:每份文档对应一行元数据,包括:来源、机构、标题、发布日期、原始URL、来源页面链接、字节大小、页数及文件的SHA-256哈希。

元数据字段

字段 说明
source 文件来源机构或库
agency 所属联邦机构
title 文档标题
posted date 发布日期
URL 原始下载地址
page 来源页面链接
byte size 文件大小(字节)
page count 页数
SHA-256 文件校验值

数据集特征

  • 语言:英语(en)
  • 任务类型:文本检索(text-retrieval)
  • 许可:美国政府作品许可(us-government-work),详见 USA.gov政府作品说明
  • 文件规模:1,000 至 1,000,000 个文件之间(具体总数未标注)
搜集汇总
数据集介绍
foia-reading-room-documents 数据集图片
构建方式
该数据集汇聚了美国联邦机构依据《信息自由法》设立的阅览室及监察长办公室报告库中的公开文档,涵盖审计报告、检查报告、调查摘要及依FOIA披露的各类记录。数据构建过程严格遵循各机构网站的robots.txt协议,通过自动化工具从相关网页抓取原始文件,并确保每份文档与机构发布的字节完全一致,未作任何改动。同时,数据集为每份文档记录了详尽的元数据,包括来源机构、标题、发布日期、原始链接、页面大小、页数及SHA-256校验和,以保障文件的完整性和可追溯性。
特点
该数据集的核心特点在于其原始性与完整性,文件中包含的文档均系美国政府官方作品,且文件未经任何形式修改,确保研究者可获得与官方发布完全相同的原始资料。此外,数据集的构建解决了政府网站文档频繁移动或删除导致的可引用性缺失问题,特别是SAM.gov附件在公告归档后消失的情况,为这些易逝的公共记录建立了稳固的存档。其布局清晰,以目录结构存储PDF文件,并配套元数据表,便于用户进行批量处理和分析,极大提升了政府文件的可访问性和研究效率。
使用方法
该数据集适用于多种应用场景,特别是在文本检索、政府信息透明化分析和采购流程研究等领域。用户可通过元数据表筛选特定机构、日期或文档类型,进而定位并下载所需的PDF文件。由于文件字节未变,支持对原始内容进行精确的文本挖掘和自然语言处理。数据集的批量存储结构使得用于训练检索模型或构建政府文献知识库成为可能,研究者亦可将元数据与文件内容联合用于分析政府信息披露的趋势与模式。使用者应遵守美国政府作品的使用条款,并尊重各机构网站的数据获取政策。
背景与挑战
背景概述
该数据集名为“Foia Reading Room Documents”,由美国联邦政府机构发布,旨在收集和保存依据《信息自由法》(FOIA)公开的政府文件。其创建背景源于政府文件在机构网站上的不稳定存在,如SAM.gov附件在公告归档后可能消失,导致文件无法被引用和批量分析。数据集由Abigail Haddad及相关机构开发,利用govdocs工具爬取各机构FOIA阅览室和监察长报告库,确保文件字节级一致并附有校验和。此数据集解决了政府文件的可获取性和持久性问题,为公共记录研究、政府采购分析和透明化监督提供了可靠语料,推动了政府数据在学术和公共领域的应用。
当前挑战
该数据集面临的挑战包括:在领域问题层面,政府文件分散且链接易失效,导致引用和追溯困难,数据集的构建需应对来源网站的频繁变动和删除。构建过程中,需遵循各站点robots.txt规则,同时处理PDF的格式多样性、元数据缺失及大量文件的批量下载效率问题。此外,确保文件原始性和完整性(如SHA-256校验)也是一大技术挑战。数据规模虽在1K至1M之间,但文件类型复杂,涵盖审计、检查、调查摘要等,需统一元数据模型,且法律与伦理上需明确政府作品的使用边界,以避免版权或隐私风险。
常用场景
经典使用场景
该数据集汇聚了美国联邦机构依据《信息自由法》在阅览室及监察长报告库公开发布的官方文档,涵盖审计报告、检查报告、调查摘要及各类记录。其经典应用场景在于构建大规模、多源异构的政府文本检索基准,服务于文本检索、信息抽取、自动摘要等自然语言处理任务,并支持跨机构、跨时间维度的文档关联与知识图谱构建,为政务信息学与计算社会科学研究提供结构化语料基础。
解决学术问题
该数据集直面政府文件分散、易失效及难以批量获取的学术痛点,以字节级一致的存档方式解决了数据可引用性和语料完整性问题。其标准化的元数据(含SHA-256校验)为可复现研究提供可信数据基石,推动了信息自由法规效力评估、政府透明度量化分析及行政过程数据挖掘等跨学科议题的实证探索,使学者得以系统性地追踪公共记录生命周期。
衍生相关工作
基于该语料,衍生工作聚焦于文档级命名实体识别与关系抽取以构建政府实体图谱,以及利用预训练语言模型对审计报告进行自动分级和缺陷归类。后续研究可拓展至跨源文档相似度计算以识别遗漏的引用或重复公开,并促进与政务问答系统结合,形成从数据存档到智能分析的完整技术链,支撑下一代数字政务基础设施的研发。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务