遇见数据集

us-statutes-at-large

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集包含美国法律成文法(United States Statutes at Large)的装订卷,由美国联邦政府出版局(GPO)通过 GovInfo 平台发布,集合标识为 STATUTE。每个卷提供两种格式:PDF 文件和 USLM XML 文件。数据集包含 metadata.jsonl 元数据文件,每行对应一个卷,字段包括文件名、包 ID、卷号、国会届次、会议期、发布日期、页数、是否扫描版、PDF 字节数、PDF SHA256 哈希、XML 文件名、XML 字节数、XML SHA256 哈希、源包 URL。卷覆盖从第 1 卷(1789 年)到第 137 卷(2023 年),其中第 1–64 卷(1789–1951 年)为扫描图像,PDF 大小 45 MB 至 1.1 GB;第 65–116 卷(1951–2002 年)为扫描图像;第 117–137 卷(2003–2023 年)为原生数字版,PDF 大小 8 MB 至 45 MB。第 1–116 卷的 metadata.jsonl 中 scanned 字段为 true。此外,granules/ 目录下包含部分法律 PDF 样本,用于转换基准测试。数据来源为 GovInfo API,所有文件均为美国政府作品,在美国属于公共领域(不受版权保护)。该数据集由 statute-pdf-to-xml 项目生成,旨在将 PDF 转换为 USLM 格式,并与 GPO 提供的 XML 进行基准对比。

This dataset contains bound volumes of the United States Statutes at Large, published by the U.S. Government Publishing Office (GPO) via the GovInfo platform, with collection identifier STATUTE. Each volume is provided in two formats: PDF files and USLM XML files. The dataset includes a metadata.jsonl file where each line corresponds to a volume, with fields such as file name, package ID, volume number, Congress, session, issue date, page count, scanned flag, PDF byte size, PDF SHA256 hash, XML file name, XML byte size, XML SHA256 hash, and source package URL. Volumes range from Volume 1 (1789) to Volume 137 (2023). Volumes 1–64 (1789–1951) are scanned images with PDF sizes from 45 MB to 1.1 GB; volumes 65–116 (1951–2002) are scanned images; volumes 117–137 (2003–2023) are born-digital with PDF sizes from 8 MB to 45 MB. The scanned field in metadata.jsonl is true for volumes 1–116. Additionally, the granules/ directory contains sample PDFs of individual laws for conversion benchmarking. Data is sourced from the GovInfo API, and all files are U.S. government works in the public domain. This dataset was generated by the statute-pdf-to-xml project to convert PDFs to USLM format and benchmark against XML provided by GPO.

创建时间:
2026-09-06
原始信息汇总

数据集概述

数据集名称:United States Statutes at Large(美国法规总汇)

数据集类型:法律文献数据集,包含美国国会通过的法律的官方汇编卷宗。


内容与结构

该数据集收录了美国官方法规汇编的合订本,每卷包含一个 PDF 文件和一个 USLM(United States Legislative Markup)XML 文件。具体文件结构如下:

  • metadata.jsonl — 每一卷的元数据记录(每卷一行)
  • pdfs/STATUTE-{n}.pdf — 来自 GovInfo 的卷 PDF 文件
  • xmls/STATUTE-{n}.xml — 来自 GovInfo 的卷 USLM XML 文件
  • granules/ — 按法律拆分的 PDF 样例文件(用于转换基准测试,并非所有法律均包含)

元数据字段包括:file_name(PDF 路径)、package_idvolume(卷号)、congress(国会届次)、session(会期)、date_issued(发布日期)、pages(页数)、scanned(是否为扫描版)、pdf_bytespdf_sha256xml_filexml_bytesxml_sha256source_package_url(来源包地址)。


时间跨度与格式特征

卷号 年份 PDF 格式 XML 格式
第1至64卷 1789至1951年 扫描图像,45 MB 至 1.1 GB 由 GPO 基于 OCR 和编辑标记生成
第65至116卷 1951至2002年 扫描图像 由 GPO 生成
第117至137卷 2003至2023年 原生数字格式,8 MB 至 45 MB 由 GPO 基于排版源文件生成

元数据中 scanned 字段在第1至116卷时为 true(即这些卷为扫描版本)。


来源与许可

  • 数据来源:美国政府出版局(U.S. Government Publishing Office)的 GovInfo 平台,集合标识为 STATUTE,下载地址格式为 https://api.govinfo.gov/packages/STATUTE-{n}/pdf/uslm
  • 许可协议:其他(other),具体为公共领域(public-domain),依据美国法典第17篇第105条(17 U.S.C. 105),美国政府作品在美国不受版权保护。
  • 语言:英语(en)。
  • 规模:样本数量小于 1,000(n<1K)。

衍生说明

该数据集由 statute-pdf-to-xml 项目制作,该项目使用 Docling 将 PDF 转换为 USLM 格式,并与 GPO 官方 XML 进行基准对比验证。数据标签包括:legallegislationunited-statesstatutespdfuslm

搜集汇总
数据集介绍
us-statutes-at-large 数据集图片
构建方式
美国联邦法律汇编《United States Statutes at Large》是依据美国政府出版局在GovInfo平台上发布的官方文献构建而成的数据资源。该数据集涵盖了从第1卷至第137卷的完整卷宗,时间跨度自1789年至2023年,每个卷宗均提供PDF与USLM XML两种格式的文件。在构建过程中,对于早期卷宗(1至116卷),采用扫描图像结合OCR技术及编辑标记生成XML;而对于2003年后的卷宗(117至137卷),则直接源自数字化排版源文件。此外,数据集还附有granules文件夹,收入部分单行法律文件,为转换基准测试提供了便利。所有文件的元数据均被详实记录于metadata.jsonl文件中,包括文件路径、卷号、国会届次、所属会期、出版日期及字节数等关键信息。
使用方法
使用者可通过metadata.jsonl文件便捷地索引各卷本,依据所需年份或国会届次选择相应PDF或XML文件。PDF文件适合直观阅读,而XML文件则适合进行深入的文本挖掘与自动化分析。对于涉及历史卷宗的研究,可利用granules目录下样本文档进行OCR转换效果的评估与基准测试。数据集的XML格式完全兼容USLM标准,便于与现有法律数据处理工具链集成,支持构建检索系统、语料库分析乃至机器学习模型。鉴于其公有领域特性,该数据集可自由整合入各类研究或商业项目中,极大便利了法律信息的获取与利用。
背景与挑战
背景概述
《美国法令全书》(United States Statutes at Large)作为美国联邦立法的权威汇编,自1789年首卷问世以来,承载了逾两个世纪的宪政与法治演进历程。该数据集的构建依托于美国国家政府出版局(GPO)在GovInfo平台上的官方数字馆藏,由statute-pdf-to-xml项目团队主导,旨在将涵盖1789年至2023年间的137卷法律文献系统性地转化为结构化数据。项目核心研究问题聚焦于利用Docling等工具实现历史法律文档的数字化转型,并通过与GPO提供的USLM XML进行基准比对,评估转换精度,从而为法律信息学、历史计量学及计算法学等领域提供标准化的语料基础。此数据集的发布不仅填补了公开法律文献在机器可读格式上的重大空白,更对法律文本挖掘、立法趋势分析及司法判例研究产生了深远影响。
当前挑战
该数据集所面临的挑战多维度而深刻。首要挑战源于法律文献本身的复杂性,涵盖跨越两个多世纪的立法文本,其语言风格、格式规范与法律术语随时代变迁而演化,使得统一解析与标注成为难题。其次,数据集构建中遭遇了显著的技术壁垒:前116卷为扫描影像,文本提取依赖光学字符识别,卷宗体积差异悬殊(自45MB至1.1GB),且早期页面存在褪色、版式混乱等问题,严重限制了OCR精度;而2003年后以数字原生格式出版的卷宗则相对易处理,但确保所有卷宗在转换至USLM格式时保持语义一致性与结构完整性,仍需克服复杂版面识别、跨页法律条目协调及历史标点规范等重重障碍,因此,整个构建过程需精细调试与多层校验,方能实现高保真度的数据呈现。
常用场景
经典使用场景
该数据集汇聚了自1789年以来美国国会通过的全部成文法文本,其时间跨度之长、内容覆盖之广在立法语料库中堪称罕见。作为法律信息学与计算法学研究的基石,它常被用于大规模法律文本的语料构建、法律条文的时间演化分析以及立法与司法决策之间的关联性挖掘。研究者可便捷地获取法案的官方PDF与结构化XML双版本,从而进行跨卷本、跨会期的系统性文本对比,为量化法律史研究提供了不可多得的素材。
解决学术问题
该数据集精准回应了法律研究领域长期面临的数据分散、格式混乱与获取成本高昂等痛点。通过统一整理并公开美国法典的全部卷宗,它极大促进了法律文本的数字化与标准化进程,使得学者能够依托完整、可靠的语料开展法律语言模型预训练、法条语义检索、立法主题建模以及法律变迁的定量分析等前沿探索。其严谨的元数据设计亦为可重复性研究树立了标杆。
实际应用
在实际应用中,该数据集被广泛用于法律科技产品的开发与迭代,诸如智能法律检索系统、合同审查辅助工具以及面向公众的立法信息问答平台等。立法机构、研究智库与新闻媒体亦借助其数据,快速溯源法律历史、核查条文变更,从而提升立法透明度与公共信息服务质量。政府出版机构与历史档案馆可依赖这些数据实现馆藏文献的数字化典藏与高效管理。
数据集最近研究
最新研究方向
该数据集聚焦于美国成文法的数字化与结构化管理,其前沿研究方向在于利用自然语言处理与文档解析技术,对历史法律文本进行高精度的自动化转换与语义标注。近期热点事件包括美国政府出版局对1790至2023年间法律卷宗的全面数字化,以及基于USLM格式的法律信息抽取与对比分析系统的开发。此数据集对于法律信息学、计算法学及立法历史研究具有里程碑意义,为法律文本的机器可读性、跨版本比对及法律演化分析提供了坚实基础,推动了法律知识图谱构建与智能法律检索系统的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务