遇见数据集

Open US Law

收藏
github2026-07-22 更新2026-07-24 收录
官方服务:

资源简介:

Open US Law 是一个开放、结构化的美国主要法律语料库,包含200多万个州成文法、美国法典、州宪法等章节,数据以Parquet格式提供,采用CC BY 4.0许可,季度更新快照。

Open US Law is an open and structured corpus of major U.S. legal materials, containing over 2 million chapters including state statutes, the United States Code, state constitutions and other related legal documents. The data is provided in Parquet format, licensed under CC BY 4.0, with quarterly updated snapshots.

创建时间:
2026-07-18
原始信息汇总

数据集概述:Open US Law

基本信息

  • 项目名称:Open US Law
  • 托管地址:GitHub(https://github.com/Vaquill-AI/open-us-law)
  • 数据发布平台:Hugging Face(https://huggingface.co/datasets/vaquill/open-us-law)
  • 镜像存储:Cloudflare R2(https://oss-data-us.vaquill.ai)
  • 维护方:Vaquill AI

核心目标

提供开放、结构化、可批量下载的美国一级法律数据(包括州成文法典、美国法典、联邦行政法规、州宪法、法院规则等),统一为单一模式,数据主要来自官方政府来源。

数据内容与规模

快照版本 v2026.07 包含 2,046,009 个章节(sections),按语料库划分如下:

语料库 章节数 管辖范围
州及领地成文法 1,983,394 50 州 + 华盛顿特区 + 波多黎各
美国法典(United States Code) 54,853 联邦
宪法 7,762 52 个

数据格式与模式

  • 格式:Parquet(24 列统一模式),适用于所有管辖范围
  • 每个章节字段包括
    • id / act_id:稳定的层级标识符
    • citation:人工引用格式
    • node_name / section_title:章节标题
    • node_text / text:法律文本
    • level_classifier:层级分类
    • link / source_url:指向官方来源的反向链接
    • act_status:法律状态(生效、废止、保留、重新编号等)
  • 许可协议:数据编译采用 CC BY 4.0,脚本采用 Apache-2.0
  • 更新频率:每季度发布新的带日期快照

覆盖范围

联邦法律

涵盖美国法典、联邦行政法规(eCFR)、联邦公报、IRS 国内税收公报、SSA 裁决、总统文件等,并提供相应的解析与下载脚本。

州成文法(全部 50 州)

各州均提供独立的爬取脚本,所有 50 州及华盛顿特区、波多黎各的成文法数据完整。部分州(AL、CT、IN、NH、NY)需要美国 IP 或代理访问。宾夕法尼亚州仅包含合并成文法,未合并部分待补充。

州行政法规

涵盖 14 个州的行政法规爬取脚本(如科罗拉多、爱达荷、伊利诺伊、堪萨斯等)。

州法院规则

涵盖 9 个州的法院规则爬取脚本(如亚利桑那、马里兰、明尼苏达、内华达、纽约、佛罗里达、德克萨斯、新泽西等),以及一个多州通用脚本。

州宪法

50 州宪法及美国联邦宪法、联邦法院规则的解析脚本。

重要注意事项

  1. IP 限制:部分州网站对非美国 IP 进行地理封锁,需要代理或在美国主机上运行。
  2. 网站变更风险:爬取脚本针对实时政府网站,可能因网站改版、URL 变动或反爬措施而失效。
  3. 浏览器依赖:少数州使用 JavaScript 渲染,需要 Selenium 和 Chrome/Chromium。
  4. 快照时效性:数据为运行时的归档快照,并非实时法律,使用前需以官方来源核实。
  5. 部分数据来源:少数州成文法来自商业聚合商而非官方发布者,这些记录不带 source_url 字段。

数据获取方式

  • 直接从 Hugging Face 加载(支持 Python datasets 库)
  • 从 Cloudflare R2 镜像直接下载(零出站费用,支持范围请求)
  • 下载合并的 tarball 或查看清单文件
搜集汇总
数据集介绍
Open US Law 数据集图片
构建方式
在公开的美国法律体系中,尽管判例法与联邦法律已可通过CourtListener等平台开放获取,但五十州成文法典的结构化批量访问长期缺失。Open US Law 数据集正是为填补这一空白而生。其构建方式秉持可复现与可审计原则,通过一组精心编制的网络爬虫(scrapers),从官方政府来源(如各州立法机构网站、uscode.house.gov等)逐条采集法规文本。对于部分存在地理限制的州,爬虫支持通过美国代理服务器运行。所有采集的原始数据被统一转换为JSONL格式,每条记录包含稳定层级标识符(如us/co/statutes/title=3/article=1/section=3-1-101)、引用格式、章节标题、正文文本以及指向官方源页面的回链,最终归一化至包含24个字段的单一Parquet模式。
特点
该数据集的核心特点在于其全面性与标准化程度。它囊括了美国全部50个州及哥伦比亚特区、波多黎各的成文法(共计近200万条),同时覆盖《美国法典》与《联邦法规汇编》以及52部州与联邦宪法。每条法规均标注了生效状态(如现行有效、废止、预留、重新编号等),并附有引用格式与完整的层级结构信息。尤为难得的是,数据集中还嵌入了法规间的交叉引用关系,指向《美国法典》与《联邦法规汇编》的相关条款。所有数据以统一的Parquet格式存储,支持按管辖区域、法规状态等字段进行高效过滤与检索,新版快照每季度发布一次,确保时效性。
使用方法
对于大多数用户而言,使用该数据集最便捷的方式是直接从Hugging Face下载已构建完成的快照。通过Hugging Face的datasets库,只需一行代码即可加载整个数据集或特定管辖区域的法规:例如使用load_dataset("vaquill/open-us-law", "statutes", split="train")加载全部成文法。用户也可访问Cloudflare R2镜像站点直接下载Parquet文件或整体打包的tarball。如需自行构建最新数据,可克隆GitHub仓库并运行相应的爬虫脚本:安装依赖后,执行如python -m src.scrapers.us.states.co.statutes.scrapeCO这类命令,即可针对特定州进行数据采集与解析,输出JSONL格式的原始文件。
背景与挑战
背景概述
Open US Law数据集由Vaquill AI团队于近年创建,旨在填补美国州级法律数据在开放领域的空白。尽管美国法律属于公共领域,且联邦法律(如美国法典、联邦法规)已存在开放获取渠道,但涵盖50个州的成文法典、行政法规、宪法及法院规则的标准化、结构化批量数据却长期缺失,主要被商业API所垄断。该数据集在《Georgia v. Public.Resource.Org》案(2020年)确立政府法令不可版权化的背景下应运而生,首次将跨管辖区的美国一级法律文本归一化为统一的Parquet格式,包含超过200万条法律章节,覆盖50州、哥伦比亚特区及波多黎各,并提供可复现的抓取工具。其发布为法律信息学、自然语言处理及公共政策研究提供了此前难以获得的基准资源,显著降低了获取全美法律语料的技术与成本门槛。
当前挑战
该数据集面临的核心挑战首先在于领域问题的复杂性:美国法律体系高度碎片化,各州政府网站结构、格式及访问策略迥异,导致跨州法律文本的归一化与结构化困难重重。具体而言,多个州(如阿拉巴马、康涅狄格、纽约)对非美国IP实施地理封锁,抓取器需依赖代理服务;部分州依赖JavaScript渲染或反爬机制,需使用Selenium等浏览器自动化工具,增加了维护成本。构建过程中最突出的挑战在于政府网站的不稳定性——站点频繁改版、URL迁移或HTML结构变化,使得逐一编写的状态抓取脚本易随时间失效,需要社区持续修复。此外,数据集为快照存档而非实时更新,法律文本的动态变化意味着用户引用前必须与官方来源核实,无法作为权威法律依据直接使用。
常用场景
经典使用场景
在计算法学与法律信息检索这一兼具学术深度与社会实践价值的交叉领域中,Open US Law 数据集以其全景式的美国法律体系整合而成为不可多得的基石性资源。该数据集以其独特的结构设计,横跨联邦与州两大层面,将美国法典、联邦行政法规、全部五十州的成文法规、州行政法规、州与联邦宪法以及法院规则纳入统一且规范的架构之中。尤为珍贵的是,它弥补了此前开放生态中州级法规长期缺失的关键环节——过往美国判例法与联邦法虽已实现较为开放的获取,但各州法规的整洁结构化数据却一直深藏于商业API之后。Open US Law 将零散分布于不同州官方网站、格式各异、更新节奏参差的原始法律文本提炼为拥有24列固定模式规约的Parquet文件,覆盖超过两百万个法律章节,每一节均配备了标准引用、生效状态、完整层级路径以及指向联邦法律的交叉引用。学者与开发者可以无缝地对其展开宏观的法律编纂模式系统性分析,或是针对特定州与特定领域的微观条文进行精准挖掘。
实际应用
在实践场景中,Open US Law 数据集的应用辐射范围横跨法律服务、公共治理与商业智能等多个维度。最直接的受益者当属法律科技领域——即智能法律检索系统与法律自动化分析工具的研发者与运营者。借助该数据集提供的结构化法律全文,可以在无需逐州对接分散的政府网站或依赖单一商业数据库的情况下,快速构建覆盖全国范围的法律规则引擎。例如,合规科技平台可以利用其内置的交叉引用机制,自动梳理某一联邦法规与五十个州对应条例之间的联动关系,极大提升跨国企业合规审查的深度与响应速度。面向公共利益的治理信息平台亦可依托其数据规范性,直接向公民提供其所在州最新生效的法律条文检索服务,弥补官方渠道在用户友好性上的空白。此外,从事法律人工智能产品开发的团队,将基于该数据集的统一结构实现更加流畅的向量化嵌入、语义索引以及基于检索增强生成的回答系统构建。
衍生相关工作
Open US Law 数据集的诞生和发展,在多个维度上催生了一系列颇具学术与工程价值的相关工作。其本身即扮演了填补开放法律生态中缺失一环的关键角色——承袭并拓展了 CourtListener 与 Caselaw Access Project 在判例法领域建立的开放传统,以及 govinfo 平台上美国法典USLM XML在联邦法层面的结构化实践,将开放获取的边界从联邦延伸至各州。该项目的工具链体系亦为后续研究者提供了可复用的方法论参照:每州一个自含型爬虫的设计模式,结合对政府网站变化的高容忍度处理策略,在信息可持续获取这一核心挑战上做出了优雅的工程回答。在此基础上,衍生出的许多工作围绕该数据集的二次开发展开——例如,以其结构化数据为原料构建的跨州法规语义相似性图谱,或基于其交叉引用关系网络构建的法律脉络演化分析系统。此外,Vaquill AI 团队以该数据集为基底推出的检索与引用解析API,也可视为该项目从数据集向完整法律检索服务生态衍进的重要延伸。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务