遇见数据集

american_municipal_law

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集为美国市政法规(American Municipal Law)的研究快照,由 justiceDAO 项目收集,旨在提供美国各市/县法规的结构化数据。数据来源于官方发布平台(如 Municode、eCode360、American Legal),通过爬虫采集并整理为 Parquet 格式。数据集包含四个批次(drops 1–4),共涵盖 326 个司法管辖区,涉及约 225,645 个 HTML 章节,分布在多个州(drop3 覆盖 29 个州,drop4 覆盖 21 个州)。每个管辖区提供两个配置:html 和 citation,分别存储法规的 HTML 文本和引用信息。此外,还包含元数据 JSON 文件。数据压缩采用 ZSTD 格式。该数据集适用于文本检索、法律信息提取、法规分析等自然语言处理任务。注意:本数据集仅供研究使用,不构成法律建议,且仅包含前四个批次的快照,后续收集仍在进行中。

This dataset is a research snapshot of American Municipal Law, collected by the justiceDAO project, aiming to provide structured data on municipal/county regulations across the United States. The data originates from official publishing platforms (such as Municode, eCode360, American Legal), gathered via web scraping and organized into Parquet format. The dataset includes four batches (drops 1–4), covering 326 jurisdictions, approximately 225,645 HTML sections, distributed across multiple states (drop3 covers 29 states, drop4 covers 21 states). Each jurisdiction offers two configurations: html and citation, storing the HTML text and citation information of the regulations respectively. Additionally, metadata JSON files are included. Data compression uses ZSTD format. This dataset is suitable for natural language processing tasks such as text retrieval, legal information extraction, and regulatory analysis. Note: This dataset is for research purposes only, does not constitute legal advice, and only contains snapshots from the first four batches; subsequent collection is ongoing.

创建时间:
2026-09-03
原始信息汇总

数据集概述

American Municipal Law 是一个面向美国市/县级法典的法律文本研究快照数据集,由 justiceDAO 采集。该数据集目前收录了来自 1,283 个司法管辖区的数据(快照日期为 2026-09-04),规模在 1K 至 10K 之间,语言为英语。

数据内容与格式

数据集包含两个主要配置:

  • html(默认配置):各司法辖区的 HTML 格式法典文件
  • citation:对应的引用信息文件

文件布局为 american_law/data/{gnis}_html.parquet{gnis}_citation.parquet,元数据存放在 american_law/metadata/{gnis}.json。所有文件均采用 ZSTD 压缩格式。

数据来源与合并

数据集的构建包含多个来源和批次:

  • 通过 municode.py 实时抓取的数据
  • 通过 ecode360.pyamlegal.py 采集的草案数据(基于 HTML/JSON)
  • 通过 run_batch_multi.py 批量运行的数据
  • justicedao/american_municipal_law 合并的 752 个司法辖区数据(其中 67 个因缺少 citation 文件被跳过)
  • 合并前 Hub 上已有 510 个辖区数据

数据清单由多个 manifest 文件记录,包括 first_drop_manifest.jsonldrop2drop4drop_incr_* 增量清单以及 justicedao_merge_manifest.jsonl

许可与声明

数据集采用自定义许可(名称为 municipal-codes-as-published),其内容为各官方主机或 Municode 发布的市政法典。justiceDAO 源数据采用 MIT 许可,本数据集打包为研究快照用途。数据集明确声明 不构成法律建议,正式文本以官方发布版本为准。

已知局限

  • 更多城镇数据仍在持续采集中,抓取队列会排除已存在于 Hub 上的所有 GNIS
  • 67 个 justicedao 的 html-only GNIS 未合并(因源端缺少 citation parquet 文件)
  • eCode360 和 American Legal 的抓取器仍处于草案/MVP 阶段,正在进行浸泡测试
  • 嵌入向量 parquet 文件未包含在本数据集中
搜集汇总
数据集介绍
american_municipal_law 数据集图片
构建方式
该数据集旨在为美国市县法规研究提供系统化的数据基础,通过整合多源市政法规文本构建而成。数据主要采集自Municode、eCode360和American Legal等官方法规发布平台,其中Municode数据由实时爬虫获取,而eCode360与American Legal的数据则经由HTML或JSON解析草案生成。数据集的构建过程遵循批次化流程,包括首轮数据收集(first drop)及后续增补轮次,并与justiceDAO项目进行了合并,将752个司法管辖区的数据整合进现有框架,最终形成包含1283个司法管辖区的综合快照。每个司法管辖区均以GNIS为标识存储为独立的Parquet文件,分别包含HTML原始页面和节选引用文本,并配套元数据JSON文件。整体数据以ZSTD压缩格式存储,兼顾存储效率与读取速度。
特点
该数据集聚焦于美国市县法规,具有高度的时效性、地域覆盖广度及格式多样性。其显著特点在于数据源融合了官方Municode平台与justiceDAO的既有数据集,并通过去重策略(跳过67个缺失引用数据的司法管辖区)保证了数据的完整性。数据以GNIS为键进行组织,便于与地理信息系统关联;同时提供HTML和引用两种文本形态,可满足全文检索与结构化引用的差异化需求。此外,数据集的采集过程高度自动化,具备可扩展的爬虫架构和增量更新机制,适用于持续监测法规动态。值得注意的是,该数据仅作为研究快照,不构成法律建议,其官方发布文本仍具权威性。
使用方法
使用时,研究人员可依据HuggingFace数据集的标准加载流程,通过指定配置(如`html`或`citation`)来获取相应格式的法规文本。数据文件遵循`american_law/data/{gnis}_html.parquet`等固定布局,便于按需读取特定司法管辖区的数据,亦可将各Parquet文件合并为完整语料库。由于数据以Parquet格式存储,用户可借助Pandas或Dask等工具进行高效处理,进而应用于法律文本检索、法规趋势分析或NLP模型训练等场景。数据集的元数据JSON文件为每个司法管辖区提供了附加信息,方便进行地域筛选。尽管该数据集已具相当规模,但官方提示存在部分未收集地区及草案质量的爬虫数据,应用时应结合官方来源进行交叉验证。
背景与挑战
背景概述
美国市政法规数据集(American Municipal Law)于2026年9月创建,由justiceDAO团队主导,旨在系统化收集美国市县级法规文本,为法律科技与公共治理研究提供结构化语料。该快照涵盖1283个司法管辖区,整合了Municode、eCode360、American Legal等来源,并通过合并justiceDAO已有数据扩展了752个辖区。其核心研究问题在于构建一个开放、多层次的法律文本检索资源,以支持法规比对、语义检索及政策分析等领域。该数据集的发布填补了市政法规层面大规模结构化数据的空白,对计算法学、智慧政务及法律人工智能研究具有重要推动作用,其多格式(HTML与引用元数据)设计也为后续自然语言处理任务奠定了数据基础。
当前挑战
该数据集面临的挑战多维且显著。领域层面,市政法规数据高度异构,各辖区法规结构、编码体系及更新频率差异巨大,这使得统一的文本规范化与语义对齐困难重重,阻碍了跨辖区高效检索与比较。法律文本的严谨性要求数据采集必须高度保真,任何疏漏均可能导致谬误传播,而版权与使用条款的复杂性也为数据开放共享带来法律壁垒。构建过程中,采集器依赖实时抓取,面临网页结构变动及反爬机制的不确定性;eCode360和American Legal的抓取工具尚处于草案阶段,稳定性有待验证。数据整合时,67个仅含HTML的辖区因缺少引用元数据而未合并,造成覆盖缺口,嵌入向量文件的缺失则进一步限制了数据在语义搜索等下游任务的直接应用。
常用场景
经典使用场景
American Municipal Law数据集作为美国市镇法规的综合性研究快照,其核心场景聚焦于法律文本的检索与比对分析。该数据集收录了1283个司法管辖区的市政法规,涵盖HTML与引文两种格式,为法律信息学、计算社会科学以及公共政策研究提供了丰富的一手语料。研究者可借此探索地方立法的异同、法规演变的时空规律,以及市政法规与联邦或州法律之间的层级关系。其精细至GNIS代码的组织结构,便于跨区域、跨时间维度的系统化检索与实证分析,成为法律文本挖掘与信息检索领域不可或缺的基础资源。
解决学术问题
该数据集解决了法律研究领域中地方性法规数据分散、格式不一且难以获取的长期困境。传统上,市政法规散落于各地方政府官网,缺乏统一的结构化存储,极大地阻碍了大规模比较法学研究和法规量化分析。american_municipal_law将1283个辖区的法规统一整合为Parquet格式,并附带元数据与引文信息,使得研究者无需耗费大量精力进行繁琐的数据采集与清洗,即可集中精力于法规内容的深层分析。此举显著提升了研究效率,为探索地方治理模式、法律文本的跨辖区传播以及法规对社区发展的影响等议题奠定了坚实的数据基础,推动法学研究向数据驱动范式转型。
衍生相关工作
此数据集的出现已催生出一系列衍生研究与实践。在学术领域,基于此库的法律文本嵌入向量计算可能支持法规相似性分析,衍生出跨辖区法规聚类与主题建模等前沿工作,为自动识别立法趋势和制度趋同现象提供方法框架。金融科技领域,一些合规科技企业正利用该数据构建监管基线库,衍生出面向中小企业的法规风险扫描工具。非营利组织justiceDAO作为数据源头,其合并的752个辖区数据已推动社区驱动的法律数据共享模式复制,引出了更多关于市政数据开放生态的研究。此外,数据集的公开性鼓励了公民黑客与数据新闻团队参与,他们基于该数据构建的可视化界面或公民须知应用,正在重塑公众与地方法律的互动方式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务