LocalLaws/LOCUS-v1
收藏官方服务:
资源简介:
LOCUS v1.0 是一个美国市政和县法律文本的块级数据集,按法律功能进行标注。每个符合条件的文本块都被分配了一个`function`(功能)、一个二进制`is_substantive`(是否实质性)标签,并且所有实质性条款都被分配了一个`topic`(主题)。该数据集旨在用于法律文本研究、地方法律结构分析、实质性过滤以及下游分类法细化。
LOCUS v1.0 is a chunk-level dataset of U.S. municipal and county law text labeled by legal function. Each eligible chunk is assigned a `function`, a binary `is_substantive` label, and all substantive provisions are assigned a `topic`. The dataset is intended for legal text research, local-law structure analysis, substantive filtering, and downstream taxonomy refinement.
提供机构:
LocalLaws搜集汇总
数据集介绍

构建方式
LOCUS-v1是一个面向美国市县级地方法律文本的语料库,其构建源于对地方政府条例结构化分析的迫切需求。该数据集以文本块为基本分析单元,从公开颁布的地方法规中提取内容,并通过自动化分类器为每个块赋予法律功能标签,如Context、Rules、Process和Enforcement。在此基础上,依据预设规则将Rules和Enforcement类别标记为实质性条款,对应赋予Buildings、Business、Nuisance、Zoning和Other等主题标签。数据集涵盖了超过221万个条例样本,样本来源于不同州和县市的官方法律文档,保证了地理和法律体制的多样性。
特点
该数据集的核心特点在于其多维度标注体系与精细化的语义分层。每个文本块不仅被标注了法律功能(function)和实质性指示符(is_substantive),还进一步在实质性条款上附加了主题分类(topic),形成了从程序性到实质性的渐进式标签结构。此外,数据集包含丰富的元数据字段,如管辖类型、州、市、县信息以及执行裁量权、透明度、家长主义等数值化特征,为法律文本的深层量化分析提供了可能。其规模达220万条,覆盖范围广,但需注意标注由模型自动生成,未经全面人工验证,存在标签噪声。
使用方法
用户可通过HuggingFace Datasets库轻松加载LOCUS-v1数据集,使用默认配置读取训练分割的parquet文件。数据集的典型应用包括法律文本分类研究、地方法规结构分析、实质性条款过滤以及法律本体论的迭代优化。在实践流程中,推荐将function和topic标签作为监督学习的目标变量,利用content字段进行文本建模;同时可利用is_substantive标签构建二分类筛选管道,辅助下游法律NLP任务。需要注意的是,该数据集不适用于法律咨询或替代人工审查,在关键应用中应配合人工验证确保可靠性。
背景与挑战
背景概述
LOCUS-v1数据集由Denis Peskoff、Joe Barrow、Christopher Vu和Diag Davenport于2026年提出,旨在填补美国地方行政法(市政法规与县级法令)在自然语言处理领域的数据空白。长期以来,法律NLP研究多聚焦于联邦或州级判例法,忽视了对基层治理至关重要的地方条例。该数据集从美国各市政与县级政府公开的法规文本中抽取了超过221万条例块,针对其法律功能(如规则、程序、执行等)与主题(如建筑、商业、妨害等)进行了系统标注,为分析地方立法结构、开展法规语义分类及构建自动化法律审查流水线奠定了大规模、结构化基础。其发布显著降低了实证研究地方政府法的门槛,促进了跨辖区法规构成的比较分析与可复现研究。
当前挑战
LOCUS-v1所应对的核心领域挑战在于地方条例的异构性与半结构化特征:不同辖区的编码方式、术语体系及条款粒度差异悬殊,使得传统法律文本分类方法难以泛化。数据集构建本身面临多重困难:首先,需从海量非统一格式的公开法规中提取连贯语块并确定语义边界;其次,功能与主题标签由自动化模型生成,未经完整人工校验,在分类边界(如“规则”与“程序”的模糊地带)存在噪声;此外,地理与人口偏倚显著,大城市及商业编纂商服务的辖区被过度代表,而小型农村地区覆盖不足。数据快照性质亦无法反映法律的动态演变,使用时需警惕对自动化标签的过度依赖及由此引发的法律误判风险。
常用场景
经典使用场景
LOCUS-v1数据集的核心应用在于对美國市县级地方法律文本进行功能分类与实质性过滤。研究者可依据其标注的‘功能’标签(如规则、程序、执行、背景)与‘主题’标签(如建筑、商业、妨害、分区),对多达221万条法令片段进行结构化分析。该数据集特别适合构建法律文本分类模型,用于区分实质性法律条款与非实质性程序性内容,从而为下游法律自然语言处理任务提供高质量的筛选基础。
实际应用
在现实场景中,LOCUS-v1可赋能一系列法治智能化工具。例如,新闻工作者与公民监督组织可利用该数据集训练的模型,快速从冗长的市政法规中定位实质性管制条款(如噪音限制、建筑许可要求),从而提升政策透明度。地方政府也可借助基于LOCUS-v1的文本分析系统,自动评估其法典在不同主题领域的覆盖广度与颗粒度,辅助立法决策。该数据集还支持低成本的人机协同标注流程,供法律科技公司开发合同审查或合规检查的原型系统。
衍生相关工作
围绕LOCUS-v1已涌现多项前沿工作。Peskoff等人(2026)在原始论文中基于该数据集训练了弱监督分类器,证明了从有限种子词构建大规模法律标签的可行性。后续研究可能延伸出面向特定州法的精细主题分类器,或者将LOCUS-v1的标注框架迁移至联邦法规层级,构建跨层级法律语义对齐模型。此外,部分团队已利用其‘透明度’与‘恩威并施’等连续评分字段,探索算法偏见检测与地方立法风格量化等新兴交叉领域。
以上内容由遇见数据集搜集并总结生成



