遇见数据集

us-caselaw-pa

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Pennsylvania Case Law 是一个包含347,902份宾夕法尼亚州上诉法院意见全文的数据集,来源于 Free Law Project 的 CourtListener 批量导出(截至2026年6月30日)。覆盖三个法院(pa、pacommwct、pasuperct),包括主意见和单独意见,排除字符数小于1的文档。数据格式采用 docketx record v1,每行一条意见记录,字段包括 id、doc_type、jurisdiction、title、text、source、license、retrieved_at、citation、court、date 和 extra(包含 CourtListener 意见/案件 ID 和意见类型)。数据集中,208,631(60.0%)个文档超过2000字符,63,389(18.2%)个在200-1999字符之间,75,882(21.8%)个小于200字符(如拒绝调卷令、单行命令和判决录入等真实记录,保留以保持完整公共记录)。该数据集基于公共领域的司法意见(无版权),以 CC0 1.0 许可发布,无任何人工标注。适用于文本检索、文本生成、法律 NLP、检索增强生成(RAG)以及法律研究等任务。

Pennsylvania Case Law is a dataset containing 347,902 full-text opinions from the Pennsylvania appellate courts, sourced from the Free Law Projects CourtListener bulk export (as of June 30, 2026). It covers three courts (pa, pacommwct, pasuperct), includes majority and separate opinions, and excludes documents with fewer than 1 character. The data format follows docketx record v1, with each row representing one opinion, including fields: id, doc_type, jurisdiction, title, text, source, license, retrieved_at, citation, court, date, and extra (containing CourtListener opinion/case IDs and opinion type). In the dataset, 208,631 (60.0%) documents exceed 2000 characters, 63,389 (18.2%) have 200-1999 characters, and 75,882 (21.8%) have fewer than 200 characters (such as denials of certiorari, per curiam orders, and judgment entries, which are real records retained to maintain a complete public record). The dataset is based on public domain judicial opinions (no copyright) and released under the CC0 1.0 license, with no human annotations. It is suitable for tasks such as text retrieval, text generation, legal NLP, retrieval-augmented generation (RAG), and legal research.

创建时间:
2026-09-06
搜集汇总
数据集介绍
us-caselaw-pa 数据集图片
构建方式
宾夕法尼亚州判例法数据集的构建根植于对公共司法记录的完整保存与开放获取理念。该数据集以Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出数据为源,通过精确的法庭标识白名单(pa、pacommwct、pasuperct)进行切片,确保仅涵盖宾夕法尼亚州上诉法院的裁判文书,且明确排除前缀匹配以避免范围溢出。纳入标准设定为文本长度不低于1个字符,从而保留包括调卷令驳回、单行命令及判决登记在内的全部公开记录,而非仅提取实质性意见。最终切片经SHA256哈希校验,共收录347,902份文书,体现了对公共领域法律文本的系统性整理与可复现性保障。
特点
该数据集在规模与结构上均展现出显著的法律语料特征。其涵盖超过三十四万份上诉法院意见,文本长度分布呈现明显分层:约六成文书超过2000字符,构成实质性裁判说理的主体;另有约两成不足200字符,为简式命令或程序性记录,虽篇幅短小却真实反映司法实践的全貌。数据格式遵循统一的docketx记录规范,每行对应一份意见,字段包括标识符、文书类型、管辖法院、标题、正文、来源、许可、检索时间以及引证信息与法院标识等,便于跨数据集整合。所有文本均属政府法令,依据Banks诉Manchester案及Georgia诉Public.Resource.Org案确立的原则,处于公共领域,采用CC0 1.0许可发布,不附加任何注释或权利主张。
使用方法
该数据集可通过Hugging Face数据集库便捷加载,仅需调用load_dataset函数并指定docketx/us-caselaw-pa标识符即可获取完整数据。研究人员可依据文本长度字段进行筛选,以聚焦于实质性裁判意见或保留全部记录用于检索与生成任务。其标准化的docketx记录结构支持与其它司法辖区数据集的无缝拼接,适用于法律文本检索、问答系统构建、裁判文书生成以及法律自然语言处理等多元场景。在使用过程中,应遵循公共领域材料的开放精神,尊重来源机构的整理工作,并在相关研究中准确引用数据切片版本及哈希值,以确保研究结果的可验证性与可重复性。
背景与挑战
背景概述
法律文本的可计算化研究长期受制于判例数据获取的高门槛与低质量。宾夕法尼亚州作为美国司法体系的重要辖区,其上诉法院判例的完整公开文本长期散落于各法院网站与商业数据库中,难以支撑大规模检索与生成任务。为此,研究者从Free Law Project旗下CourtListener于2026年6月30日发布的批量导出数据中,精确切分出宾夕法尼亚州三个法院(pa、pacommwct、pasuperct)的347,902份上诉裁决文书,构建了us-caselaw-pa数据集。该数据集以统一格式提供全文及元数据,涵盖主意见与单独意见,并明确排除长度不足1字符的文档,从而首次实现了该州判例公共记录的系统性、可复现性封装,为法律检索、判例推理及法律语言模型研究提供了关键基础设施。
当前挑战
该数据集所面对的领域核心问题在于:如何从大规模、格式异构且包含大量非实质内容的州级判例全文中,实现精准的法律信息检索与可靠的生成式推理。构建过程中的主要挑战则体现为三重张力:其一,源数据虽为公共记录,但法院文书结构松散、引证体系复杂,需在保留完整性与可读性之间取得平衡;其二,数据集中约21.8%的文档不足200字符,多为调卷令拒绝、单行命令等真实但简短的记录,若不加筛选会引入噪声,若过度过滤则丧失公共记录的完整性;其三,不同法院与意见类型的语义差异显著,需在元数据标注与文本切分中保持法律语境的一致性,以避免模型习得偏差。
常用场景
经典使用场景
在计算法学与法律信息检索领域,判例文本的规模化获取与结构化处理构成诸多研究的基础环节。us-caselaw-pa数据集汇聚了宾夕法尼亚州三大上诉法院逾三十四万份裁判文书全文,其最经典的使用场景在于为法律文本检索与生成任务提供语料支撑。研究者可借助该数据集训练和评估判例检索模型,实现基于语义相似度的先例匹配;亦可将其作为生成式模型的微调语料,用于裁判要旨摘要、法律论证生成等任务。数据集保留完整公开记录的做法,使得检索系统能够覆盖从实质意见到程序性裁定的全部文书类型,从而更贴近真实司法检索需求。
实际应用
在实务层面,us-caselaw-pa数据集为法律科技产品与司法信息服务提供了可直接调用的语料资源。律师事务所与法律检索平台可利用其构建判例推荐系统,辅助律师快速定位相关先例;法律援助机构可借助其训练问答模型,为公众提供初步法律信息。数据集遵循统一的docketx记录格式,便于与其它司法辖区语料整合,支撑跨州法律检索工具的研发。其CC0许可与公共领域属性,降低了商业与非商业应用的法律门槛,使开发者能够专注于模型与产品创新,而无需担忧版权风险。
衍生相关工作
作为DocketRouter法律语料库的组成部分,us-caselaw-pa数据集已催生一系列围绕州级判例检索与生成的研究工作。基于该数据集,研究者探索了密集检索模型在判例法场景下的适配与优化,并构建了面向法律领域的检索增强生成系统。部分工作进一步将其与联邦判例数据集进行联合训练,考察跨层级法律文本的迁移学习效果。此外,该数据集亦被用于法律文本的领域自适应预训练,以及判例引文解析与司法网络分析等任务,为法律人工智能社区贡献了可复用的数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务