遇见数据集

us-caselaw

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

US Caselaw数据集是一个包含美国全境所有已发表法院意见全文的大型法律文本数据集。数据来源于Free Law Project的CourtListener批量导出(2026年6月30日),涵盖所有50个州、哥伦比亚特区、联邦法院(最高法院、巡回法院、地区法院、破产法院、特别法院)、部落法院以及美国领土。数据集包含所有意见类型(多数意见、协同意见、异议意见、法庭意见、命令等),并采用统一的行格式。每条记录包含以下字段:唯一标识符(id)、文档类型(doc_type)、管辖区域(jurisdiction)、标题(title)、全文文本(text)、来源(source)、许可证(license)、检索时间(retrieved_at),以及引用信息(citation)、法院(court)、日期(date)和一个包含CourtListener意见/集群ID及意见类型的额外对象(extra)。数据规模在100万至1000万条记录之间。该数据集适用于法律文本检索(如判例法检索)、法律文本生成(如自动摘要、法律文书撰写)、法律自然语言处理研究、基于检索增强生成(RAG)的法律应用等场景。所有司法意见属于政府法令,为公共领域作品,数据打包采用CC0 1.0许可。

The US Caselaw dataset is a large-scale legal text dataset containing the full text of all published court opinions across the United States. The data originates from the Free Law Projects CourtListener bulk export (June 30, 2026), covering all 50 states, the District of Columbia, federal courts (Supreme Court, Circuit Courts, District Courts, Bankruptcy Courts, Special Courts), tribal courts, and U.S. territories. It includes all opinion types (majority opinions, concurrences, dissents, per curiam opinions, orders, etc.) in a unified line format. Each record contains the following fields: unique identifier (id), document type (doc_type), jurisdiction, title, full text (text), source, license, retrieved_at, as well as citation, court, date, and an extra object containing CourtListener opinion/cluster IDs and opinion type. The dataset size ranges from 1 million to 10 million records. It is suitable for legal text retrieval (e.g., case law retrieval), legal text generation (e.g., automatic summarization, legal document drafting), legal NLP research, and retrieval-augmented generation (RAG) applications in law. All judicial opinions are government edicts and are in the public domain, with the dataset packaged under the CC0 1.0 license.

创建时间:
2026-09-08
原始信息汇总

US Caselaw 数据集概述

基本信息

  • 数据集名称:US Caselaw
  • 数据集地址:https://huggingface.co/datasets/docketx/us-caselaw
  • 许可证:CC0 1.0
  • 语言:英语(en)
  • 数据规模:1M < n < 10M
  • 任务类别:文本检索(text-retrieval)、文本生成(text-generation)
  • 配置:默认配置(default),数据文件路径为 data/*/*.jsonl.gz

标签

  • legal
  • law
  • caselaw
  • us-law
  • court-opinions
  • public-domain
  • rag
  • legal-nlp
  • legal-research
  • federal
  • state-law

数据集简介

该数据集是美国判例法记录的合集,包含 Free Law Project / CourtListener 批量导出(2026-06-30)中所有已发布的判决意见,提供全文,涵盖所有意见类型(多数意见、协同意见、异议意见、per curiam、命令)。

所有司法管辖区采用统一的行格式。数据以原地方式构建,随着完整判例法管道重新发布而更新:先包含全部 50 个州 + 华盛顿特区,然后是联邦法院(最高法院、所有巡回法院、地区法院、破产法院、专门法院)、部落法院和美国属地。每个司法管辖区位于 data/<code>/ 目录下。此外还提供各司法管辖区的单独数据集 docketx/us-caselaw-<code>,供仅需单个州的用户使用。

加载方式

python from datasets import load_dataset ds = load_dataset("docketx/us-caselaw") # everything

or stream one jurisdictions file directly from data/<code>/

数据格式

每行数据为 docketx record v1 格式,包含以下字段:

  • id
  • doc_type
  • jurisdiction
  • title
  • text
  • source
  • license
  • retrieved_at
  • citation
  • court
  • date
  • extra(包含 CourtListener 的 opinion/cluster id 及意见类型)

来源与许可

司法判决为政府法令,属于公共领域(Banks v. Manchester, 128 U.S. 244 (1888);Georgia v. Public.Resource.Org, 590 U.S. 255 (2020))。数据打包采用 CC0 1.0 许可。

  • 来源:CourtListener 批量导出(2026-06-30),Free Law Project — https://free.law
  • 构建方:DocketX(https://docketx.ai)——同一语料库为 https://docketrouter.ai 的已验证法律 API 提供支持。
搜集汇总
数据集介绍
us-caselaw 数据集图片
构建方式
该数据集立足美国判例法公开记录,以Free Law Project旗下CourtListener于2026年6月30日发布的批量导出文件为唯一来源,经由自动化流水线完整提取已出版判决全文,涵盖多数意见、协同意见、异议意见、 per curiam 及各类命令,并将全部内容统一转换为docketx记录v1格式。各司法辖区以独立子目录data/<code>/组织,从全部50州及哥伦比亚特区起步,逐步纳入联邦法院、部落法院及美国属地法院,从而在保持原始文本完整性的同时实现跨辖区行结构一致。
特点
数据集以百万级至千万级规模集成了美国判例法体系,兼具文本检索与文本生成双重任务属性。每一条记录均包含id、doc_type、jurisdiction、title、text、source、license、retrieved_at等标准字段,并附citation、court、date及内含CourtListener意见与聚类标识和意见类型的extra对象。其突出之处在于覆盖范围广、意见类型全、司法辖区统一表示,且全部判决均为政府法令,依Banks诉Manchester与Georgia诉Public.Resource.Org等判例属于公有领域,打包采用CC0 1.0许可。
使用方法
使用者可借助Hugging Face datasets库以load_dataset("docketx/us-caselaw")一次性加载完整语料,亦可通过data/<code>/路径直接流式读取单一司法辖区的文件。对于仅需特定州数据的场景,可选用对应的docketx/us-caselaw-<code>子集数据集。加载后的每一行均遵循docketx记录v1规范,便于直接用于法律文本检索、判决生成、检索增强生成及法律自然语言处理等研究或应用任务。
背景与挑战
背景概述
美国判例法体系浩如烟海,其公开获取长期受限于碎片化的数据库与格式壁垒。2026年,DocketX团队依托Free Law Project的CourtListener批量导出数据,构建了us-caselaw数据集,旨在将全美各司法管辖区的已发布判决书全文统一为标准化记录。该数据集覆盖联邦各级法院、各州及特区、部落法院与属地法院,总计逾百万条判例,采用统一的docketx记录模式,并依据Banks诉曼彻斯特案与乔治亚州诉Public.Resource.Org案所确立的政府法令公有领域原则,以CC0 1.0许可开放。这一工作为法律信息学、判例检索与生成式法律AI提供了前所未有的完整语料基础,显著降低了法律文本挖掘的准入门槛。
当前挑战
构建us-caselaw数据集面临多重复杂挑战。在领域问题层面,判例文本的异质性极高,不同法院的判决书结构、引用格式、术语体系差异悬殊,且需完整保留多数意见、协同意见、异议意见及各类命令,这对统一表征与下游法律检索及生成任务构成严峻考验。在构建过程中,数据源自CourtListener批量导出,涵盖五十个州及联邦、部落、属地法院,各管辖区数据质量与元数据完备度参差不齐,需设计可扩展的管道以解析、规范化并整合异构记录,同时确保法律引证、法院标识与裁判日期的准确性。此外,判例的公有领域属性虽明确,但大规模聚合仍需审慎处理许可与溯源信息,以维护数据集的合法性与可复现性。
常用场景
经典使用场景
在计算法学与法律信息检索领域,美国判例法数据集长期被视为验证检索模型与文本生成系统的关键基准。us-caselaw汇聚了Free Law Project所导出的全部已公布判决书,涵盖联邦与州级司法辖区,并以统一的结构化字段组织全文。其最经典的使用场景在于为法律文本检索任务提供大规模、多管辖区的语料支撑,研究者可借此训练与评估基于密集向量或稀疏表示的检索模型,亦可将其作为检索增强生成系统的外部知识库,以提升法律问答与文书摘要的准确性与可溯源性。
实际应用
在法律实务与智能法律服务中,该数据集为判例检索、类案推送与法律问答系统提供了权威且可追溯的底层语料。律师与法官可借助基于该语料构建的检索工具快速定位相关先例,法律科技公司则可利用其训练面向合同审查、风险评估与合规监测的领域模型。由于判决书属于政府法令并处于公共领域,该数据集以CC0协议发布,显著降低了商业应用与学术研究的授权门槛,促进了法律人工智能产品的快速迭代与广泛部署。
衍生相关工作
围绕us-caselaw已衍生出一系列具有代表性的后续工作。研究者基于其构建了面向法律检索的基准评测集,用以比较不同嵌入模型在长文本与专业术语上的表现;亦有工作将其与引文网络结合,开展判决影响力与司法先例演化的量化研究。在生成式人工智能方向,该数据集常被用于微调与评估法律领域的检索增强生成系统,并催生了多个面向判例摘要、争议焦点抽取与法律论证生成的公开模型与工具链,持续拓展着法律自然语言处理的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务