遇见数据集

us-court-opinions-dockets-judges-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

US Court Opinions Metadata, Dockets & Judges (CourtListener) 数据集源自 CourtListener / Free Law Project 的官方批量数据,提供了美国法院意见的元数据、案卷信息和法官信息。该数据集包含约1000万条意见集群、7000万条案卷记录和1.6万名法官的数据,以及派生信号(如引用图、公司诉讼档案),但不包含意见全文。数据按规模分为三个层级:S层(入门级,约230万行)、M层(研究级,约740万行)和L层(完整元数据库,约4650万行),每个层级包含多个表格(如cases、citations、courts、judges、opinions等)。该数据集适用于诉讼风险分析、法律分析研究、司法行为研究、公司诉讼暴露分析、引用网络分析等任务。数据采用CC BY-NC 4.0许可,仅供学术和个人使用,商业使用需获取DataForge商业许可。

The US Court Opinions Metadata, Dockets & Judges (CourtListener) dataset is derived from the official bulk data of CourtListener / Free Law Project, providing metadata, docket information, and judge information for U.S. court opinions. The dataset contains approximately 10 million opinion clusters, 70 million docket records, and 16,000 judges, along with derived signals (such as citation graphs and corporate litigation profiles), but does not include full opinion texts. The data is divided into three tiers based on size: S tier (entry-level, ~2.3 million rows), M tier (research-level, ~7.4 million rows), and L tier (full metadata database, ~46.5 million rows), each containing multiple tables (e.g., cases, citations, courts, judges, opinions). This dataset is suitable for tasks such as litigation risk analysis, legal research, judicial behavior analysis, corporate litigation exposure analysis, and citation network analysis. The data is licensed under CC BY-NC 4.0, for academic and personal use only; commercial use requires a DataForge commercial license.

创建时间:
2026-08-08
原始信息汇总

US Court Opinions Metadata, Dockets & Judges (CourtListener)

数据集概述

该数据集基于 CourtListener / Free Law Project 的官方批量数据构建,包含 1000万意见集群、7000万案卷和1.6万名法官的元数据及衍生信号表(如引用图、公司诉讼概况),不含意见全文。数据集由 DataForge 开放数据计划提供,适用于学术和个人免费使用。

数据规模与分档

分档 行数 压缩后大小
S(入门切片) 2,286,889 73.9 MB
M(研究包) 7,395,271 374.7 MB
L(完整元数据库) 46,485,000 2.30 GB
  • S档:案件和法院的基础数据
  • M档:包含法官及衍生信号的研究级数据
  • L档:完整元数据,含引用图边和诉讼概况

数据内容

所有文件以 snappy parquet 格式存储,按分档(S/M/L)和表类型组织,共 23个配置,包括:

  • 案件表(cases):各档均包含
  • 引用表(citations):引用图边数据
  • 法院表(courts):法院信息
  • 法官表(judges/judge_positions):法官及其职位信息
  • 意见表(opinions):意见元数据
  • 法院年度统计(court_year_stats):M/L档包含
  • 公司诉讼概况(company_litigation_profiles/yearly):L档包含
  • 法院建筑(courthouses):L档包含
  • 口头辩论(oral_arguments):L档包含

应用场景

  • 诉讼风险与法律分析研究
  • 司法行为研究
  • 公司诉讼风险画像(仅限组织当事方)
  • 引用网络分析

许可协议

双重许可

  • 学术/个人使用:CC BY-NC 4.0,需注明来源并回链至 data.zalize.com
  • 商业使用:需获取 DataForge 商业许可证
  • 上游数据来自 CourtListener / Free Law Project(Public Domain Mark 1.0),不含意见全文

文件格式与访问

  • 支持通过 load_dataset 加载,如:load_dataset("zalizedata/us-court-opinions-dockets-judges-dataset", "S-cases", split="train")
  • 原始压缩包(含 CSV、数据字典、数据表、许可证)可从 DataForge CDN 免费下载:
    • S档:https://dl.zalize.com/open-data/courtlistener-tier1-S-2026-08-04
    • M档:https://dl.zalize.com/open-data/courtlistener-tier1-M-2026-08-04
    • L档:https://dl.zalize.com/open-data/courtlistener-tier1-L-2026-08-04

附加信息

  • 来源与方法:CourtListener / Free Law Project 官方批量数据(元数据+衍生信号)
  • 语言:英语
  • 任务类型:文本分类
  • 数据规模:10M < n < 100M
  • DOI:10.5281/zenodo.21838140
  • GitHub 镜像:https://github.com/wookat/dataforge-pipelines/releases/tag/open-data-us-court-records
  • 数据集主页:https://data.zalize.com/datasets/us-court-opinions-dockets-judges-dataset
  • 相关数据集:Clinical Trials & Drug Approvals、Global Research Output & Mobility,完整目录共25个数据集,见 https://data.zalize.com/open-data
搜集汇总
数据集介绍
us-court-opinions-dockets-judges-dataset 数据集图片
构建方式
该数据集源自美国法院判决意见、案件卷宗及法官信息的权威数据源CourtListener/Free Law Project,通过系统化整合与精炼加工,构建了涵盖案件、引证、法院、法官及意见等多个维度的元数据体系。数据集按数据规模分为S、M、L三个层级,每一层级均以Parquet格式存储,便于高效访问。其构建过程不仅保留了原始数据的完整性,还额外生成了引证图谱、公司诉讼概况等衍生信号表,为法律分析提供了丰富的数据基础。
特点
该数据集的核心特色在于其全面性与深度,囊括了约1000万条意见集群、7000万条卷宗记录及1.6万名法官的详细信息。特别值得一提的是,数据集中融入了引证网络分析所需的引证关系数据,以及针对公司主体的诉讼暴露度分析资料,极大增强了其在法律实证研究中的适用性。此外,多层级的配置设计赋予了使用者根据研究需求灵活选择数据粒度的能力,无论是初步探索还是深入挖掘,均能找到适宜的数据视图。
使用方法
使用该数据集极为便捷,可通过HuggingFace的datasets库直接加载所需配置,例如执行load_dataset("zalizedata/us-court-opinions-dockets-judges-dataset", "S-cases", split="train")即可获取S层级案件数据。数据集支持多种法律研究场景,包括诉讼风险分析、司法行为研究、公司诉讼暴露评估及引证网络分析等。用户可根据具体研究目标,选用不同层级的配置,如M或L层级涵盖更丰富的法官与引证信息,满足从宏观统计到微观案例剖析的多维度需求。
背景与挑战
背景概述
该数据集由DataForge开放数据项目于2026年构建并发布,旨在利用CourtListener和Free Law Project的官方批量数据,为法律分析研究提供高质量的元数据资源。其核心研究问题是构建一个覆盖美国法院案件、法官、诉讼记录及引文网络的大型结构化数据库,以支持诉讼风险分析、司法行为研究和公司诉讼暴露评估等领域。数据集包含超过1000万意见簇、7000万诉讼记录及16000名法官的元数据,并按规模分为S、M、L三个层级,便于不同研究需求的使用。其发布填补了法律数据科学领域缺乏全面、结构化元数据集的空白,为法律学者和数据科学家提供了宝贵的资源,推动了计算法学和司法实证研究的发展。
当前挑战
该数据集所解决的领域问题涵盖了法律数据获取的高门槛与碎片化挑战,通过整合法院意见、诉讼记录和法官信息,为法律分析提供了统一的数据基础。在构建过程中,面临的主要挑战包括:处理来自不同来源的异构数据,确保数据的一致性和准确性;设计高效的层级划分(S、M、L)以适应不同规模的研究需求;构建引文图与公司诉讼概况,涉及复杂的实体识别和关系抽取。此外,数据集仅包含元数据而不含全文,这要求在使用时需与其他全文资源配合,同时需遵循CC BY-NC 4.0许可,限制商业用途,保障数据合规性。
常用场景
经典使用场景
该数据集汇聚了美国法院超过千万级的意见书元数据、七千万条卷宗记录以及一万六千余名法官的详尽资料,源自CourtListener与Free Law Project的官方批量数据,经精心整合与派生信号增强,形成了层次分明、规模宏大的法律数据资源。其经典使用场景聚焦于法律与社会科学交叉领域,如利用海量判例元数据进行司法行为分析,探究法官判决倾向、审判时效及法院层级间的差异;亦可用于构建复杂的引文网络,揭示判例之间的承继与互动脉络,为法理学研究提供量化支撑。
解决学术问题
此数据集系统性地解决了法律实证研究中长期存在的数据碎片化与获取门槛高的问题,为学者提供了一站式、结构化的司法记录来源。它使得研究者能够从宏观层面追踪诉讼趋势、评估法院运行效率,并深入剖析法官个人特质与判决结果之间的关联,从而推动司法决策理论的验证与革新。此外,其丰富的公司诉讼档案数据,为评估企业法律风险敞口、研究商业纠纷模式提供了前所未有的便利,极大地拓宽了法律社会学与法经济学的实证研究视野。
衍生相关工作
围绕此数据集,已衍生出多项具有影响力的学术与工程工作。在学术前沿,研究者利用其引文图谱构建了判例影响力预测模型,并基于法官信息开发了司法行为动力学仿真系统。在工程实践领域,基于此数据训练的算法已应用于诉讼结果预判、法律文档智能检索等场景,催生了如法律知识图谱、法院判决趋势可视化平台等一系列创新应用,进一步拓展了原始数据的价值边界,形成了从数据到知识再到应用的完整闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务