遇见数据集

us-caselaw-in

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Indiana Case Law 是一个由 DocketRouter 项目发布的数据集,包含印第安纳州上诉法院(包括印第安纳州最高法院和印第安纳州上诉法院)的 136,110 份公开判决意见全文。这些数据来自 Free Law Project / CourtListener 于 2026-06-30 的批量导出,经过切片处理,并提供了 sha256 校验和以确保完整性。数据集保留了所有真实记录,包括调卷令拒绝、一行命令和判决条目等短文本,以呈现完整的公共记录。文档长度分布如下:78.7% 的文档超过 2,000 字符,14.1% 介于 200-1,999 字符,7.2% 少于 200 字符。数据格式遵循 docketx record v1 规范,每条记录包含 14 个字段:id(唯一标识)、doc_type(文档类型)、jurisdiction(管辖权)、title(标题)、text(全文文本)、source(来源)、license(许可)、retrieved_at(检索时间)、citation(引用)、court(法院)、date(日期)、extra(额外信息,包括 CourtListener 意见/集群 ID 和意见类型)。该数据集可用于文本检索(如法律案例检索)和文本生成(如根据事实生成法律意见摘要)等任务,适合法律自然语言处理和法律研究。数据以 JSONL.GZ 格式存储,可通过 Hugging Face Datasets 库直接加载,许可为 CC0 1.0,属于公共领域,无任何注释或附加权利主张。

Indiana Case Law is a dataset released by the DocketRouter project, containing 136,110 full-text public opinion documents from the Indiana appellate courts (including the Indiana Supreme Court and the Indiana Court of Appeals). The data originates from a bulk export of Free Law Project / CourtListener on June 30, 2026, which has been sliced and provided with SHA256 checksums to ensure integrity. The dataset retains all authentic records, including short texts such as certiorari denials, one-line orders, and judgment entries, to present a complete public record. The document length distribution is as follows: 78.7% of documents exceed 2,000 characters, 14.1% are between 200-1,999 characters, and 7.2% are less than 200 characters. The data format follows the docketx record v1 specification, with each record containing 14 fields: id (unique identifier), doc_type (document type), jurisdiction, title, text (full text), source, license, retrieved_at (retrieval time), citation, court, date, extra (additional information including CourtListener opinion/cluster IDs and opinion type). This dataset can be used for text retrieval (e.g., legal case retrieval) and text generation (e.g., generating legal opinion summaries based on facts), suitable for legal natural language processing and legal research. The data is stored in JSONL.GZ format and can be directly loaded via the Hugging Face Datasets library. The license is CC0 1.0, belonging to the public domain, without any annotations or additional rights claims.

创建时间:
2026-09-08
原始信息汇总

Indiana Case Law 数据集

基本信息

  • 数据集地址:https://huggingface.co/datasets/docketx/us-caselaw-in
  • 名称:Indiana Case Law(印第安纳州判例法)
  • 许可证:CC0 1.0
  • 语言:英语(en)
  • 任务类别:文本检索(text-retrieval)、文本生成(text-generation)
  • 数据规模:100K < n < 1M

数据内容

  • 收录 136,110 份印第安纳州上诉法院判决书全文,来源于公开记录。
  • 数据切片自 Free Law Project / CourtListener 于 2026-06-30 的批量导出。
  • 涵盖法院(2 个法院 ID,采用显式白名单,绝不用前缀匹配):indindctapp
  • 包含主判决意见和单独意见;排除少于 1 个字符的文档。
  • 切片 sha256:55d142640871536a7a4ee6e87aaf7e9ef187736ba3e8473165e135c7204aceb8(同时存在于 slice.manifest.json 中)。

数据构成

基于该切片的实测结果:

  • 107,058 份文档(78.7%)文本长度在 2,000 字符以上。
  • 19,247 份文档(14.1%)文本长度在 200–1,999 字符之间。
  • 9,805 份文档(7.2%)文本长度少于 200 字符。
  • 短文档为真实记录(如调卷令驳回、单行命令、判决记录),并非错误,被有意保留(min_chars = 1),以保证收录完整的公开记录而非过滤后的子集。
  • 若只需实质性判决意见,可按 len(text) 进行过滤。

数据格式

  • 每行一条意见,遵循 docketx record v1 格式。
  • 字段包含:iddoc_typejurisdictiontitletextsourcelicenseretrieved_at,以及 citationcourtdateextra(CourtListener opinion/cluster id、意见类型)。
  • 所有 docketx 数据集均使用统一格式。

来源与许可

  • 司法判决属于政府法令,为不受版权保护的公有领域作品(Banks v. Manchester, 128 U.S. 244 (1888);Georgia v. Public.Resource.Org, 590 U.S. 255 (2020))。
  • 本数据打包以 CC0 1.0 发布。
  • 来源:CourtListener 批量导出(2026-06-30),Free Law Project — https://free.law。
  • 本数据集重新分发公有领域的法院文本,未添加任何标注,也不主张任何权利。

加载方式

python from datasets import load_dataset ds = load_dataset("docketx/us-caselaw-in")

所属系列

属于 DocketRouter 法律语料库:https://huggingface.co/docketx

标签

legal、law、caselaw、indiana、us-law、state-law、court-opinions、public-domain、rag、retrieval、legal-nlp、legal-research

搜集汇总
数据集介绍
us-caselaw-in 数据集图片
构建方式
在普通法体系下,司法意见作为具有法律约束力的权威文本,其系统化整理对于法律检索与实证研究具有基础性意义。该数据集取自Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出档案,经由切片处理,精确提取印第安纳州上诉法院与印第安纳州税务上诉法院两级法院的裁判文书。构建过程采用显式白名单机制锁定法院标识,规避前缀匹配可能引入的无关记录,并以最小字符数为1的阈值保留全部公开文书,最终形成涵盖136110份裁判意见的完整语料。每份文书以统一行式记录结构存储,附有哈希校验值以确保数据完整性。
特点
该数据集以未经过滤的完整公共记录为显著特征,囊括了从篇幅充实的实质性意见到简短的调卷令驳回、单行裁定及判决登记等各类文书形态。经精确统计,近八成文书正文超过2000字符,约一成四处于200至1999字符区间,余下部分则不足200字符,此种分布真实反映了司法文书长短不一的自然样态。数据集采用docketx record v1统一格式,字段涵盖文书类型、管辖区、标题、正文、引证信息、法院层级与日期等维度,且司法意见作为政府法令在版权法上属于公有领域,整个数据包以CC0 1.0协议发布,不附加任何注释或权利主张。
使用方法
研究者可通过Hugging Face datasets库以单行指令加载该数据集,获取完整的印第安纳州上诉裁判文书语料。鉴于数据集刻意保留了全部原始记录,使用者可依据文本长度字段进行自主筛选,以获取符合特定研究需求的实质性意见。该数据集适用于法律文本检索、裁判文书生成、检索增强生成系统构建以及法律自然语言处理等多个方向,亦可用于法律实证研究与司法裁判规律的量化分析。统一的数据格式使其能够与DocketRouter法律语料库中的其他数据集实现无缝整合,为跨州或跨层级的比较研究提供便利。
背景与挑战
背景概述
司法裁判文书的公开与再利用是法律信息学与计算法学研究的基石。印第安纳州判例法数据集(us-caselaw-in)由DocketRouter团队构建,于2026年从Free Law Project的CourtListener批量导出中切取,涵盖印第安纳州最高法院与上诉法院的136,110份上诉意见书全文。该数据集旨在为法律检索、文本生成及检索增强生成等任务提供权威、完整的州级判例语料,其基于docketx记录格式的标准化封装和公有领域授权,为法律自然语言处理研究提供了可复现的数据基础,对推动判例法智能分析具有重要价值。
当前挑战
该数据集所应对的领域问题在于,法律判例文本具有高度专业性、结构松散且长度分布极端不均,现有通用检索与生成模型难以精准捕捉裁判要旨与法理逻辑。构建过程中亦面临多重挑战:需从海量公开记录中精确切分特定法院的文档,避免前缀匹配导致的误纳;须保留篇幅极短但具法律效力的命令与判决记录,以维持公共记录的完整性,同时不引入噪声;还需确保数据来源的合法性、格式的统一性以及去标识化处理的严谨性,从而在开放共享与法律伦理之间取得平衡。
常用场景
经典使用场景
在计算法学与法律信息检索领域,印第安纳州判例法数据集主要服务于法律文本检索与判例生成任务。研究者通常将其作为语料库,构建面向州级上诉法院裁判文书的检索增强生成系统,借助稠密向量索引对十万余份意见书进行语义匹配,从而在问答场景中精准定位相关判例。同时,该数据集亦被用于训练和评测法律文本摘要、引文识别与判决预测模型,其完整的案卷记录与元数据字段为多任务学习提供了统一的结构化支撑。
解决学术问题
该数据集有效缓解了州级司法裁判文书在公开获取与规范整理方面的长期困境。既往研究多依赖联邦层级或少数几个州的判例,导致跨州法律推理与下级法院行为分析缺乏足够样本。印第安纳州判例法数据集以无过滤的完整公开记录为特色,涵盖简短命令与完整意见书,使学者得以探究上诉法院裁判的全貌分布,检验法律现实主义关于裁判一致性的假说,并为法律语言模型的领域适应提供可复现的基准。
衍生相关工作
围绕该数据集已衍生出多项经典工作。基于docketx记录格式,研究者将其与其它州判例语料联合,训练跨辖区的法律检索模型与判例引文网络。部分工作以此为基础构建法律问答基准,评估大语言模型在州法场景下的推理能力;另有研究利用其元数据开展裁判时间线与法院行为分析,形成对印第安纳州上诉司法实践的量化刻画,推动了法律自然语言处理向州级司法体系的纵深发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务