us-caselaw-il
收藏官方服务:
资源简介:
该数据集包含249,250份伊利诺伊州上诉法院的司法意见全文,来源于Free Law Project / CourtListener于2026年6月30日的批量导出。覆盖两个法院(ill和illappct),包括主意见和单独意见,排除字符数小于1的文档。数据集中约80.2%的文档超过2000字符,8.1%在200-1999字符之间,11.7%少于200字符(这些短文档为真实的调卷令拒绝、单行命令和判决条目,未被过滤)。每条记录遵循docketx record v1格式,包含id、doc_type、jurisdiction、title、text、source、license、retrieved_at、citation、court、date和extra字段。司法意见属于政府法令,为公共领域作品,本数据集的打包版本采用CC0 1.0许可。数据集适用于文本检索、文本生成、法律NLP、法律研究、RAG等任务。加载方式:`load_dataset("docketx/us-caselaw-il")`。
创建时间:
2026-09-08
搜集汇总
数据集介绍

构建方式
该数据集源自Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出数据,通过显式白名单机制精确提取伊利诺伊州上诉法院(ill)与伊利诺伊州上诉法院分庭(illappct)的裁判文书,剔除字符数低于1的无效记录后,共获得249,250份上诉意见全文。数据以统一管道从公共记录中切片,并以docketx记录v1格式序列化,每行一份意见,附带唯一标识、文书类型、司法管辖区、标题、正文、来源、许可、检索时间及引证、法院、日期等结构化字段,确保完整覆盖公开司法记录。
使用方法
研究者和开发者可通过Hugging Face数据集库便捷加载,调用load_dataset("docketx/us-caselaw-il")即可获取完整数据。使用时可根据研究需求,利用text字段的字符长度进行过滤,例如仅保留len(text) >= 2000的实质性意见,或直接使用全量数据以保持公共记录的完整性。每行JSON对象包含id、doc_type、jurisdiction、title、text、source、license、retrieved_at等字段,用户可基于这些结构化信息进行检索增强生成、文本生成或法律检索任务,并应遵守CC0 1.0许可条款。
背景与挑战
背景概述
司法裁判文书作为法律体系运行的终局性文本载体,构成普通法推理与先例拘束原则的实证基础。伊利诺伊州上诉法院判例数据集(us-caselaw-il)由DocketRouter法律语料库项目构建,数据源自Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出文件,经切片处理后收录伊利诺伊州上诉法院及上诉法庭两个明确授权法院的249,250份裁判文书全文,涵盖主导意见与并存意见,并以docketx记录格式统一封装。该数据集以零标注、零权利主张的CC0许可方式重新分发公有领域司法文本,为法律信息检索、判例推理生成及检索增强生成系统提供了大规模、高保真的州级判例语料基础,对推动法律自然语言处理研究具有重要的数据基础设施意义。
当前挑战
法律裁判文书的领域特性为该数据集的应用带来多重挑战。在领域问题层面,判例文本的检索与生成需处理长篇幅法律论证、层级化引证结构以及先例效力判定等复杂语义任务,模型须在冗长且高度专业化的司法语言中精准识别关键判决要旨。构建过程中的挑战同样显著:原始数据须从CourtListener批量导出中精确切片,仅保留伊利诺伊州两个指定法院的记录并排除前缀匹配误差;文书长度分布高度不均,约11.7%的记录不足200字符,包含调卷令驳回与单行命令等非实质性文本,研究者须自行依据文本长度进行过滤以适配具体任务;此外,docketx格式中引证、法院、日期等元数据的完整性与一致性亦需在跨数据集复用时加以审慎校验。
常用场景
经典使用场景
在计算法学与法律信息检索领域,判例全文语料库素来是支撑实证研究与智能系统开发的基石。us-caselaw-il数据集汇集了伊利诺伊州上诉法院逾二十四万份裁判文书,其经典使用场景集中于法律文本检索与生成任务。研究者可借助该数据集训练和评估检索模型,以实现对判例要旨、裁判理由及法条引用的精准定位;亦可将其作为生成式模型的语料来源,用于裁判文书摘要、法律问答及论证结构生成等任务。数据集中所保留的短篇裁定与调卷令驳回记录,为研究司法程序的完整生态提供了不可多得的原始素材。
解决学术问题
长期以来,美国州级判例数据的碎片化与获取壁垒制约了法律实证研究的纵深发展。us-caselaw-il数据集的问世,有效回应了州上诉法院裁判文书大规模可计算分析的学术需求,解决了既往研究因样本偏狭而难以开展跨审级、长时段司法行为考察的困境。该数据集以完整的公开记录为底本,使研究者得以系统探究裁判说理风格演变、法官投票行为、先例援引网络等核心议题,为法律现实主义与计量法学研究注入了扎实的数据动能,其意义在于推动州法研究从个案叙事走向可复现的大规模实证范式。
实际应用
在实务层面,us-caselaw-il数据集为法律科技产品提供了坚实的底层语料支撑。律师事务所与法律信息服务商可依托其构建判例检索系统,辅助律师快速定位伊利诺伊州上诉法院的相关裁判;法律援助机构能够借此开发面向公众的法律问答工具,降低司法信息获取门槛。与此同时,该数据集亦可服务于司法行政管理,例如通过文本分析辅助案件分流、识别裁判文书中潜在的程式化表述,从而提升司法效率。其公共领域属性更使商业开发与公益应用均无版权之虞。
数据集最近研究
最新研究方向
随着法律人工智能向纵深演进,围绕美国州级判例法的检索增强生成与文本挖掘正成为学术前沿的热点议题。us-caselaw-il 数据集以二十万余份伊利诺伊州上诉法院判决全文为载体,保留了包括调卷令驳回与单行裁定在内的完整公共记录,为法律问答系统的真实性验证、判决要旨抽取与跨判例推理提供了贴近司法实践的语料基础。当前研究聚焦于将此类权威判例文本与稠密检索模型、长上下文语言模型相耦合,探索在引证溯源、裁判规则归纳及类案匹配等任务中的效能边界。该数据集所蕴含的公共领域属性与结构化元数据,亦为构建可复现、可审计的法律检索基准创造了条件,对提升司法信息获取的公平性与透明度具有实质意义。
以上内容由遇见数据集搜集并总结生成




