遇见数据集

us-caselaw-fed-appellate

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

本数据集收录了美国联邦上诉法院(包括所有巡回区及历史案件)的判例法全文,共包含 1,510,937 份上诉意见文档。数据来源于 Free Law Project / CourtListener 于 2026-06-30 的大规模导出,覆盖 126 个法院 ID(显式允许列表,不采用前缀匹配)。数据集包括主要意见和单独意见,并排除少于 1 个字符的文档。在内容分布上,约 74.6% 的文档包含 2000 个以上字符(实质性意见),20.4% 包含 200-1999 个字符,另有 5.0% 少于 200 个字符(这些短文档是真实的程序性命令或一行判决,已刻意保留以保证公共记录的完整性)。数据集采用 docketx record v1 格式,每行一条意见记录,字段包括:唯一标识符(id)、文档类型(doc_type)、管辖权(jurisdiction)、标题(title)、正文(text)、来源(source)、许可证(license)、检索时间(retrieved_at)、引用(citation)、法院(court)、判决日期(date)以及额外信息(extra,包含 CourtListener 中的意见/集群 ID 和意见类型)。所有司法判决均为政府法令,属于公有领域无版权作品,本打包数据以 CC0 1.0 许可证发布。该数据集适用于文本检索、文本生成、法律自然语言处理(Legal NLP)、检索增强生成(RAG)以及法律研究等任务。用户可通过 Hugging Face Datasets 库加载:`load_dataset("docketx/us-caselaw-fed-appellate")`。

创建时间:
2026-09-09
搜集汇总
数据集介绍
us-caselaw-fed-appellate 数据集图片
构建方式
该数据集源自Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出记录,经系统化切片后形成。其构建过程严格遵循特定巡回法院标识符的白名单机制,明确列示126个法院ID,涵盖联邦上诉法院各巡回区及历史性法院,杜绝前缀匹配带来的误纳。原始文档经过筛选,仅保留主导意见与单独意见,并排除少于一字符的异常内容。切片文件附带SHA-256校验值,以确保数据完整性与可追溯性,最终封装为遵循docketx记录格式的JSONL压缩文件。
特点
本数据集以逾151万份美国上诉法院意见书全文为核心,体量庞大,覆盖126个法院,时间跨度兼具历史与当代。其显著特征在于刻意保留少量短文本记录,如程序性命令与单行判决,以维持公共记录的完整性,而非仅提供实质性意见。每条记录包含标识符、文档类型、司法辖区、标题、正文、来源、许可、检索时间及引证、法院、日期和扩展元数据等字段,结构统一,格式规范。司法意见作为政府法令,属公有领域作品,数据集以CC0 1.0协议发布,不添加任何注释,亦不主张任何权利。
使用方法
研究者可通过Hugging Face datasets库加载该数据集,使用标准接口便捷访问全部文档。由于数据集保留了不同长度的文本,用户可根据实际需求对文本长度进行过滤,例如筛选字符数超过2000的实质性意见,以聚焦深度法律分析。数据适用于文本检索、文本生成、法律自然语言处理及检索增强生成等任务,为法律研究、判例推理与司法文本建模提供基础语料。其统一的docketx格式便于与其他法律语料库集成,支持跨数据集的比较研究与模型训练。
背景与挑战
背景概述
美国联邦上诉法院判例数据集(us-caselaw-fed-appellate)由DocketRouter团队于2026年构建,旨在为法律信息检索与文本生成研究提供大规模、高质量的司法意见全文。该数据集源自Free Law Project的CourtListener公开数据,涵盖126个法院标识、约151万份上诉法院意见书,包括主要意见与单独意见,并遵循统一的docketx记录格式。其核心研究问题在于如何利用公开司法记录支持法律检索与生成任务,同时保持司法文本的完整性与可追溯性。该数据集对法律自然语言处理、判例检索及法律问答系统具有重要推动作用,为研究者提供了前所未有的覆盖范围与规模。
当前挑战
该数据集所面临的挑战涉及法律领域与构建过程两个层面。在法律领域,其旨在解决判例检索与理解中的信息过载与语义复杂性问题,需应对司法意见的冗长、术语专业及引用网络密集等特性。在构建过程中,主要挑战包括:从CourtListener海量导出数据中精确切片并确保法院标识的完整覆盖,避免因前缀匹配造成错误纳入;保留极短文本(如程序性命令)以维持公开记录的完整性,同时为使用者提供基于长度的过滤选项;以及维护数据格式的一致性并确保公共领域文本的准确再分发。这些挑战要求构建者在数据完整性与实用性之间取得平衡,并持续验证来源的可靠性。
常用场景
经典使用场景
在司法裁判文书智能检索与生成的研究中,该数据集常被用作构建上诉法院判例全文语料库的基础资源,支持基于稠密向量检索的增强生成系统以及长文本摘要、判决要旨抽取等任务。研究者可依托其超过百万份判例文档,训练面向法律领域的检索器与生成模型,并利用统一的数据格式进行跨巡回法院的对比实验,从而检验模型在真实司法语境下的鲁棒性。
实际应用
在法律实务与法律服务产品中,该数据集可支撑判例智能检索、类案推荐、裁判趋势分析与法律问答系统等应用。律师与法官助理可借助其全文内容快速定位相关先例,法律科技公司亦可基于其构建面向诉讼策略评估的检索增强生成工具。此外,其涵盖程序性裁定与简短判决记录,有助于贴近真实案件处理流程,提升检索结果在实务场景中的召回率与可用性。
衍生相关工作
围绕该数据集,已衍生出多项经典工作,包括面向法律文本的领域自适应预训练模型、长文档层次化检索架构以及判例引用解析与司法网络分析框架。相关研究常将其与联邦最高法院及州法院语料结合,形成多层级司法语料体系,进而催生跨法院知识迁移、法律论证挖掘与判决预测等方向的代表性成果,持续拓展法律人工智能的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务