us-caselaw-fl
收藏官方服务:
资源简介:
Florida Case Law(佛罗里达州判例法)数据集包含447,040份佛罗里达州上诉法院意见全文,数据来自Free Law Project / CourtListener的批量导出(2026-06-30)。该数据集覆盖8个明确指定的法院ID(包括fla、fladistctapp等),包含主要意见和单独意见,但排除了少于1个字符的文档。文档按字符长度分布:161,912份(36.2%)超过2000字符,161,987份(36.2%)在200-1999字符之间,123,141份(27.5%)少于200字符。短文档(如驳回调卷令、一行命令等)被完整保留,以确保公共记录的完整性。数据格式遵循docketx record v1标准,每行一个意见,包含id、doc_type、jurisdiction、title、text、source、license、retrieved_at、citation、court、date和extra字段。所有司法意见属于公共领域,本数据集以CC0 1.0许可发布,不添加任何标注或主张权利。该数据集适用于文本检索、文本生成、法律自然语言处理、法律研究以及基于检索增强生成(RAG)等任务。
创建时间:
2026-09-06
搜集汇总
数据集介绍

构建方式
该数据集以Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出数据为素材,借助明确的白名单机制精准锁定佛罗里达州八个上诉法院标识,包括fla、fladistctapp及其六个地区分庭,从而避免前缀匹配带来的无关数据混入。经过切片处理与sha256校验后,最终萃取出447,040份佛罗里达州上诉法院意见书全文,涵盖主意见与独立意见,并刻意保留文本长度不低于1个字符的全部记录,以维持公共档案的完整性与原始样貌。
特点
数据集由447,040份佛罗里达州上诉法院意见书构成,按照文本长度可划分为三个层次:161,912份文档超过2,000字符,161,987份介于200至1,999字符之间,另有123,141份不足200字符。短文本并非数据瑕疵,而是调卷令驳回、单行裁定与判决登记等真实司法记录的留存。每一条记录遵循docketx record v1格式,包含标识符、文书类型、管辖区、标题、正文、来源、许可、检索时间以及引证、法院、日期与扩展信息,格式统一且字段完备。
使用方法
研究者可通过HuggingFace的datasets库以单行代码加载该数据集,即调用load_dataset("docketx/us-caselaw-fl")即可获取全部内容。由于数据保留了完整的公共记录,使用时可依据实际需求对text字段的长度进行筛选,以获取仅含实质性意见书的子集。该数据集适用于文本检索、文本生成、法律信息检索增强生成以及法律自然语言处理等任务,亦可为法律实证研究与司法裁判分析提供基础语料。
背景与挑战
背景概述
司法裁判文书作为法律体系运行的原始记录,长期构成法律信息检索与计算语言学研究的基础语料。佛罗里达州判例法数据集(us-caselaw-fl)由DocketRouter团队于2026年基于Free Law Project下属CourtListener平台的批量导出数据构建,涵盖佛罗里达州八家上诉法院的44.7万余份裁判意见全文,时间切片由sha256校验值唯一锁定。该数据集旨在为法律文本检索、生成式法律推理及检索增强生成(RAG)系统提供大规模、完整且可溯源的全州判例资源,其无标注、纯公有领域的定位降低了法律自然语言处理研究的准入门槛,对推动州级判例语料的标准化整合具有参照意义。
当前挑战
法律裁判文书的领域特性为数据集的构建与应用带来多重挑战。裁判意见文本篇幅分布极不均衡,短至单行裁定、长至数万字的论证,语义密度差异显著,对检索与生成模型的长度鲁棒性构成考验。佛罗里达州法院层级与意见类型(主导意见、并存意见、异议意见)的细粒度区分,要求模型具备法律文书结构理解能力。数据集刻意保留低于两百字符的简短记录,如调卷令驳回与判决登记,虽保障了公共记录的完整性,但引入了大量低信息密度样本,检索与生成任务需依赖文本长度过滤策略以规避噪声干扰。此外,判例文本中频繁出现的引证网络与专业术语,对预训练语言模型的领域适应能力提出更高要求。
常用场景
经典使用场景
在计算法学与法律信息检索领域,佛罗里达州判例法数据集作为公共记录全文语料库的典型代表,其最经典的使用场景聚焦于大规模判例文本的检索与生成任务。研究者借助该数据集构建法律问答系统、判例摘要模型与裁判文书相似性检索框架,尤其面向佛州上诉法院体系内八类法院的裁判意见展开实验。由于数据完整保留短小程序性裁定,使用者得以在真实司法文本分布下评估模型的鲁棒性,并针对实质性意见与程序性记录分别设计实验方案。
衍生相关工作
该数据集作为DocketRouter法律语料库的组成部分,衍生出一系列围绕州级判例法的经典工作。研究者基于其开展跨州判例检索模型对比实验,推动法律预训练语言模型的领域适配;亦有工作利用其构建判例引用网络与裁判意见聚类分析框架,探索司法观点的演化路径。在检索增强生成方向,该数据集成为法律问答系统评测的重要基准之一,并与联邦判例数据集形成互补,支撑多层次法律语料体系的构建。
数据集最近研究
最新研究方向
在法律信息学与计算法学交叉领域,面向判例全文的检索增强生成与长文本理解正成为前沿方向。us-caselaw-fl 数据集以佛罗里达州上诉法院44.7万份公开裁判文书为语料,为法律问答、判例检索与判决预测等任务提供了大规模、高保真的基础资源。当前研究聚焦于利用该数据集构建领域专用的稠密检索模型与检索增强生成系统,以缓解通用大模型在州法适用中的事实性幻觉问题;同时,针对其中占比近三成的简短程序性裁定,研究者探索层次化过滤与多粒度表示学习,以提升对实质性意见与程序性记录的区分能力。该数据集对推动美国州级判例法的可解释人工智能研究、促进司法透明与法律平等获取具有重要影响,亦为跨州法律语料对比研究提供了可复用的数据切片范式。
以上内容由遇见数据集搜集并总结生成




