us-caselaw-co
收藏官方服务:
资源简介:
科罗拉多州判例法数据集(Colorado Case Law)包含来自 Free Law Project / CourtListener 批量导出(2026-06-30)的 62,317 份科罗拉多州上诉法院意见全文。数据覆盖两个法院:科罗拉多州最高法院(colo)和科罗拉多州上诉法院(coloctapp)。文档包括主要意见和单独意见,保留所有公开记录(即使极短),字符数分布为:88.2% 的文档超过 2,000 字符,10.6% 介于 200-1,999 字符,1.2% 少于 200 字符(如调卷令驳回、单行命令和判决条目)。数据格式采用 docketx record v1,每条记录包含以下字段:id(唯一标识符)、doc_type(文档类型)、jurisdiction(管辖权)、title(标题)、text(全文)、source(来源)、license(许可证)、retrieved_at(检索时间)、citation(引用)、court(法院)、date(日期)以及 extra(附加信息,包含 CourtListener 意见/案卷 ID 和意见类型)。该数据集适用于文本检索(text-retrieval)和文本生成(text-generation)任务,也可用于 RAG、法律 NLP 和法律研究。许可证为 CC0 1.0(公共领域),因法院意见属于政府法令,不受版权保护。
创建时间:
2026-09-06
搜集汇总
数据集介绍

构建方式
该数据集以Free Law Project旗下CourtListener于2026年6月30日发布的批量导出数据为源,采用显式允许列表精确限定科罗拉多州两个上诉法院标识符colo与coloctapp,确保不因前缀匹配引入无关记录。原始卷宗经解析后统一转换为docketx record v1格式,每行存储一份意见书,保留判决书、协同意见及异议意见,并将文本长度下限设为1字符,从而完整保留公共记录中的全部文书,最终以gzip压缩的jsonl文件分发,且提供切片哈希以校验数据完整性。
特点
数据集涵盖62,317份科罗拉多州上诉法院意见书,其中54,979份达到2,000字符以上,另有6,610份介于200至1,999字符之间,728份短于200字符,这些短文书多为调卷令驳回、单行命令或判决登记,属于真实司法记录而非数据错误。每行记录包含标识符、文书类型、司法辖区、标题、正文、来源、许可、检索时间以及引证、法院、日期和扩展字段,整体面向法律文本检索、生成与法律自然语言处理任务,具有公共领域属性,不附加任何标注或权利主张。
使用方法
研究人员可通过Hugging Face datasets库直接加载该数据集,调用load_dataset("docketx/us-caselaw-co")即可获取完整数据。若仅需实质性意见书,可依据text字段长度进行过滤;若开展检索增强生成、法律问答或文本生成实验,则可结合citation、court、date等元数据构建索引或划分训练与评估集合。使用时应遵循CC0 1.0许可,并注明数据来源于Free Law Project的CourtListener批量导出,以保持来源透明与可追溯。
背景与挑战
背景概述
在计算法学与法律信息检索领域,高质量、大规模且来源可靠的司法裁判文书语料始终是驱动研究与应用的基石。2026年,基于Free Law Project旗下CourtListener平台于同年6月30日发布的批量导出数据,研究人员构建了us-caselaw-co数据集,涵盖科罗拉多州上诉法院系统62,317份裁判意见全文,并明确限定colo与coloctapp两个法院标识,以规避前缀匹配带来的噪声。该数据集旨在为法律文本检索、生成与检索增强生成等任务提供完整的公共领域司法记录,其发布进一步丰富了DocketRouter系列法律语料库,为美国州级判例法的可计算研究奠定了重要基础。
当前挑战
本数据集所面对的核心领域问题在于:如何在保持判例法文本完整性与原始记录真实性的前提下,为法律检索与生成模型提供兼具规模与质量的语料,同时避免对短文本或程序性裁定的不当过滤而损失司法全貌。构建过程中的主要挑战包括:从海量CourtListener批量导出数据中精确切片出仅含科罗拉多州两个上诉法院的文档,杜绝因前缀匹配而混入无关法院记录;在保留大量不足200字符的认证驳回、单行命令与判决登记等真实短记录的同时,为使用者提供可依据文本长度进行后续筛选的透明机制;以及严格遵循司法意见属政府法令、归于公共领域的法律原则,在数据封装与再分发中不添加任何注释或权利主张,确保许可与来源的合规性。
常用场景
经典使用场景
在计算法学与法律信息检索领域,判例全文语料库长期扮演着基础设施的角色。us-caselaw-co汇集了科罗拉多州上诉法院自公共记录中析出的六万余份裁判文书,涵盖主意见与并存意见等完整文本形态,其经典使用场景在于支撑法律文本检索与生成任务。研究者可依托该数据集构建判例相似性检索系统,或训练面向法律领域的语言模型以生成裁判要旨摘要。凭借逐份文书的结构化元数据与长文本特征,该数据集亦常被用于评估检索增强生成方法在专业法律语境下的表现。
实际应用
在法律实务与智能法律服务中,该数据集可作为判例检索与法律咨询系统的底层语料。律师事务所与法律科技企业可借助其构建面向科罗拉多州管辖范围的判例推荐工具,辅助律师快速定位相关先例。法律援助机构亦可利用其开发面向公众的裁判文书检索接口,降低法律信息获取门槛。由于数据以docketx记录格式统一封装,工程团队能够便捷地将其集成至检索增强生成流水线,支撑法律文书起草与合规审查等实际业务。
衍生相关工作
作为DocketRouter法律语料体系的组成部分,us-caselaw-co与Free Law Project及CourtListener的公开数据生态紧密关联,衍生出跨州判例检索、法律嵌入模型训练与裁判文书摘要生成等方向的研究工作。围绕该数据集,已有研究探索基于判例全文的稠密检索与重排序策略,以及面向长文本的法律语言模型微调方法。其统一的记录格式亦促进了多辖区法律语料的横向比较研究,为构建通用法律检索基准提供了可扩展的数据范式。
以上内容由遇见数据集搜集并总结生成




