遇见数据集

us-caselaw-ut

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集包含来自美国犹他州上诉法院的34,886份意见全文,来源于Free Law Project / CourtListener 2026-06-30的批量导出。覆盖两个法院ID(utah和utahctapp),包括主要意见和单独意见,排除长度小于1个字符的文档。数据集保留了完整的公共记录,包括调卷令拒绝、一行命令和判决登记等短文档(约4.2%少于200字符,87.9%超过2000字符)。每行数据遵循docketx record v1格式,包含id、doc_type、jurisdiction、title、text、source、license、retrieved_at、citation、court、date和extra等字段。数据集采用CC0 1.0许可,属于公共领域,未添加任何注释。适用于法律文本检索、文本生成、检索增强生成(RAG)、法律自然语言处理和法律研究等任务。

This dataset contains 34,886 full opinions from the Utah appellate courts of the United States, sourced from a bulk export of Free Law Project / CourtListener on 2026-06-30. It covers two court IDs (utah and utahctapp), including majority and separate opinions, excluding documents with fewer than 1 character. The dataset retains complete public records, including short documents such as certiorari denials, one-line orders, and judgment entries (approximately 4.2% fewer than 200 characters, 87.9% more than 2000 characters). Each row of data follows the docketx record v1 format, including fields such as id, doc_type, jurisdiction, title, text, source, license, retrieved_at, citation, court, date, and extra. The dataset is licensed under CC0 1.0, is in the public domain, and has no added annotations. It is suitable for tasks such as legal text retrieval, text generation, retrieval-augmented generation (RAG), legal natural language processing, and legal research.

创建时间:
2026-09-06
搜集汇总
数据集介绍
us-caselaw-ut 数据集图片
构建方式
该数据集源自Free Law Project旗下CourtListener平台于2026年6月30日发布的全量批量导出文件,通过精确的法院标识符白名单策略,仅保留犹他州最高法院与犹他州上诉法院的裁判文书,排除前缀匹配导致的无关记录。采用docketx record v1统一格式进行结构化封装,每行对应一份意见书,涵盖主意见与单独意见,并设定最小字符数为1以维持公共记录的完整性。切片过程经由SHA256校验确保数据可复现,最终形成包含34,886份文档的公开法律语料库。
特点
数据集收录了犹他州两级上诉法院的裁判全文,总计34,886份文档,其中约87.9%的文书篇幅超过2,000字符,构成实质性意见的主体,另有少量简短的调卷令驳回、单行命令与判决登记等真实记录被刻意保留。每份文档均包含案卷标识、法院、裁判日期、引证信息与来源许可等元数据,且所有文本均属公共领域,不存在版权限制。该数据集不附加任何人工标注,亦不主张衍生权利,适用于法律文本检索、生成与检索增强生成等任务。
使用方法
研究者可通过Hugging Face datasets库以一行代码加载该数据集,即load_dataset("docketx/us-caselaw-ut"),获得结构化的裁判文书集合。若需聚焦于实质性意见,可依据text字段长度进行过滤,例如筛选字符数大于等于2,000的记录;若需完整公共记录,则可直接使用全量数据。该数据集隶属于DocketRouter法律语料体系,可与同一格式的其他州法数据集联合使用,支撑跨域法律检索、判例生成及法律问答系统的构建与评估。
背景与挑战
背景概述
犹他州判例法数据集诞生于法律信息学与自然语言处理交叉研究的迫切需求之中。自2026年6月30日从Free Law Project的CourtListener批量导出中切分构建以来,该数据集由DocketRouter团队整理发布,收录了犹他州最高法院与上诉法院的34,886份上诉意见书全文。其核心研究问题在于为法律文本检索与生成任务提供完整、无偏的公共领域判例语料,弥补州级判例数据在开放法律资源中的稀缺。作为法律检索增强生成与判例分析的基础资源,该数据集推动了州法研究、司法预测与法律问答系统的发展,对促进司法透明与法律人工智能的可复现性具有显著影响力。
当前挑战
该数据集所面对的核心挑战在于法律文本检索与生成任务本身的复杂性,即如何在冗长、高度专业化且结构异质的判例文书中实现精准的语义匹配与连贯的文本生成。构建过程中的挑战同样突出:原始记录包含大量短文本条目,如调卷令驳回、单行命令与判决登记,约4.2%的文书不足200字符,需在保持完整公共记录与过滤实质性意见之间取得平衡;同时,法院标识必须采用精确白名单而非前缀匹配,以避免跨法院数据污染;此外,判例文本的公共领域属性虽已由判例法确立,但确保大规模语料在切分、去重与格式统一过程中不引入错误,仍需严谨的工程校验与来源追溯。
常用场景
经典使用场景
在司法裁判文书智能检索与文本生成的研究中,us-caselaw-ut 数据集作为犹他州上诉法院公开裁判文书的完整语料,为法律文本检索与生成任务提供了权威且结构化的数据基础。该数据集涵盖34,886份裁判意见文书,包含主意见与独立意见,并保留极短裁定记录,适用于构建法律检索系统、训练法律领域生成模型以及开展裁判文书语义分析。其体量适中而质量可靠,尤其适合作为法律自然语言处理任务的基准语料,支撑检索增强生成(RAG)等前沿范式的实验验证。
实际应用
在实务层面,us-caselaw-ut 数据集可支撑律师事务所、法律援助机构与司法行政部门构建智能法律检索平台,辅助律师快速定位相关判例、识别裁判要旨与评估诉讼策略。同时,该数据集亦可服务于法律科技企业开发裁判文书摘要生成、法律问答系统与合规风险预警工具,提升法律服务的效率与可及性。其完整公开记录的特性,尤其适合用于训练面向州级司法体系的检索增强生成系统,推动法律信息服务的智能化转型。
衍生相关工作
作为 DocketRouter 法律语料体系的组成部分,us-caselaw-ut 数据集与 Free Law Project 及 CourtListener 的公开数据生态紧密关联,衍生出多项围绕法律检索增强生成、裁判文书向量化表示与跨州法律文本迁移学习的研究工作。该数据集亦为构建法律领域大语言模型微调基准、开发司法裁判知识图谱以及探索公版法律文本的伦理与治理问题提供了重要素材,推动了法律自然语言处理领域从通用模型向领域专用系统的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务