us-caselaw-tx
收藏官方服务:
资源简介:
德克萨斯州案例法(Texas Case Law)数据集包含662,717份德克萨斯州上诉法院意见的全文,源自Free Law Project / CourtListener 的批量导出(快照日期为2026-06-30)。该数据集覆盖德克萨斯州20个明确指定的法院ID(包括德克萨斯州最高法院、上诉法院、刑事上诉法院及各地区上诉法院),包含主意见和单独意见。所有文档均来自公共记录,且最短字符数限制为1(即故意保留极短文档,如调卷拒绝、单行命令和判决条目,以确保公共记录的完整性)。数据集的组成统计:约70.9%的文档包含2,000字符以上的文本,28.7%包含200-1,999字符,0.4%少于200字符。每条记录采用docketx record v1格式,包含id、doc_type、jurisdiction、title、text、source、license、retrieved_at、citation、court、date、extra等字段。司法意见属于公共领域作品,本数据集以CC0 1.0许可发布,不添加任何注释。该数据集适用于文本检索、文本生成、RAG(检索增强生成)、法律NLP、法律研究等任务。
创建时间:
2026-09-06
搜集汇总
数据集介绍

构建方式
在普通法体系中,判例文本构成法律推理与司法论证的基石,对州级上诉法院判决的系统化整理则为法律信息学研究提供了不可或缺的语料支撑。该数据集源自Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出数据,采用显式白名单策略,精确锁定德克萨斯州20个上诉法院标识符,杜绝前缀匹配可能引入的无关记录。数据提取范围涵盖主审意见与独立意见,以字符数不低于1为唯一准入条件,从而保全了公共司法记录的完整面貌。切片文件附带sha256校验值,确保数据溯源的可验证性。
特点
该数据集以66万余份德克萨斯州上诉法院意见书全文为体量,在规模与覆盖面上均具备显著的检索与生成研究价值。其记录结构遵循统一的docketx record v1格式,逐行呈现意见书标识、文书类型、管辖区域、标题、全文、来源、许可、获取时间以及引证、法院、日期与扩展信息等字段,便于跨数据集协同使用。值得注意的是,短文本记录并非数据瑕疵,而是包含调卷令驳回、单行命令与判决登记等真实司法文书,保留了公共记录的原生样态。全部司法意见属于政府法令,依Banks诉Manchester案与Georgia诉Public.Resource.Org案之先例,不受版权保护,数据集以CC0 1.0协议发布,无任何权利保留或额外标注。
使用方法
研究者和开发者可借助Hugging Face datasets库,通过load_dataset函数直接加载docketx/us-caselaw-tx数据集,快速接入德克萨斯州判例全文语料。针对法律检索、文本生成与检索增强生成等任务,用户可根据研究需要,利用len(text)字段过滤出具有实质裁判理由的长文本意见,亦可保留全部记录以考察司法文书的全谱系分布。该数据集隶属于DocketRouter法律语料体系,与同一格式的其他docketx数据集兼容,便于构建跨州或跨辖区的比较研究。使用时应留意数据切片的时间节点,以确保引用与分析的时效性和准确性。
背景与挑战
背景概述
法律文本的数字化整理与开放获取,是计算法学与法律信息学长期关注的基础性议题。美国作为普通法系代表,其州级上诉法院判例构成理解司法推理与法律演进的珍贵语料。us-caselaw-tx数据集由docketx团队构建,源自Free Law Project旗下CourtListener平台2026年6月30日的批量导出,完整收录德克萨斯州20个上诉法院的662,717份裁判文书全文,涵盖主意见与个别意见,并以docketx记录格式统一封装。该数据集延续了司法裁判文书属政府法令、不受版权保护的法律传统,采用CC0 1.0协议发布,为法律检索、文本生成与法律自然语言处理研究提供了大规模、可复用的公共领域语料,对推动法律人工智能的透明性与可及性具有重要价值。
当前挑战
在领域问题层面,法律裁判文书的自动检索与理解面临长文本语义建模、专业术语歧义消解以及判例援引关系抽取等核心难题,传统方法难以在跨法院、跨审级的异构文书中保持稳健性能。在构建过程中,数据完整性同质控之间存在张力:为保留certiorari驳回、单行命令等真实记录,最低字符阈值设定为1,导致约0.4%的文档不足200字符,研究者须自行依据文本长度筛选实质性意见;同时,法院标识须采用显式白名单而非前缀匹配,以避免审级与辖区混淆,这要求对来源元数据进行严格校验。上述挑战共同构成了该数据集在法律信息检索与生成任务中亟待应对的关键议题。
常用场景
经典使用场景
在普通法体系的法律信息学研究之中,判例文本的规模化获取与结构化组织始终构成智能法律应用的基础性环节。该数据集汇集德克萨斯州二十个上诉法院逾六十六万份裁判文书全文,天然适配判例检索、类案匹配、裁判文书摘要生成与法律问答等经典任务。研究者常将其用作稠密检索与生成式模型的语料来源,借助文本检索与文本生成两大任务范式,在长文本法律语料上评估模型的语义表征能力与推理生成质量,亦可用于构建面向德州州法领域的检索增强生成系统。
解决学术问题
法律自然语言处理长期受制于高质量判例语料的稀缺与碎片化,尤以州级上诉法院文书为甚。该数据集以完整公共记录为采集原则,保留包括调卷令驳回、单行命令与判决登记在内的短文书,使研究者得以在无过滤偏差的语料上考察裁判说理的分布特征与长尾现象。其明确界定的法院白名单与统一记录格式,缓解了跨法院、跨审级数据难以对齐的问题,为判例检索、裁判预测与法律论证挖掘等研究提供了可复现的基准,推动了法律信息检索从封闭语料向开放公共记录范式的转变。
衍生相关工作
作为DocketRouter法律语料体系的组成部分,该数据集与同系列其他司法辖区语料共享docketx记录格式,便于横向比较与跨州研究。围绕其衍生的经典工作涵盖判例检索基准的构建、法律文本嵌入模型的微调以及检索增强生成流程在法律问答中的验证。CourtListener与Free Law Project的公开批量导出构成其上游数据基础,而下游则催生了面向州法领域的语义检索、文书摘要与裁判预测等研究,逐步形成以公共领域判例为核心的可复用法律NLP资源生态。
以上内容由遇见数据集搜集并总结生成




