us-caselaw-mo
收藏官方服务:
资源简介:
该数据集包含161,325份密苏里州上诉法院的完整意见文本,源自Free Law Project / CourtListener于2026-06-30的批量导出。覆盖五个法院标识符(mo, moctapp, moctapped, moctappsd, moctappwd),包括主意见和单独意见。文档排除字符数少于1的条目。组成统计:123,830份(76.8%)文档字符数超过2,000,30,845份(19.1%)在200至1,999字符之间,6,650份(4.1%)少于200字符。短文档是真实记录(如调卷令拒绝、单行命令、判决条目),有意保留以保持公共记录的完整性,用户可根据文本长度过滤以获取实质性意见。数据格式采用docketx record v1,每行一条意见,字段包括:id、doc_type、jurisdiction、title、text、source、license、retrieved_at、citation、court、date和extra(包含CourtListener意见/案卷ID、意见类型)。许可证为CC0 1.0,司法意见作为政府法令属于公共领域,本数据集未添加任何注释,不主张任何权利。该数据集适用于文本检索、文本生成、法律NLP、法律研究、RAG等任务。
创建时间:
2026-09-06
搜集汇总
数据集介绍

构建方式
该数据集源自Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出数据,采用明确的白名单策略,仅保留密苏里州五个上诉法院的标识符(mo、moctapp、moctapped、moctappsd、moctappwd),杜绝前缀匹配可能引入的无关记录。切片过程剔除了字符数低于1的文档,完整收录主意见与独立意见,最终凝练为161,325份密苏里州上诉法院意见书全文。数据集以SHA-256哈希值锁定切片版本,确保数据溯源的可验证性与不可篡改性。
使用方法
用户可通过HuggingFace datasets库以一行代码便捷加载该数据集,即调用load_dataset("docketx/us-caselaw-mo"),随后利用Python生态中的数据处理工具进行检索、生成或分析。针对需要实质性意见的应用场景,建议依据文本长度字段进行过滤,从而聚焦于信息密度更高的长文档。该数据集适配法律文本检索、法律生成、法律自然语言处理及检索增强生成等任务,亦可用于法律研究中的判例挖掘与司法推理建模,为计算法学研究提供了系统化的基础语料。
背景与挑战
背景概述
司法裁判文书作为政府法令,依Banks诉曼彻斯特案及佐治亚州诉Public.Resource.Org案确立的先例,属于不可版权保护的公共领域作品,构成法律信息检索与自然语言处理研究的基础语料。在此背景下,docketx/us-caselaw-mo数据集于2026年6月30日自Free Law Project的CourtListener批量导出中切片生成,收录密苏里州五家上诉法院的161,325份裁判意见全文。该数据集以docketx记录格式统一封装,涵盖主意见与协同意见,旨在为法律文本检索、生成及检索增强生成任务提供完整且无权利负担的州级判例资源,对推动法律信息学的可复现研究具有基础性意义。
当前挑战
法律裁判文书领域长期面临文档格式异构、引用结构复杂与检索粒度模糊等固有难题,而本数据集的建设还需应对公共记录完整性与可用性之间的张力。挑战具体表现为:密苏里州五家法院的裁判文书在篇幅上高度不均衡,76.8%的文档具备两千字符以上的实质内容,却有4.1%的调卷令驳回、单行命令与判决登记等短文本,若不加甄别地用于训练或检索,可能引入噪声并削弱模型对实质法律推理的建模能力;同时,原始批量导出中的法院标识须以显式白名单精确匹配,任何前缀式匹配都可能混入无关司法辖区的文档,破坏语料的纯净性与地域一致性。
常用场景
经典使用场景
在计算法律学与法律信息检索领域,该数据集最经典的使用场景在于构建判例法全文检索系统与法律问答工具。密苏里州上诉法院及最高法院的裁判文书构成了普通法体系下司法推理的基石,研究者可依托161,325份裁判意见训练稠密检索模型与检索增强生成(RAG)管道,使法律从业者得以通过自然语言查询快速定位相关先例。该数据集的文档级粒度与完整的元数据字段(citation、court、date、doc_type)为监督式检索训练提供了高质量的标注信号,尤其适合评测跨年度、跨审级的长文本法律检索算法。
解决学术问题
该数据集直击法律自然语言处理中长期存在的语料稀缺与地域失衡问题。既往研究多聚焦联邦最高法院或少数几个大州的判例,密苏里州等中部地区的司法实践长期缺乏系统性的公开语料,导致法律检索模型的地域泛化能力难以评估。该数据集以完整公共记录为原则,保留包括调卷令驳回、单行命令在内的短文档,使研究者能够考察模型在非实质性裁判文本上的鲁棒性,并为司法行为预测、裁判文书摘要、法律引文网络分析等任务提供了无版权限制的大规模实证基础。
实际应用
在法律实务层面,该数据集可支撑律所与法律援助机构搭建面向密苏里州管辖区的先例检索与类案推送平台。诉讼律师借助该语料训练的检索模型,能够在撰写书状时高效定位上诉法院的裁判要旨;法官助理与司法研究者亦可利用其进行裁判趋势的量化分析。由于裁判文书属于政府法令而处于公有领域,商业法律科技产品可无许可障碍地集成该数据,为州级法律检索服务、合规审查与法律教育工具提供可溯源的底层语料。
数据集最近研究
最新研究方向
在计算法学与法律信息学交叉领域,面向州级判例的检索增强生成与司法裁判预测正成为前沿热点。us-caselaw-mo数据集凭借其涵盖密苏里州五所上诉法院逾十六万份公开裁判文书的完整记录,为法律文本检索、长文档理解及判决推理建模提供了高保真语料。近期研究聚焦于利用该数据构建检索增强生成系统,以缓解大语言模型在州法适用中的幻觉问题,并探索基于引文网络与裁判要旨的相似案例匹配。同时,该数据集对短文本如调卷令驳回与单行命令的保留,推动了司法透明与低资源法律自然语言处理研究,其公共领域属性亦为开放法律科学生态提供了可复现的基准,对促进法律人工智能的可解释性与公平性具有深远影响。
以上内容由遇见数据集搜集并总结生成




