遇见数据集

us-caselaw-mt

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

蒙大拿案例法数据集(Montana Case Law)包含来自公共记录的64,117份蒙大拿州上诉法院意见全文,源自Free Law Project / CourtListener于2026年6月30日的批量导出。数据集涵盖蒙大拿州法院的主要意见和单独意见,文档长度各异,包括短至一句话的调卷令驳回、单行命令和判决条目,保留所有真实记录。每条数据采用docketx record v1格式,包含id、doc_type、jurisdiction、title、text、source、license、retrieved_at、citation、court、date和extra等字段。该数据集适用于文本检索、文本生成、检索增强生成(RAG)、法律自然语言处理和法律研究等任务。许可证为CC0 1.0,属于公共领域。

创建时间:
2026-09-06
搜集汇总
数据集介绍
us-caselaw-mt 数据集图片
构建方式
本数据集立足于美国州级司法裁判文书公开化的制度背景,源自Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出记录,通过明确的法院标识符白名单(mont)进行精确切片,杜绝前缀匹配所致的跨法院混淆。原始数据经过去重与文本规范化处理,仅保留主审意见与独立意见,以最小字符阈值剔除空文档,完整覆盖蒙大拿州上诉审级的裁判文书。切片过程生成唯一sha256校验值并载入清单文件,从而确保数据溯源的可审计性与切片边界的确定性,为后续法律检索与生成任务奠定可靠的数据基底。
使用方法
在具体使用层面,研究者可借助Hugging Face datasets库以单行指令加载该数据集,直接获得结构化的文书记录。加载后的文本字段可用于法律检索、判决预测、检索增强生成以及法律语言模型的继续预训练等多种任务,短文本记录亦可供文书分类或程序性裁定的专题分析。鉴于数据以JSONL压缩格式分片存储,用户既可全量载入,亦可按需流式读取以控制内存开销。由于所有文书均属公共领域,使用时无需额外授权,仅需在成果中注明数据来源与切片版本即可。
背景与挑战
背景概述
蒙大拿州判例法数据集(us-caselaw-mt)源自Free Law Project旗下CourtListener平台于2026年6月30日发布的公共领域批量导出记录,由DocketRouter团队整理并发布。该数据集汇聚了蒙大拿州上诉法院65,117份裁判文书全文,涵盖主导意见与并存意见,旨在为法律信息检索、司法裁判预测及法律文本生成等自然语言处理任务提供底层语料支撑。作为美国州级判例公开数据基础设施建设的重要一环,该数据集以其完整性与结构化格式,推动了法律人工智能研究从联邦层面向州法层面的纵深拓展。
当前挑战
本数据集所应对的核心领域挑战在于州级判例文本的异构性与检索效率问题——蒙大拿州裁判文书在篇幅、格式及引用体系上高度不一致,对文本检索与生成模型的鲁棒性构成严峻考验。构建过程中面临的挑战则包括:如何在保留完整公共记录的前提下有效区分实质性意见与程序性简短裁定,以及如何将来自CourtListener的原始批量数据规范化为统一的结构化记录格式。此外,判例文本中固有的法律术语专业性与长文档依赖关系,亦对模型的语义理解能力提出了较高要求。
常用场景
经典使用场景
在司法裁判文本挖掘与法律信息检索领域,该数据集通常被用于构建面向州级上诉法院判决全文的检索与生成基准。研究者以蒙大拿州最高法院及上诉法院的六万余份裁判文书为语料,训练和评估法律文本检索模型、判决摘要生成系统以及基于检索增强生成的法律问答架构。凭借其完整的公开记录属性,该数据集支持从判例检索、引文网络分析到裁判要旨抽取等多种经典任务的实验复现。
解决学术问题
该数据集有效缓解了美国州级司法裁判语料长期分散、格式不一与获取门槛较高的问题。通过统一遵循docketx记录格式并保留全部公开记录,它为法律自然语言处理研究提供了可验证、可追溯的标准化语料,使判例检索、裁判预测、法律论证挖掘等学术议题得以在真实且完整的州法语境下展开,从而推动法律人工智能研究从联邦层面向州法层面的拓展与深化。
实际应用
在法律实务与公共法律服务场景中,该数据集可支撑面向蒙大拿州判例的智能检索系统、律师工作流中的先例推荐工具以及法律科技公司的裁判文书分析产品。其全文记录可用于构建判例知识库,辅助律师快速定位相关裁判观点,亦可用于法律问答机器人和合规审查系统,提升州法检索效率与司法信息的可及性。
数据集最近研究
最新研究方向
在司法裁判文书公开与法律人工智能深度融合的背景下,us-caselaw-mt数据集凭借其覆盖蒙大拿州上诉法院全部公开裁判文书的完整记录,正推动法律信息检索与生成技术向精细化方向演进。当前前沿研究聚焦于以检索增强生成架构赋能法律问答与判例摘要,利用该数据集保留的简短裁定与判决登记等原始记录,探索长尾法律文本的语义表示与可解释性建模。与此同时,围绕公共领域司法文本的无版权属性,研究者积极构建跨州裁判文书语料库的联邦式检索基准,以评估大语言模型在真实司法场景中的事实一致性与引用可靠性。该数据集为法律自然语言处理提供了可复现的评测基础,亦为司法透明化与普惠法律服务的智能化转型注入关键数据动能。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务