遇见数据集

us-caselaw-ma

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

马萨诸塞州判例法数据集包含90,879份马萨诸塞州上诉法院意见的全文,来源于Free Law Project / CourtListener 2026-06-30的批量导出。这些意见覆盖三个法院:马萨诸塞州最高法院(mass)、马萨诸塞州上诉法院(massappct)和马萨诸塞州地区上诉法院(massdistctapp)。文档包括主导意见和单独意见,排除长度小于1字符的文档,但保留了长度小于200字符的短文档(如调卷令拒绝、单行命令和判决条目),以确保公开记录的完整性。数据采用docketx record v1格式,每行一个意见,包含id、doc_type(文档类型)、jurisdiction(管辖权)、title(标题)、text(正文)、source(来源)、license(许可证)、retrieved_at(检索时间)、citation(引用)、court(法院)、date(日期)以及extra(包含CourtListener意见/集群ID和意见类型等额外信息)。司法意见属于政府法令,为公共领域不可版权作品,本数据集以CC0 1.0许可发布,仅重新分发公共领域法院文本,不添加任何注释,不主张任何权利。该数据集可用于文本检索、文本生成、法律研究、检索增强生成(RAG)以及法律自然语言处理(NLP)等任务。

The Massachusetts case law dataset contains the full text of 90,879 opinions from the Massachusetts appellate courts, sourced from a bulk export of Free Law Project / CourtListener on 2026-06-30. These opinions cover three courts: the Supreme Judicial Court (mass), the Massachusetts Appeals Court (massappct), and the Massachusetts District Court Appellate Division (massdistctapp). Documents include majority opinions and separate opinions, excluding documents shorter than 1 character, but retaining short documents under 200 characters (such as denials of certiorari, per curiam orders, and judgment entries) to ensure completeness of the public record. The data is in docketx record v1 format, with one opinion per line, containing id, doc_type, jurisdiction, title, text, source, license, retrieved_at, citation, court, date, and extra (including CourtListener opinion/cluster IDs and opinion type). Judicial opinions are government edicts, uncopyrightable public domain works; this dataset is released under the CC0 1.0 license, redistributing only public domain court texts without adding any annotations or claiming any rights. This dataset can be used for tasks such as text retrieval, text generation, legal research, retrieval-augmented generation (RAG), and legal natural language processing (NLP).

创建时间:
2026-09-06
搜集汇总
数据集介绍
us-caselaw-ma 数据集图片
构建方式
在司法裁判文书公开与自然语言处理交叉领域,高质量法律语料库的构建需兼顾全面性与可溯源性。该数据集源自Free Law Project旗下CourtListener于2026年6月30日发布的批量导出数据,通过显式白名单精确锁定马萨诸塞州三个上诉法院标识符(mass、massappct、massdistctapp),严格避免前缀匹配带来的数据污染。原始文档经切片、去重与格式统一后,保留判决主文及独立意见,剔除不足1字符的异常记录,最终生成由90,879份上诉意见构成的完整公共记录文本,并以SHA-256校验和与清单文件确保数据切片完整性。
特点
该数据集系统收录了马萨诸塞州上诉法院的裁判文书全文,文档规模介于1万至10万条之间,覆盖多数派意见与独立意见等多元裁判形态。其中约85.1%的文档正文超过2000字符,13.1%介于200至1999字符之间,另有1.8%的短文本为调卷令驳回、单行命令及判决登录等真实司法记录,未作过滤以保持公共记录的完整性。每条数据遵循统一的docketx record v1格式,涵盖标识符、文书类型、司法管辖区、标题、正文、来源、许可、检索时间以及引证、法院、日期等扩展字段,为文本检索、文本生成及法律检索增强生成等任务提供结构一致且权利状态清晰的语料基础。
使用方法
研究者可通过Hugging Face datasets库以一行代码加载该数据集,直接获得按行组织的司法意见文本。由于数据保留原始公共记录全貌,使用时可依据len(text)字段进行条件筛选,以获取仅含实质性裁判理由的文档子集,满足不同粒度分析需求。该数据集适用于法律文本检索、裁判要旨生成、司法裁判预测以及检索增强生成系统的知识库构建等场景。其CC0 1.0许可允许无限制再利用,与DocketRouter法律语料库家族其他数据集共享统一记录格式,便于跨州或跨法院集成实验。
背景与挑战
背景概述
司法裁判文书的公开与再利用是法律信息学与计算法学发展的基石。马萨诸塞州判例法数据集(us-caselaw-ma)由DocketRouter项目于2026年构建,依托Free Law Project旗下CourtListener平台的大规模公开数据,系统整合了马萨诸塞州上诉法院、上诉庭及地区上诉法院的90,879份裁判意见全文。该数据集旨在为法律检索、文本生成、问答系统及检索增强生成等任务提供高质量、结构化且无版权争议的语料,其核心贡献在于将分散的司法公开记录转化为可直接用于自然语言处理研究的标准化资源,从而推动法律人工智能在州级司法场景中的实证研究与应用开发。
当前挑战
该数据集所回应的领域问题在于:法律文本的获取长期受限于格式异构、来源分散与版权模糊,而司法裁判文书的可计算化处理更面临长文档建模、专业术语密集及检索精度要求严苛等固有难题。在构建层面,数据切片需从海量法院记录中精确限定三个特定法院标识,避免前缀匹配带来的数据混淆;同时,必须保留大量篇幅短小但具有法律效力的简要命令与判决条目,以维持公共记录的完整性,这对数据清洗与质量评估策略提出了审慎权衡的要求。此外,确保每份文书在保留原始结构的同时符合统一记录格式,亦构成工程与法理层面的双重挑战。
常用场景
经典使用场景
在计算法学与法律信息检索领域,判例全文语料库向来是支撑实证研究与智能系统开发的基石。us-caselaw-ma数据集汇聚马萨诸塞州上诉法院九万余份判决文书,其经典用途在于作为法律检索与文本生成的训练与评测资源,研究者可借此构建判例相似度匹配模型、训练面向法律问答的生成系统,或开展司法裁判规律的量化分析,从而在真实且完整的州级判例语料中检验各类自然语言处理方法的有效性。
解决学术问题
该数据集有效回应了法律自然语言处理中长期存在的语料稀缺与覆盖偏差问题。既往研究多依赖联邦层级或少数热门辖区的判例,难以支撑州法体系的精细化比较与跨辖区迁移学习。本数据集以明确的三类法院标识符为白名单,完整保留包括驳回调卷令与单行裁定在内的全部公开记录,使研究者能够探究判决文书长度分布、意见类型差异及司法说理密度等议题,为法律文本挖掘与检索模型提供可复现的基准,推动了州级判例研究的实证转向。
衍生相关工作
作为DocketRouter法律语料体系的组成部分,us-caselaw-ma遵循统一的docketx记录格式,因而与同系列其他辖区数据集形成天然的衍生研究网络。围绕该数据集,学界已涌现出判例检索基准测试、法律文本嵌入模型微调、检索增强生成的法律问答系统,以及跨州判例比较分析等经典工作。这些工作不仅验证了州级判例语料在检索与生成任务中的价值,也促进了法律领域开放数据标准的推广与复用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务