遇见数据集

us-caselaw-nj

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集包含从Free Law Project / CourtListener批量导出(截至2026年6月30日)中提取的142,776份新泽西州上诉法院意见全文。数据覆盖三个法院(nj、njch、njsuperctappdiv),包括主要意见和单独意见,仅排除长度小于1字符的文档。格式采用docketx record v1标准,每行一条意见记录,字段包括:id、doc_type、jurisdiction、title、text、source、license、retrieved_at、citation、court、date和extra(包含CourtListener意见/案件ID、意见类型)。数据组成:92,036份文档(64.5%)文本超过2,000字符,26,245份(18.4%)在200-1,999字符之间,24,495份(17.2%)少于200字符(包括真实的短期记录,如调卷令拒绝、单行命令和判决摘要)。所有文档保持原始状态(最小字符数为1),以确保公共记录的完整性。司法意见属于政府法令,为公共领域无版权作品,本数据集以CC0 1.0协议发布,不添加任何注释,不主张任何权利。适用于文本检索、文本生成以及法律NLP任务,尤其适合检索增强生成(RAG)和法律研究。

创建时间:
2026-09-07
搜集汇总
数据集介绍
us-caselaw-nj 数据集图片
构建方式
该数据集源自Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出数据,采用显式白名单策略,严格锁定新泽西州三个上诉法院标识符(nj、njch、njsuperctappdiv),确保不因前缀匹配引入无关司法辖区的文书。经过去重与格式规范化处理,最终提取出142,776份新泽西州上诉法院意见书全文,涵盖主意见与单独意见,仅剔除字符数不足1的异常记录,从而保留完整的公开司法档案,并以docketx记录规范统一存储。
特点
数据集以docketx record v1格式组织,每行对应一份意见书,包含标识符、文书类型、司法辖区、标题、正文、来源、许可、检索时间及引证、法院、日期等扩展字段,结构规整且跨数据集兼容。文本长度分布呈现显著分层:约64.5%的文书超过2000字符,构成实质性判决意见;另有约17.2%的文书不足200字符,系调卷令驳回、单行命令等简短司法记录,均被刻意保留以维护公开记录的完整性。所有文书均属公共领域,以CC0 1.0协议发布,不附加任何标注或权利主张。
使用方法
通过Hugging Face datasets库可直接加载,调用load_dataset("docketx/us-caselaw-nj")即可获取完整数据。若需聚焦实质性判决意见,可根据文本长度字段进行筛选,例如设定len(text)阈值以排除简短程序性记录。该数据集适用于法律文本检索、生成式法律问答、检索增强生成系统构建以及法律自然语言处理研究,亦可供法律信息学与司法实证分析使用。
背景与挑战
背景概述
新泽西州判例法数据集(us-caselaw-nj)于2026年6月30日由DocketRouter团队从Free Law Project的CourtListener批量导出中切片构建,涵盖142,776份新泽西州上诉法院意见书全文。该数据集聚焦于法律文本检索与生成任务,旨在为法律自然语言处理研究提供大规模、高质量的公开语料,推动判例法检索增强生成及法律问答系统的发展。其基于docketx记录格式的标准化封装,为跨州法律语料库的整合与比较研究奠定了重要基础。
当前挑战
该数据集所应对的核心领域挑战在于法律判例文本的异质性:文档长度分布悬殊,从一行裁定到数万字符的详细意见书,对检索与生成模型的长文本建模能力构成考验。构建过程中的挑战则源于公共记录的完整性维护与数据质量平衡,需保留大量短文本以忠实反映司法全景,同时避免噪声干扰模型训练;此外,法院标识的精确匹配、多类型意见书的解析以及跨数据集格式统一,均对数据处理的严谨性提出较高要求。
常用场景
经典使用场景
在计算法学与法律信息检索领域,新泽西州判例法数据集(us-caselaw-nj)最为经典的使用场景在于支撑判例全文检索与判决要旨的语义匹配。研究者与从业者依托该数据集构建检索增强生成系统,以自然语言查询精准回溯新泽西州上诉法院及高等法院的裁判文书,从而在卷帙浩繁的司法档案中迅速定位具有拘束力的先例。其完整的公开记录属性亦使其成为法律文本摘要、裁判要旨抽取以及引证网络分析等任务的优质语料,为判例法研究提供了可复现的数据基础。
衍生相关工作
作为DocketRouter法律语料库的组成部分,该数据集与同系列的其他州及联邦判例数据共享统一的docketx记录格式,从而催生了一系列跨法域的法律检索与生成研究,包括多州判例语义检索基准、裁判文书自动摘要模型以及法律问答系统的迁移学习实验。围绕公共领域判例文本的检索增强生成范式,亦衍生出针对长文档切分、引证识别与先例强度评估的方法学工作。这些衍生研究不仅拓展了州级判例语料的应用边界,也为法律自然语言处理领域的标准化数据基础设施建设提供了重要参照。
数据集最近研究
最新研究方向
在计算法学与法律信息检索的交汇地带,us-caselaw-nj数据集正驱动着面向州级司法裁判文书的深度语义挖掘。围绕该数据集的近期研究聚焦于检索增强生成架构下判例法知识的精准调用,利用其完整保留的简短程序性裁定与长篇实质性意见并存的结构特性,探索法律文本的层次化表征学习与跨法院引用网络建模。伴随人工智能司法应用透明性议题的持续升温,该语料库为评估大语言模型在真实司法场景中的幻觉抑制与法条溯源能力提供了不可替代的公共领域基准,亦为推进州法统一检索与类案推送系统的可复现研究奠定了数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务