遇见数据集

us-caselaw-nh

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

New Hampshire Case Law 数据集包含来自美国新罕布什尔州上诉法院的22,351份完整意见文档,数据来源于Free Law Project / CourtListener 于2026年6月30日的批量导出。数据集覆盖新罕布什尔州的法院(法院ID: nh),包括主意见和独立意见,并排除了长度不足1个字符的文档。文档按 docketx record v1 格式组织,每条记录占一行,包含以下字段:id、doc_type、jurisdiction、title、text、source、license、retrieved_at、citation、court、date 和 extra(包含CourtListener的案件/意见ID及意见类型)。数据集中约86.6%的文档文本长度超过2000字符,13.0%的文档在200-1999字符之间,0.5%的文档少于200字符(这些短文档为真实记录,例如调卷令拒绝、一行命令和判决条目,被特意保留以保持公共记录的完整性)。所有司法意见均属于公共领域无版权作品,本数据集以CC0 1.0许可发布。该数据集适用于文本检索、文本生成、法律自然语言处理、检索增强生成(RAG)以及法律研究等任务。

创建时间:
2026-09-06
搜集汇总
数据集介绍
us-caselaw-nh 数据集图片
构建方式
本数据集立足于美国州级司法判例的公开获取与结构化整理需求,从Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出文件中系统抽取新罕布什尔州上诉法院的裁判文书全文。构建过程严格限定于单一法院标识(nh)的白名单,排除前缀匹配带来的跨法院噪声,仅保留主意见与独立意见,并以字符数下限为1的宽松阈值纳入所有公开记录。其切片经sha256哈希校验,确保数据完整性与可追溯性。最终形成的语料涵盖22,351份文书,兼顾实质裁判与程序性简短记录,维护了公共司法记录的原始全貌。
特点
该数据集在构成上呈现显著的文本长度分层:86.6%的文书拥有2,000字符以上的实质内容,13.0%介于200至1,999字符之间,仅0.5%为不足200字符的程序性记录。这些短文本并非缺失或错误,而是调卷令驳回、单行命令与判决登记等真实司法活动的反映,其保留体现了对公共记录完整性的尊重。每份文书遵循统一的docketx记录格式,涵盖标识、文书类型、管辖、标题、正文、来源、许可、检索时间及引证、法院、日期与扩展字段,为跨数据集整合提供了一致性基础。数据源自政府法令,属公共领域作品,以CC0 1.0协议发布,不附加任何标注或权利主张。
使用方法
研究者可通过HuggingFace datasets库以单行代码便捷加载该数据集,调用方式为load_dataset("docketx/us-caselaw-nh"),适用于文本检索与文本生成等任务。使用中可依据文本长度字段进行筛选,以聚焦实质性裁判文书或保留完整记录。其标准化的字段结构支持法律自然语言处理、判例检索增强生成及法律信息学研究等场景,尤其适合构建面向新罕布什尔州司法实践的检索与问答系统。数据集作为DocketRouter法律语料库的组成部分,亦可与其他州级判例数据集协同使用,拓展比较法与跨管辖分析的可能性。
背景与挑战
背景概述
随着法律信息学的兴起,司法裁判文书的公开与再利用成为推动法律研究、智能检索及生成式模型发展的关键基础设施。新罕布什尔州判例法数据集(us-caselaw-nh)由Free Law Project的CourtListener批量导出于2026年6月30日构建,收录该州上诉法院公开裁判文书22,351份,旨在为法律自然语言处理提供权威、完整的原始语料。该数据集着力解决地方法律文本获取碎片化与覆盖不全的问题,其遵循公共领域原则,为法律检索增强生成、判决预测及跨州司法比较研究奠定了重要数据基础。
当前挑战
该数据集面临的核心挑战在于法律文本的异质性与检索生成的精准性。所解决的领域问题涉及法律文书检索与生成,其难点包括长文档语义建模、判例引用结构解析及法律术语的领域适应性。构建过程中,需确保州法院覆盖的精确匹配与文档去重,同时保留简短裁定等非典型记录以维持公共记录的完整性;此外,数据来源的时效性与不同州格式的统一性亦构成持续挑战,要求在使用时对文本长度与质量进行细致甄别。
常用场景
经典使用场景
在司法裁判文本挖掘与法律信息检索领域,新罕布什尔州判例法数据集构成了一项基础性的语料资源。该数据集最为经典的使用场景在于支撑法律文本检索与判例摘要生成任务,研究者可借助其完整的上诉法院意见书全文,构建面向判例法检索的稠密检索模型或检索增强生成系统,从而实现对相关先例的高效定位与自动化摘要。
解决学术问题
该数据集有效回应了法律自然语言处理中判例全文获取困难与州级司法语料稀缺的学术困境。其覆盖新罕布什尔州单一法院的完整公开记录,为研究长文本法律论证结构、判决理由抽取以及先例引用网络分析提供了可复现的数据基础,推动了法律文本理解与生成模型在真实司法语境下的评估与迭代。
衍生相关工作
围绕该数据集已衍生出若干法律信息检索与文本生成方向的经典工作,包括基于判例全文的稠密检索基线、面向长文档的法律摘要模型以及跨州判例语料的对比研究。这些工作依托docketx统一记录格式,推动了法律领域检索增强生成管线的标准化,并为后续多管辖区的判例法语料整合提供了方法参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务