遇见数据集

us-caselaw-va

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Virginia Case Law 是一个包含 54,048 份弗吉尼亚州上诉法院意见全文的数据集。这些文本源自 Free Law Project / CourtListener 在 2026-06-30 的批量导出,属于公开记录。数据集涵盖两个法院(va 和 vactapp),包括主要意见和单独意见,仅排除字符数少于 1 的文档。在精确地切片中,约 91.5% 的文档文本长度超过 2000 字符,7.2% 在 200 至 1999 字符之间,1.3% 少于 200 字符(这些短文档为真实记录,如调卷令驳回、单行命令和判决登记,故意保留以构成完整的公共记录)。数据格式遵循 docketx record v1 规范,每条记录包含 id、doc_type、jurisdiction、title、text、source、license、retrieved_at、citation、court、date 以及 extra(包含 CourtListener 意见/案件集 ID 和意见类型)。由于司法意见属于政府法令,本身为公共领域作品,此打包版本采用 CC0 1.0 许可发布,未添加任何额外标注或修改。该数据集适用于文本检索(text-retrieval)和文本生成(text-generation)任务,尤其适合法律领域的 RAG、检索、法律 NLP 和法律研究等应用场景。

Virginia Case Law is a dataset containing the full text of 54,048 Virginia appellate court opinions. These texts originate from a bulk export of Free Law Project / CourtListener dated 2026-06-30 and are public records. The dataset covers two courts (va and vactapp), includes majority and separate opinions, and only excludes documents with fewer than 1 character. In precise slicing, approximately 91.5% of documents have text length exceeding 2000 characters, 7.2% have between 200 and 1999 characters, and 1.3% have fewer than 200 characters (these short documents are real records such as certiorari denials, single-line orders, and judgment entries, intentionally retained to form a complete public record). The data format follows the docketx record v1 specification; each record includes id, doc_type, jurisdiction, title, text, source, license, retrieved_at, citation, court, date, and extra (containing CourtListener opinion/docket IDs and opinion type). Since judicial opinions are government edicts and thus public domain works, this packaged version is released under the CC0 1.0 license without any additional annotations or modifications. This dataset is suitable for text-retrieval and text-generation tasks, especially for legal-domain RAG, retrieval, legal NLP, and legal research applications.

创建时间:
2026-09-06
原始信息汇总

Virginia Case Law 数据集概述

基本信息

  • 数据集名称:Virginia Case Law
  • 数据集地址:https://huggingface.co/datasets/docketx/us-caselaw-va
  • 许可证:CC0 1.0
  • 语言:英语(en)
  • 数据规模类别:10K < n < 100K
  • 任务类别:文本检索(text-retrieval)、文本生成(text-generation)
  • 标签:legal、law、caselaw、virginia、us-law、state-law、court-opinions、public-domain、rag、retrieval、legal-nlp、legal-research
  • 配置文件:默认配置(default),数据文件位于 data/*.jsonl.gz

数据内容

  • 收录 54,048 份弗吉尼亚州上诉法院意见文档的全文,来源为公开记录。
  • 数据切片自 Free Law Project / CourtListener 于 2026-06-30 的批量导出。
  • 法院覆盖范围:2 个法院标识(显式白名单,从不使用前缀匹配):vavactapp
  • 包含主意见(lead opinions)与单独意见(separate opinions);排除长度少于 1 个字符的文档。
  • 切片 sha256 值:8fcf1c833daeccadd8c383082c70911a7aab676aebe3518c1ffb2e7271d1a140(亦记录于 slice.manifest.json)。

数据构成

基于该切片的实测统计:

  • 49,456 份文档(91.5%)文本长度在 2,000 字符以上。
  • 3,892 份文档(7.2%)文本长度在 200–1,999 字符之间。
  • 700 份文档(1.3%)文本长度在 200 字符以下。
  • 短文档为真实记录而非错误,包括调卷令驳回(certiorari denials)、单行命令和判决登记条目。
  • 因其设定 min_chars = 1,这些短文档被有意保留,以保证数据为完整的公开记录而非经过过滤的子集。
  • 若仅需实质性意见,可按 len(text) 进行过滤。

数据格式

  • 每行遵循 docketx record v1 格式(每行一条意见)。
  • 字段包括:iddoc_typejurisdictiontitletextsourcelicenseretrieved_at,以及 citationcourtdateextra(CourtListener 的 opinion/cluster id、意见类型)。
  • 所有 docketx 数据集均使用相同的格式。

来源与许可

  • 司法意见为政府法令,属于不可受版权保护的公有领域作品(依据 Banks v. Manchester, 128 U.S. 244 (1888);Georgia v. Public.Resource.Org, 590 U.S. 255 (2020))。
  • 本数据打包以 CC0 1.0 发布。
  • 来源:CourtListener 批量导出(2026-06-30),Free Law Project — https://free.law
  • 本数据集重新分发公有领域的法院文本,不添加任何标注,也不主张任何权利。

加载方式

python from datasets import load_dataset ds = load_dataset("docketx/us-caselaw-va")

相关资源

  • 属于 DocketRouter 法律语料库:https://huggingface.co/docketx
搜集汇总
数据集介绍
us-caselaw-va 数据集图片
构建方式
该数据集源于Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出记录,专以弗吉尼亚州上诉审级为限,通过明确列示的法院标识符(va与vactapp)进行精确筛选,杜绝前缀匹配可能引入的无关文书。原始卷宗经开刀处理,保留主意见书与独立意见书,仅剔除字符数不足1的空文档,最终形成54,048份上诉意见全文的集合。切片过程经过SHA-256校验(8fcf1c833daeccadd8c383082c70911a7aab676aebe3518c1ffb2e7271d1a140),确保了数据包在传输与存储环节的完整性。
特点
数据集以docketx record v1格式逐行记录,每份意见书包含标识符、文书类型、司法辖区、标题、正文、来源、许可、抓取时间,并附有引证、法院、日期及CourtListener意见与簇编号等扩展字段。文本长度分布呈现鲜明分层:91.5%的文档逾2,000字符,7.2%介于200至1,999字符之间,另有1.3%不足200字符,后者多为调卷令驳回、单行命令与判决登记等真实司法记录,因最小字符阈值设为1而被完整保留。司法意见作为政府法令,依Banks诉Manchester案与Georgia诉Public.Resource.Org案确立的原则,属于不可版权保护的公有领域作品,数据包以CC0 1.0协议发布,不附加任何标注,亦不主张任何权利。
使用方法
研究者和开发者可借助Hugging Face datasets库直接加载该数据集,调用方式为load_dataset("docketx/us-caselaw-va"),即可获取默认配置下的全部JSONL压缩文件。鉴于短文本包含实质法律效力的简易裁判记录,若研究目标聚焦于实质性意见书,可按len(text)设定阈值进行过滤,从而在检索增强生成、文本生成、法律信息检索等任务中灵活适配。该数据集亦隶属于DocketRouter法律语料体系,可与同系列其他司法辖区的数据集协同使用,以支撑跨州法律文本分析与比较研究。
背景与挑战
背景概述
法律文本挖掘与检索增强生成技术的兴起,使高质量、大规模法院判决语料成为计算法学研究的基础设施。弗吉尼亚州判例法数据集(us-caselaw-va)由DocketRouter团队于2026年构建,源自Free Law Project旗下CourtListener数据库的批量导出,涵盖弗吉尼亚州最高法院与上诉法院的54,048份上诉意见书全文。该数据集以docketx记录格式统一封装,保留判决原文、引证信息与法院标识,为法律信息检索、判决预测及法律问答系统提供了可复用的公开语料,其CC0许可亦消除了版权障碍,推动了州级判例法的开放获取与跨州比较研究。
当前挑战
该数据集所应对的核心领域问题在于法律文本检索与生成任务中缺乏完整、中立且格式统一的州级判例语料,尤其在州法院层面,判决书公开程度参差、检索工具稀缺。构建过程中的挑战同样显著:需从海量导出记录中精确筛选弗吉尼亚州两个法院标识,避免前缀匹配引入噪声;需在保留简短程序性文书与维持实质性意见覆盖之间取得平衡,故以1字符为下限,导致约1.3%的文档不足200字符,使用者须自行按文本长度过滤;此外,原始记录中引证格式、日期字段与并存意见的标注一致性亦构成数据清洗与下游建模的持续难题。
常用场景
经典使用场景
在司法裁判文书检索与生成的研究脉络中,该数据集凭借五万余份弗吉尼亚州上诉法院意见书全文,构建起可供模型深度研习的判例语料。其经典用法主要聚焦于法律文本检索与生成任务,研究者借助长文本检索技术,从判例库中定位与待决争点语义相契的先例;同时以生成式建模方法,基于案情摘要复现裁判理由的论证结构。依托每条记录的管辖法院、裁判日期与引证信息,检索增强生成范式得以在真实司法文本上完成端到端的训练与评测。
实际应用
该数据集在实务场景中展现出多重效用。律所与法律援助机构可基于其构建判例智能检索系统,以语义匹配方式快速定位同类争点的裁判要旨,压缩案例调研的时间成本;司法信息化平台可借助其训练裁判文书摘要与要旨抽取模型,辅助法官与书记员梳理卷宗。对法律科技企业而言,该语料可用于开发合同风险提示、诉讼策略推演等下游工具,而检索增强生成架构的引入,则使模型输出得以锚定于可溯源的司法文本,提升法律问答的可靠性。
衍生相关工作
作为DocketRouter法律语料体系的组成部分,该数据集与同系列的其他州法判例集形成互补格局,推动了跨管辖区的法律检索基准建设。围绕该语料,研究者相继开展了判例检索增强生成、法律长文本摘要以及裁判要旨抽取等方向的探索,并催生出面向州级判例的语义索引与引证网络分析工作。其统一的docketx记录格式亦促进了不同法域数据集之间的互操作,为法律领域的多任务基准与迁移学习研究提供了可复用的底层资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务