遇见数据集

us-caselaw-wy

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Wyoming Case Law 是一个包含16,358份怀俄明州上诉法院意见全文的数据集,源自 Free Law Project 于2026年6月30日的 CourtListener 批量导出。数据集覆盖法院标识为 wyo,包括主意见和单独意见,最小文档长度设为1字符以保留完整的公共记录(含驳回、单行命令和判决录入等简短记录)。其中15,317份文档(93.6%)超过2,000字符,943份(5.8%)为200-1,999字符,98份(0.6%)少于200字符。数据采用 docketx record v1 格式,每行一条意见,字段包括:id、doc_type、jurisdiction、title、text、source、license、retrieved_at、citation、court、date 和 extra(CourtListener 意见/案件簇ID及意见类型)。数据集基于美国司法意见作为政府法令属于公共领域的原则,以 CC0 1.0 许可证发布,不添加任何标注,无版权主张。该数据集适用于文本检索(如 RAG、法律检索)和文本生成(如法律 NLP 研究)等任务。

Wyoming Case Law is a dataset containing the full text of 16,358 opinions from the Wyoming appellate courts, sourced from the Free Law Projects CourtListener bulk export on June 30, 2026. The dataset covers court identifier wyo, including majority opinions and separate opinions, with a minimum document length of 1 character to preserve complete public records (including short records such as dismissals, single-line orders, and judgment entries). Among them, 15,317 documents (93.6%) exceed 2,000 characters, 943 (5.8%) are 200-1,999 characters, and 98 (0.6%) are fewer than 200 characters. The data uses the docketx record v1 format, with one opinion per line, and fields include: id, doc_type, jurisdiction, title, text, source, license, retrieved_at, citation, court, date, and extra (CourtListener opinion/case cluster IDs and opinion type). The dataset is released under the CC0 1.0 license based on the principle that U.S. judicial opinions are in the public domain as government edicts, without any annotations or copyright claims. It is suitable for tasks such as text retrieval (e.g., RAG, legal search) and text generation (e.g., legal NLP research).

创建时间:
2026-09-06
原始信息汇总

Wyoming Case Law 数据集总结

基本信息

  • 数据集名称:Wyoming Case Law
  • 数据集地址:https://huggingface.co/datasets/docketx/us-caselaw-wy
  • 许可证:CC0 1.0
  • 语言:英语(en)
  • 任务类别:文本检索(text-retrieval)、文本生成(text-generation)
  • 数据规模:10K < n < 100K
  • 标签:legal、law、caselaw、wyoming、us-law、state-law、court-opinions、public-domain、rag、retrieval、legal-nlp、legal-research

数据集内容

  • 包含来自公共记录的 16,358 份怀俄明州上诉法院意见书全文文档。
  • 数据切取自 Free Law Project / CourtListener 于 2026-06-30 发布的批量导出数据。
  • 法院覆盖范围:1 个法院 id,采用显式允许列表(非前缀匹配):wyo
  • 包含主意见书和单独意见书;排除少于 1 个字符的文档。
  • 切片 sha256 值为 e713201b5a9c8ea78c26c1c58c056e77e35b18e773b96c61f21ef34e812663a9(也记录于 slice.manifest.json)。

数据构成

在此切片上实测:

  • 15,317 份文档(93.6%)包含 2,000 字符以上的文本。
  • 943 份文档(5.8%)包含 200 至 1,999 字符。
  • 98 份文档(0.6%)少于 200 字符。

短文档是真实记录而非错误,例如调卷令驳回、单行命令和判决登记条目。这些文档被有意保留(min_chars = 1),以保证这是完整的公共记录而非经过筛选的子集。如需仅保留实质性意见书,可按 len(text) 进行过滤。

数据格式

  • 每行遵循 docketx record v1 格式(每行一条意见书)。
  • 字段包括:iddoc_typejurisdictiontitletextsourcelicenseretrieved_at,以及 citationcourtdateextra(包含 CourtListener 意见/集群 id、意见类型)。
  • 所有 docketx 数据集均使用相同格式。

来源与许可

  • 司法意见书属于政府法令,为不可享有著作权的公共领域作品(依据 Banks v. Manchester, 128 U.S. 244 (1888);Georgia v. Public.Resource.Org, 590 U.S. 255 (2020))。
  • 本数据打包以 CC0 1.0 发布。
  • 来源:CourtListener 批量导出(2026-06-30),Free Law Project — https://free.law。
  • 本数据集重新分发公共领域法院文本,不添加任何标注,也不主张任何权利。

加载方式

python from datasets import load_dataset ds = load_dataset("docketx/us-caselaw-wy")

所属项目

属于 DocketRouter 法律语料库的一部分:https://huggingface.co/docketx

搜集汇总
数据集介绍
us-caselaw-wy 数据集图片
构建方式
怀俄明州上诉法院判例全文语料库的构建,根植于公开司法记录的数字化汇编传统。该数据集取自Free Law Project旗下CourtListener平台2026年6月30日的批量导出数据,通过明确白名单机制仅纳入法院标识为“wyo”的文书,涵盖主导意见与单独意见,并刻意将最小文本长度阈值设定为1字符,以保留包括调卷令驳回、单行命令及判决登记在内的完整公共记录,最终形成16,358份上诉意见文档,切片哈希值亦经校验记录以保障数据完整性与可复现性。
特点
该数据集以无著作权之政府法令为法理基础,依据Banks诉Manchester案及Georgia诉Public.Resource.Org案确立的公共领域原则,将司法意见作为不可版权之作品予以释出,并以CC0 1.0协议封装。其显著特征在于完整性与真实性的兼顾:15,317份文档(93.6%)载有2,000字符以上文本,943份(5.8%)介于200至1,999字符,98份(0.6%)不足200字符,且短文本并非错误而是调卷令驳回等真实记录,研究者可依文本长度自行筛选实质性意见,从而在保持公共记录原貌的同时赋予使用灵活性。
使用方法
该数据集遵循docketx record v1格式,每行存储一份意见文档,字段涵盖标识符、文书类型、管辖区域、标题、文本、来源、许可、检索时间,并附引证、法院、日期及包含CourtListener意见与簇标识的扩展信息,与全部docketx数据集保持格式统一。使用者可借助Hugging Face datasets库以单行代码加载,即调用load_dataset("docketx/us-caselaw-wy"),随后依len(text)字段实施筛选,应用于文本检索、文本生成、法律问答及检索增强生成等任务,为法律信息学与计算法学研究提供结构化基础资源。
背景与挑战
背景概述
在司法透明度与法律信息学研究的双重驱动下,州级判例语料库的构建成为法律自然语言处理的基础性工程。怀俄明州判例法数据集(us-caselaw-wy)由DocketRouter项目团队于2026年从Free Law Project的CourtListener批量导出中切分而成,涵盖怀俄明州上诉法院16358份判决文书,旨在为法律检索、文本生成与检索增强生成提供完整的公开记录。该数据集遵循docketx record v1格式,填补了怀俄明州法律文本在开放语料中的空白,为州级司法行为分析与法律AI应用奠定了数据基石。
当前挑战
该数据集所应对的核心领域问题在于法律判例检索与理解的智能化。判例文本篇幅漫长、术语密集且逻辑嵌套复杂,模型须精准捕捉争议焦点与裁判要旨,方能实现可靠的引用检索与生成。构建过程中的挑战同样显著:原始记录包含大量简短的命令、调卷令拒绝等非实质性文书,需在完整性与可用性之间谨慎权衡;同时须确保来源的权威性、时间切片的可复现性以及公共领域许可的合规性,避免引入任何注释或权利主张,从而维持语料的中立与纯净。
常用场景
经典使用场景
在计算法学与法律信息检索领域,该数据集最为经典的应用在于构建判例全文检索与文本生成系统。研究者以怀俄明州上诉法院的裁判文书为语料,训练面向法律领域的稠密检索模型,或借助检索增强生成架构,使语言模型能够在回答法律问题时回溯至具体判例原文。由于文本保留完整的裁判理由与判决主文,其亦常被用于法律摘要生成、判决预测及引用关系抽取等任务的基准评测,成为连接信息检索与文本生成两类任务的桥梁型资源。
解决学术问题
该数据集有效缓解了美国州级司法文书公开语料稀缺与分布不均的学术困境。长期以来,法律自然语言处理研究多聚焦于联邦最高法院或少数大州,怀俄明州等司法辖区的判例长期缺席于公开语料库。此数据集以完整公开记录为原则,未经过度筛选,保留了简式裁定与判决登记等短文本,使研究者得以考察长尾司法行为与文书类型差异对模型性能的影响,进而推动法律文本分类、检索公平性与跨辖区迁移学习等议题的实证研究。
衍生相关工作
该数据集隶属于DocketRouter法律语料体系,其格式规范与同类州级判例数据集保持一致,因而衍生出一系列跨数据集的法律检索与生成研究。围绕该资源,已有工作探索法律领域的检索增强生成基准、判例引用网络分析以及州法问答系统的构建。其与Free Law Project及CourtListener生态的衔接,亦促进了公共领域司法文本在开源模型训练与法律科技评测中的复用,形成了以公开判例为核心的数据共享与方法迁移链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务