遇见数据集

us-caselaw-or

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Oregon Case Law 数据集包含来自美国俄勒冈州上诉法院(包括俄勒冈州最高法院和俄勒冈州上诉法院)的 86,341 份司法意见全文。这些数据来源于 Free Law Project 的 CourtListener 平台于 2026 年 6 月 30 日的批量导出,并进行了切片处理。数据集涵盖主意见和单独意见,保留所有文档(包括字符数极少的调卷令拒绝、单行命令和判决条目),以提供完整的公共记录。文档长度分布为:74.0% 超过 2,000 字符,11.6% 在 200-1,999 字符之间,14.5% 少于 200 字符。数据采用 docketx record v1 格式,每行一条意见,包含 id、doc_type(文档类型)、jurisdiction(司法管辖区)、title(标题)、text(文本)、source(来源)、license(许可证)、retrieved_at(检索时间)、citation(引证)、court(法院)、date(日期)以及 extra(CourtListener 意见/集群 ID、意见类型)等字段。所有司法意见均属于公共领域无版权作品,本数据集以 CC0 1.0 许可证发布,仅重新分发公共领域法院文本,不添加任何标注,不主张任何权利。该数据集适用于文本检索(text-retrieval)、文本生成(text-generation)以及法律自然语言处理(legal NLP)、RAG 等任务。

创建时间:
2026-09-06
搜集汇总
数据集介绍
us-caselaw-or 数据集图片
构建方式
该数据集源自Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出记录,通过显式白名单机制精确筛取俄勒冈州上诉法院与俄勒冈州税务法院两个司法辖区的公开裁判文书。在构建过程中,研究团队以案件意见为基本单元,逐条提取主意见与独立意见,仅剔除文本长度不足一个字符的异常记录,最终形成包含86,341份文档的完整公共记录切片。每份文档均遵循统一的docketx record v1格式,涵盖标识符、文书类型、司法辖区、标题、正文、来源、许可协议、获取时间以及引证信息、法院、日期等结构化字段,并保留CourtListener意见与集群标识作为扩展元数据。
使用方法
研究者和开发者可通过Hugging Face datasets库以一行代码便捷加载该数据集,即调用load_dataset函数并指定数据集标识符docketx/us-caselaw-or。加载后,用户可根据研究目的对文本长度进行筛选,例如仅保留正文超过2,000字符的实质性意见,以排除简短的程序性记录。该数据集适用于法律文本检索、文本生成、检索增强生成以及法律自然语言处理等任务,亦可作为俄勒冈州司法裁判规律实证研究的语料基础。使用时需注意其公有领域属性,遵守CC0 1.0协议,并尊重数据来源的学术引用规范。
背景与挑战
背景概述
法律判例文本的数字化与开放获取,构成了计算法学与法律信息检索研究的基础设施。俄勒冈州判例法数据集(us-caselaw-or)源自Free Law Project旗下CourtListener于2026年6月30日发布的公共记录批量导出,涵盖俄勒冈州最高法院与上诉法院的86,341份上诉意见书全文。该数据集由DocketRouter法律语料库项目整理发布,以CC0 1.0协议开放,旨在为法律文本检索、生成式问答及检索增强生成(RAG)等任务提供权威、可复现的州级判例语料。其核心贡献在于以统一格式保存完整的公共记录,为法律自然语言处理研究提供了高质量的基准资源,对推动判例检索与法律智能系统的发展具有重要价值。
当前挑战
法律判例数据集的构建与利用面临多重挑战。在领域问题层面,判例文本篇幅冗长、结构异质,且包含大量援引、程序性表述与独立意见,如何实现精准的段落级检索与语义匹配,仍是法律信息检索的核心难题。在数据集构建层面,需从海量公共记录中精确切分特定司法辖区的文档,避免法院标识的前缀误匹配,并妥善处理大量不足200字符的简式裁定与命令,以在保留完整公共记录与提供实质性意见之间取得平衡。此外,判例文本的时效性、司法管辖差异以及缺乏标注信息,也为模型训练与评估带来了显著困难。
常用场景
经典使用场景
在计算法学与法律信息检索领域,判例文本语料的构建历来是支撑实证研究与智能法律系统的基石。俄勒冈州判例法数据集汇聚了该州上诉法院及上诉税务法院的八万余份公开裁判文书,天然适配法律文本检索与长文本生成两大任务范式。研究者可依托其完整文本开展判例相似度匹配、裁判要旨抽取、判决结果预测等经典实验;亦可将其作为检索增强生成系统的外部知识库,为法律问答与文书起草提供可溯源的事实依据。该数据集刻意保留篇幅短小的程序性裁定与调卷令驳回记录,使得基于完整公开记录的检索评测更贴近司法实践的真实分布。
解决学术问题
法律人工智能研究长期受制于高质量、可自由使用的判例语料稀缺,商业数据库的许可限制与隐私脱敏需求往往令大规模实证分析难以复现。该数据集以政府法令不具著作权之法律原则为依据,将俄勒冈州上诉审裁判文书以CC0协议完整释放,有效化解了数据获取的合法性障碍与可重复性危机。其统一的记录格式与明确的时间切片,为跨州判例比较、司法决策的计量建模、法律语言模型的领域适应预训练等议题提供了标准化基准,推动了法律自然语言处理从封闭语料向开放科学范式的转型。
实际应用
在实务层面,该数据集可直接服务于律师事务所与法律援助机构的智能检索系统建设,帮助执业者快速定位俄勒冈州上诉法院在特定争点上的裁判立场与说理脉络。法律科技企业可借助其训练面向州级管辖权的判决预测与风险评估工具,辅助诉讼策略的制定。对于公共政策研究机构而言,完整的判例时间序列为观察特定法律议题的司法演化提供了实证素材。此外,该数据集亦可用于构建面向法律文书生成任务的微调语料,提升通用大模型在裁判说理与法律论证方面的专业表现。
数据集最近研究
最新研究方向
在计算法学与法律信息学交叉领域,面向特定司法辖区判例文本的细粒度挖掘正成为前沿热点。us-caselaw-or数据集以俄勒冈州上诉法院公开裁判文书为对象,其无标注、全量保留的原始文本为检索增强生成(RAG)与法律文本生成任务提供了真实语料基础。近期研究聚焦于利用该数据集构建州级判例检索系统,探索长文本法律论证的语义表征与引用网络重建,并借助其明确的公共领域属性推动开放法律数据治理。该数据集亦助力评估大语言模型在低资源州法场景下的推理能力,对促进司法透明、降低法律研究门槛具有积极意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务