遇见数据集

us-caselaw-ks

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Kansas Case Law 数据集是一个包含 69,413 份堪萨斯州上诉法院意见全文的公共领域数据集。数据来源于 Free Law Project 的 CourtListener 批量导出(2026-06-30),覆盖两个法院 ID:kan(堪萨斯州最高法院)和 kanctapp(堪萨斯州上诉法院)。数据集包含主意见和单独意见,保留所有公共记录(包括短字符文档,如调卷令拒绝、单行命令和判决条目),最小字符数为1。文档采用统一的 docketx record v1 格式,每行一条记录,字段包括:id(唯一标识符)、doc_type(文档类型)、jurisdiction(管辖范围)、title(标题)、text(全文)、source(来源)、license(许可证)、retrieved_at(检索时间),以及额外的 citation(引用)、court(法院)、date(日期)、extra(CourtListener 意见/案卷ID、意见类型)等。据测量,该数据集中约 82.5% 的文档包含超过 2000 字符,6.8% 包含 200-1999 字符,10.7% 低于 200 字符。数据集以 JSONL.GZ 格式存储,可通过 Hugging Face datasets 库加载,适用于文本检索、文本生成、法律 NLP、RAG(检索增强生成)以及法律研究等任务。数据集采用 CC0-1.0 许可,无附加标注,属于公共领域。

创建时间:
2026-09-06
搜集汇总
数据集介绍
us-caselaw-ks 数据集图片
构建方式
该数据集源自Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出数据,经系统化切片提取堪萨斯州上诉法院的公开裁判文书全文。构建过程采用显式白名单方式锁定kan与kanctapp两个法院标识,避免前缀匹配造成的数据污染,同时纳入主意见与独立意见,仅排除字符数低于1的文档,以确保覆盖完整公共记录。最终形成包含69,413份司法意见的语料库,并通过sha256校验值及切片清单文件保障数据完整性与可追溯性。
特点
数据集具备鲜明的法律领域特征与严谨的结构化属性。其文本长短分布如实反映司法实践原貌:82.5%的文档承载两千字符以上的实质性论述,6.8%居于两百至一千九百九十九字符区间,而10.7%的短文本亦属真实司法记录,包括调卷令驳回、单行命令及判决登记等,未作主观剔除。所有条目遵循docketx记录v1规范,统一涵盖标识符、文书类型、司法辖区、标题、正文、来源、许可、检索时间及引证、法院、日期等扩展字段,为法律信息检索与生成任务提供格式一致、来源可靠的基础资源。
使用方法
研究者可借助Hugging Face datasets库以单行代码加载该数据集,直接获取结构化的司法文书集合。针对文本检索与生成等不同任务,使用者可依据正文长度字段进行灵活筛选,若聚焦实质性裁判理由,可设定字符数阈值以滤除简短程序性记录;若追求完整公共档案则保留全部条目。每条记录所附的法院标识、日期、引证与来源信息,能够支持按司法辖区、时间跨度或引证关系展开细粒度分析。该数据集隶属DocketRouter法律语料体系,可与同系列其他州法数据集协同用于法律自然语言处理研究。
背景与挑战
背景概述
在自然语言处理迈向专业垂直领域的浪潮中,法律文本的数字化与开放获取成为计算法学与智能检索研究的重要基石。美国各州判例法卷帙浩繁,却长期散落于封闭数据库或非结构化网页,掣肘了法律检索、论证挖掘与判决预测等任务的进展。us-caselaw-ks数据集正是在这一背景下应运而生,由DocketRouter团队基于Free Law Project于2026年发布的CourtListener批量导出数据构建,收录堪萨斯州上诉法院及上诉法庭共69,413份公开裁判文书。该数据集以docketx记录格式统一封装,涵盖主意见与独立意见,为法律信息检索、文本生成及检索增强生成提供了大规模、高质量且权属清晰的州级判例语料,显著降低了法律NLP研究的准入门槛。
当前挑战
从领域问题观之,该数据集致力于缓解州级判例法检索与理解中的双重困境:一方面,判例文书篇幅冗长、术语密集且论证结构复杂,传统检索模型难以精准捕捉法律争点与裁判要旨之间的语义关联;另一方面,不同州法院文书格式迥异,跨辖区泛化始终是法律文本建模的痛点。就构建过程而言,挑战同样不容小觑。原始记录中短文本占比逾一成,包含调卷令驳回、单行命令等非实质性文书,如何在保持完整公开记录的同时引导用户有效过滤,成为数据使用中的现实难题;此外,法院标识须以显式白名单精确匹配,杜绝前缀误配,而文书去重、时间戳对齐与许可合规性审查亦需细致处理,方能确保语料在规模与质量之间取得平衡。
常用场景
经典使用场景
在计算法学与法律信息检索领域,大规模判例语料库始终是驱动智能法律系统的核心基础设施。us-caselaw-ks数据集汇聚了堪萨斯州上诉法院与上诉税务法院的六万余份公开裁判文书,其完整保留简短裁定与判决记录的做法,为法律文本检索、判例摘要生成以及判决结果预测等经典任务提供了原始而全面的语料支撑。研究者常以此构建检索增强生成系统,通过密集检索模型从海量意见书中定位与待决案件事实最为契合的先例,进而辅助法律论证与裁判说理。该数据集亦被用于训练和评测长文本法律摘要模型,以检验模型对司法意见结构及裁判逻辑的把握能力。
衍生相关工作
作为DocketRouter法律语料库的组成部分,us-caselaw-ks与同系列其他州级判例数据集共享统一的docketx记录模式,从而催生了一系列跨州法律检索与多辖区判决预测的比较研究。基于该数据集,研究者开发了面向法律长文本的检索增强生成流水线,并衍生出判例引用网络分析与裁判要旨自动抽取等经典工作。其与CourtListener批量导出的血缘关系,使得基于Free Law Project生态的诸多工具链得以直接适配,例如法律问答基准的构建与法律语言模型的持续预训练。这些衍生工作共同丰富了开放法律数据的研究版图,并为后续州级判例资源的系统化整合奠定了方法基础。
数据集最近研究
最新研究方向
在计算法学与法律信息学交叉领域,堪萨斯州判例法数据集正驱动着面向司法推理的检索增强生成系统向纵深演进。前沿探索聚焦于长文档法律论证的细粒度检索与生成一致性,利用该数据集完整的州上诉法院意见文本,构建可追溯的法律问答与判决预测模型。伴随公共领域判例文本大规模开放的运动,该数据集为法律检索与文本生成任务提供了无版权障碍的基准资源,其保留的简式裁定与调卷令驳回记录亦推动了对司法程序性文书的识别研究。相关热点涉及法律领域大模型的事实性幻觉抑制以及跨州判例的迁移学习,对提升法律人工智能的可解释性与司法透明度具有深远影响,并为比较法视野下的州级司法实证分析奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务