us-caselaw-de
收藏官方服务:
资源简介:
Delaware Case Law 数据集包含来自美国特拉华州上诉法院的23,480份公开意见文档,数据源自Free Law Project的CourtListener批量导出(2026-06-30)。覆盖三个法院:特拉华州最高法院(del)、特拉华州衡平法院(delch)和特拉华州孤儿法院(delorphct)。文档包含主意见和单独意见,排除长度小于1字符的文档。其中17,449份(74.3%)超过2000字符,2,309份(9.8%)在200-1999字符之间,3,722份(15.9%)少于200字符(如调卷令驳回、单行命令等真实记录)。每条记录遵循docketx record v1格式,字段包括:唯一标识、文档类型、管辖区域、标题、文本、来源、许可、检索时间、引用、法院、日期和额外信息(CourtListener意见/案件ID、意见类型)。该数据集适用于文本检索(RAG)、文本生成、法律NLP和法律研究等任务。所有司法意见均为公共领域作品,数据集以CC0 1.0许可发布。
创建时间:
2026-09-06
搜集汇总
数据集介绍

构建方式
该数据集源自Free Law Project旗下CourtListener平台于2026年6月30日发布的批量导出数据,通过显式白名单机制精确提取特拉华州三个上诉法院(法院标识符为del、delch与delorphct)的裁判文书,最终汇聚为23,480份上诉意见文档。数据构建过程中仅保留主意见与独立意见,排除长度不足1字符的无效记录,并对切片文件施以SHA-256校验,以确保数据来源的可追溯性与完整性。
使用方法
研究者可借助Hugging Face datasets库,以一行代码便捷加载该数据集:load_dataset("docketx/us-caselaw-de")。加载后所得数据集可直接应用于文本检索、文本生成等任务,亦适用于构建法律领域的检索增强生成系统。若需筛选具有实质内容的意见书,可依据文本长度字段len(text)进行过滤。该数据集隶属于DocketRouter法律语料库,使用者可访问其Hugging Face组织主页获取更多相关资源。
背景与挑战
背景概述
法律文本的数字化与开放获取构成计算法学研究的基础设施,而州级判例因其数量庞杂、格式参差,长期缺乏系统化的公开语料供给。在此背景下,Free Law Project 通过 CourtListener 平台持续汇聚全美法院公开裁判文书,docketx 团队据此于2026年6月30日批量导出中切分出特拉华州上诉审意见,形成 us-caselaw-de 数据集。该数据集收录特拉华州最高法院、衡平法院及遗嘱认证法院的23,480份裁判文书全文,采用统一的 docketx record v1 格式封装,以 CC0 1.0 协议释出,为法律检索、检索增强生成及法律自然语言处理研究提供了权威且可自由使用的州法语料,其价值在于将公有领域的司法文本转化为机器可读的标准化资源,降低法律人工智能研究的语料门槛。
当前挑战
本数据集所回应的领域问题在于美国州级判例法检索与理解的高门槛:特拉华州作为全美公司注册与商事纠纷的司法重镇,其衡平法院判例对公司治理与并购实务具有准立法性影响,然而判例文本冗长、程序性文书与实体裁判混杂、引用体系繁复,给自动化检索与生成带来显著困难。构建过程中的挑战同样突出:原始批量导出涵盖多法院、多意见类型,需以显式白名单精确切分以避免前缀匹配引入无关记录;文书长度分布极不均衡,逾一成五的文档不足200字符,多为调卷令驳回或单行命令等真实但简短的记录,如何在保持公开记录完整性与提供实质性意见之间取得平衡,需要依赖长度过滤等下游策略而非预筛删除;此外,同一案件的牵头意见与协同、异议意见并存,文档去重与归属标注亦构成技术难点。
常用场景
经典使用场景
在计算法学与法律信息检索领域,判例全文语料库长期承担着支撑类案检索与裁判规律挖掘的基础性角色。us-caselaw-de汇集了特拉华州三个上诉法院的23,480份公开裁判文书,其docketx记录格式统一、来源可溯,天然适配检索增强生成、法律问答与长文本建模等任务。研究者可将其用作法律语言模型的微调语料,或构建以判例为知识源的检索索引,服务于法官、律师与学者的判例查询需求。
解决学术问题
法律人工智能研究长期受制于高质量判例语料的稀缺,尤其州级上诉法院的完整公开记录更难以获取。该数据集以min_chars=1保留全部公开记录,涵盖实质意见书与简式命令,使研究者得以考察裁判文书的完整分布,而非仅聚焦长篇意见。其明确的法院白名单与切片哈希校验,缓解了语料边界模糊与可复现性不足的痼疾,为类案检索、判决预测与法律文本生成等议题提供了可验证的数据基础。
实际应用
在实务层面,该数据集可嵌入法律检索平台与智能问答系统,帮助律师快速定位特拉华州公司法与衡平法领域的相关判例,降低跨州法律检索的成本。律所与法律科技公司亦可借助其训练面向合同审查、尽职调查与合规分析的语言模型。由于语料源自公有领域且以CC0发布,商业与非商业应用均无障碍,为法律服务的数字化转型提供了低门槛的数据支撑。
数据集最近研究
最新研究方向
在计算法学与法律信息检索的交汇处,us-caselaw-de数据集凭借其完整的特拉华州上诉法院公开记录全文,正驱动着面向司法裁判预测与法律论证挖掘的前沿探索。研究者日益关注利用该语料构建检索增强生成系统,以缓解大语言模型在州法适用中的事实性幻觉,并支撑跨判例的类比推理。伴随美国各州法院数字化公开进程与生成式人工智能介入法律服务的监管辩论,此类未经筛选的完整判例集合为评估模型在长尾程序性裁定与实质性意见间的判别能力提供了不可替代的基准。其公共领域属性亦促进开放法律数据的可复现研究,对提升司法透明与法律人工智能的可问责性具有深远意义。
以上内容由遇见数据集搜集并总结生成




