遇见数据集

overthelex/ua-case-outcome-6m

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个用于案件结果预测的乌克兰法院判决数据集,包含6,690,284条来自民事和商业法院的实质性判决,时间跨度为2008年至2026年。数据集从乌克兰国家法院判决登记处(EDRSR)提取,并按三个战时时期(战前:2008-2013年、混合战争:2014-2021年、全面战争:2022-2026年)进行时间划分,以反映乌克兰法律历史的不同阶段。每个时期的数据按时间顺序分为训练集、验证集和测试集(80/10/10)。数据集字段包括:文本(判决的事实部分)、标签(案件结果:批准、驳回或部分批准)、语言(始终为乌克兰语)、管辖范围(民事或商业)、判决日期和文档ID。任务是基于事实部分预测案件结果,适用于法律NLP研究,特别是时间概念漂移分析。

The largest publicly available dataset of Ukrainian court decisions for case outcome prediction, extracted from the State Court Decisions Registry (EDRSR). Contains 6,690,284 substantive decisions from civil and commercial courts spanning 2008--2026, with temporal splits across three wartime epochs (pre-war: 2008-2013, hybrid war: 2014-2021, full-scale: 2022-2026). The dataset is structured with chronological train/validation/test splits (80/10/10) for each epoch, reflecting distinct phases of Ukrainian legal history. Features include: text (facts section of the decision), label (case outcome: approved, dismissed, or partial), language (Ukrainian), jurisdiction (civil or commercial), adjudication date, and doc_id. The task is to predict the case outcome based on the facts section, suitable for legal NLP research, especially temporal concept drift analysis.

提供机构:
overthelex
搜集汇总
数据集介绍
overthelex/ua-case-outcome-6m 数据集图片
构建方式
该数据集源自乌克兰国家法院判决登记处(EDRSR),从超过1亿份司法文档中提取了约1260万份民事和商事法院的实质性判决,进一步通过正则表达式从判决主文部分解析案件结果,筛选出约670万份可解析结果的判决。数据集按判决日期进行时间划分,分为战前(2008–2013)、混合战争(2014–2021)和全面战争(2022–2026)三个时期,每个时期独立构建训练、验证和测试集(80/10/10比例),以模拟真实部署条件下的时序预测场景。文本预处理包括对匿名标记(如ОСОБА_1)进行归一化处理。
使用方法
使用HuggingFace的datasets库即可加载该数据集,通过指定配置名称(如pre_war、hybrid_war或full_scale)选择对应时间时期的子集。可直接调用split参数获取训练、验证或测试划分,例如`load_dataset('overthelex/ua-case-outcome-6m', 'full_scale', split='test')`。该设计支持跨时期评估,用户可将早期数据用于训练,后期数据用于测试,以度量模型在司法实践变迁中的鲁棒性。数据集适配文本分类任务,输入为事实段文本,输出为三分类标签,适合训练和评估法律领域自然语言理解模型。
背景与挑战
背景概述
在自然语言处理与法律人工智能的交叉领域,司法裁判预测已成为一项具有深远意义的前沿课题,其核心在于利用算法从法律文书中自动推断案件结果。ua-case-outcome-6m数据集由Volodymyr Ovcharov于2025年创建,源自乌克兰国家法院判决登记处(EDRSR),这一全球最大的开放司法数据库之一。该数据集聚焦于乌克兰民事与商事法院的实质性判决,包含约670万条记录,时间跨度从2008年至2026年,并按历史时期划分为战前、混合战争及全面战争三个时间切片,旨在系统性地研究法律环境变迁对裁判结果预测的影响。作为法律自然语言处理领域的重要资源,该数据集不仅支持多分类任务(诉讼请求被完全支持、部分支持或驳回),还为评估模型在时间推移下的性能衰减提供了独特的基准,推动了跨语言法律理解基准LEXTREME的发展。
当前挑战
该数据集所应对的核心挑战在于法律判决预测中的时序动态适应性与标签不平衡问题。首先,司法判决高度依赖特定时代的社会、政治与法律背景,乌克兰在过去十余年间经历了主权变更、军事冲突及战时立法,导致裁判逻辑与结果分布在战前、混合战争与全面战争三个阶段呈现显著漂移,这要求模型具备在时序分割下评估泛化能力,而非简单依赖随机划分。其次,标签分布呈现极端不均衡,战前时期‘完全支持’判决占比高达78.8%,而‘驳回’仅占5.2%,这种偏斜给分类器的训练与评估带来严重困难。此外,数据构建过程中面临来自百万级文档中提取可解析判决结果的工程挑战,包括正则表达式抽取结果的精度控制、匿名化标记(如将个人信息统一为[PERSON]等)的自然语言特征损失,以及跨时期法庭管辖权变更导致的关联性下降,这些因素共同构成了该数据集在学术与应用层面的多重挑战。
常用场景
经典使用场景
在司法人工智能领域,ua-case-outcome-6m数据集被广泛用于构建判决结果预测模型。研究者利用该数据集提供的案件事实部分(ВСТАНОВИВ)作为输入,通过文本分类技术预测民事与商事案件的最终判决走向,包括完全支持、驳回或部分支持三种类别。该数据集规模宏大,包含近670万份乌克兰法院实质性判决,按战前、混合冲突与全面战争三个历史时期进行时间分割,为探究法律文本的时序演化与判决模式变迁提供了独特的数据基础。其经典用法在于训练端到端的法律语言模型,评估模型在不同司法语境下的泛化能力与鲁棒性,是法律自然语言处理领域中一项标杆性的多分类任务资源。
解决学术问题
该数据集直面司法判决预测中的若干核心学术难题。首先,它解决了大规模非英语司法文本的结构化标注问题,为乌克兰语法律NLP研究提供了前所未有的高质量语料。其次,通过引入时间敏感的划分策略,该数据集支持研究司法实践随社会动荡与战争状态演变的概念漂移现象,揭示了法律决策在外部冲击下的稳定性与适应性。此外,该数据集还推动了跨域迁移学习在司法场景中的探索,使研究者能够系统性地分析不同历史阶段的司法文本特征差异。其发布极大地拓展了多语言法律人工智能的研究边界,为评估模型在法律推理与事实理解方面的真实能力赋予了坚实的数据支撑。
实际应用
在现实应用中,基于ua-case-outcome-6m数据集训练的判决预测模型可辅助法律从业者进行案件预判与策略优化。例如,律师和法务部门可利用该模型快速评估诉讼风险,从而在案件受理初期作出更理性的决策。法院内部也可将其用作审判质量监控工具,辅助识别判决中的潜在偏差与不一致之处。在战乱与司法资源紧张的特殊时期,该数据集衍生的模型还能助力法律信息系统的自动化升级,缓解人力资源不足带来的压力。此外,该数据集也服务于法律数据检索与引文分析等下游系统,为构建智能化的司法知识图谱与法律咨询平台奠定了坚实的文本理解基础。
数据集最近研究
最新研究方向
基于乌克兰国家法院判决登记库(EDRSR)构建的ua-case-outcome-6m数据集,聚焦于战时司法语境下的案件结果预测任务,已成为法律自然语言处理领域的前沿基准。该数据集横跨战前(2008–2013)、混合战争(2014–2021)及全面战争(2022–2026)三个历史分期,通过时间分割模拟真实部署场景,揭示司法实践随冲突演变的动态偏移。最新研究围绕其展开跨时期泛化能力评估、裁判文书时效性衰减分析及多语言零样本迁移学习,相关论文如arXiv:2605.17639探讨法律信息检索中时间效应,arXiv:2605.15362构建包含1亿份判决的引文网络,为战时法律稳定性与人工智能辅助裁判的可信度提供了实证基础,对乌克兰司法数字化转型及冲突期间法治连续性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务