遇见数据集

LBOX OPEN

收藏
arXiv2022-10-05 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

首个大规模韩国法律AI数据集,包含一个法律语料库、两个分类任务、两个法律判决预测任务和一个摘要任务。法律语料库由147k韩国判例组成,涉及多个法律任务和案例类型。

This is the first large-scale Korean legal AI dataset, which includes a legal corpus, two classification tasks, two legal judgment prediction tasks, and one summarization task. The legal corpus consists of 147k Korean judicial precedents covering multiple legal tasks and case types.

创建时间:
2022-06-11
搜集汇总
数据集介绍
构建方式
LBOX OPEN的构建始于对韩国裁判文书原始数据的系统性处理。研究团队首先利用基于ResNet的布局分类器将文书页面区分为纯文本或包含表格、图片的混合类型,随后采用Mask-R-CNN架构的布局解析器对非文本元素进行分割。针对PDF格式文档,通过自定义规则解析器提取文本;而对于图像格式文档,则调用商用OCR引擎识别文字,并借助基于韩文字符级Transformer的语言模型校正OCR错误。当机器学习模块的置信度低于阈值时,相应页面由人工处理。最终,所有计算机可读文档以JSON格式存储,包含元信息、判决主文、请求要旨、上诉内容以及由事实、主张、理由和判断构成的说理部分。该流程从韩国政府公开的LAW OPEN DATA获取82,263份裁判文书,并从内部数据库补充65,000份,共计147,000余份文书,构建了包含2.59亿个token的大规模语料库。
特点
该数据集的核心特点在于其多任务覆盖与领域专精性。LBOX OPEN包含一个大规模法律语料库、两个文本分类任务(案由预测与法条预测)、两个法律判决预测任务(刑事与民事)以及一个摘要生成任务,全面覆盖了韩国法律人工智能研究的关键场景。语料库中63,439份文书来自最近四年(2018-2021年),且大量收录了涉及事实审的第一审和第二审判决,这对法律实务工作者具有重要价值。数据集还提供了扩展版本,通过纳入低频案由和长文本序列,增加了任务的挑战性与现实性。此外,研究团队基于该语料库预训练了韩国首个法律语言模型LCUBE,实验证明领域特定语料对于提升分类与摘要任务性能至关重要。
使用方法
研究者可将所有任务统一建模为文本生成问题,利用现成的Transformer模型进行微调。对于案由分类和法条分类任务,模型需根据案件事实预测对应的案由或法条名称,评价指标采用精确字符串匹配。法律判决预测任务中,刑事部分要求模型根据事实预测罚金、有期徒刑和拘役的幅度,民事部分则需基于事实与请求要旨预测诉请认可度,两者均提供了不同粒度的量化标签方案以适配从简单分类到回归的多种难度。摘要任务要求模型根据判决主文和说理部分生成抽象摘要。数据集已预先划分为训练、验证和测试集,并额外提供了来自语料库外裁判文书的测试集以确保公平比较。所有数据与基线模型代码均在GitHub和HuggingFace上公开,便于研究者复现与扩展。
背景与挑战
背景概述
LBOX OPEN 数据集由 LBox 公司与韩国科学技术院(KAIST)的研究人员于 2022 年联合创建,旨在填补韩国法律人工智能领域大规模基准数据的空白。该数据集聚焦于韩国法律文本的理解与判决预测,涵盖语料库、文本分类、法律判决预测及摘要生成等六大任务,包含 14.7 万份判例(2.59 亿词元)。作为首个大规模韩语法律 AI 基准,LBOX OPEN 不仅推动了多语言法律自然语言处理的研究,还为全球法律 AI 领域提供了独特的东方视角与实证基础。
当前挑战
该数据集面临的挑战主要体现在两个方面。在领域问题层面,法律判决预测任务极具难度,模型需从事实描述中推断罚金、劳役刑等具体量刑,且预测结果易受数据偏差影响,如性别偏见可能导致判决不公。在构建过程中,原始判例以图像或 PDF 格式存在,需通过定制化的布局分类、OCR 校正与后处理管线进行结构化,自动化效率仅 53% 至 80%,大量数据仍需人工校验,显著增加了构建成本与复杂性。
常用场景
经典使用场景
在自然语言处理与法律人工智能的交叉领域中,LBOX OPEN 作为首个大规模韩语法律 AI 基准数据集,其经典使用场景聚焦于法律文本的多任务理解与判决预测。该数据集整合了法律语料库、案由分类、法条预测、刑事与民事判决预测以及裁判文书摘要五大任务,为研究者提供了一个统一且多样的评测平台。通过将法律文本生成统一建模为序列到序列任务,研究者能够系统评估模型在事实描述、法律推理和裁判结果生成等核心环节的表现,从而推动法律 NLP 从单一分类向复杂推理的纵深发展。
实际应用
在实际应用层面,LBOX OPEN 所涵盖的任务直接映射到法律实务中的多个痛点环节。案由与法条分类任务可辅助法律咨询系统自动识别案件类型与适用法条,提升律师推荐与案件分流效率。刑事与民事判决预测任务则可作为法官裁判的辅助参考工具,通过对历史判决模式的学习,为量刑建议与赔偿金额估算提供数据驱动的参考依据。裁判文书摘要任务则面向法律从业者的高效阅卷需求,通过自动生成案件摘要,显著降低信息检索与文书梳理的时间成本。这些应用场景不仅提升了法律服务的智能化水平,也为司法透明度和效率的提升奠定了技术基础。
衍生相关工作
LBOX OPEN 的发布催生了一系列衍生研究工作,特别是在韩语法律语言模型与多任务学习范式的探索上。基于该数据集预训练的 LCUBE 模型,作为首个针对韩语法律领域的大规模语言模型,为后续领域自适应与迁移学习研究提供了基线。该数据集的分类与判决预测任务设计启发了研究者对法律文本中事实与判决之间因果关系的建模,推动了可解释法律判决预测的发展。此外,数据集中的裁判文书摘要任务激发了针对长文本摘要生成的研究,尤其是如何有效处理法律文书中冗长的推理与裁决部分。这些衍生工作不仅丰富了法律 NLP 的研究生态,也为其他语种的法律基准构建提供了可复用的范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务