遇见数据集

HierLegalBERT

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

HierLegalBERT是一个专门用于印度最高法院判决分析的法律自然语言处理数据集。该数据集基于OpenNyaya语料库(1950-2023年),包含超过19,000个印度最高法院判决文档,总计约1.79亿词元。数据集的核心特点是完整保留了判决文档的层级结构:每个判决被系统性地划分为五个结构部分——序言(案件标题、法庭信息)、事实(事件叙述)、论点(律师陈述)、分析(法庭推理)和命令(最终处置)。数据预处理流水线通过自动化的规则和正则表达式方法,为每个句子生成丰富的标注信息,包括词元序列、词元类型(法律术语、数字、普通文本)、条款分类标签(10个类别如保释、处罚、管辖权等)以及判决结果标签(驳回/允许/部分允许)。此外,数据集还支持多法官意见中的矛盾对挖掘。该数据集专门设计用于支持四项NLP任务的联合训练:命名实体识别(识别当事人、法庭、IPC条款、日期、引用等实体)、条款分类、判决结果预测和矛盾检测。通过引入脚本类型嵌入、章节类型位置编码和不确定性加权多任务学习等创新机制,HierLegalBERT为印度法律NLP研究提供了一个结构完整、标注丰富、可复现的基准数据集。

HierLegalBERT is a legal natural language processing (legal NLP) dataset specifically designed for the analysis of judgments from the Supreme Court of India. Built upon the OpenNyaya corpus spanning 1950 to 2023, it contains over 19,000 judgment documents from the Indian Supreme Court, with a total of approximately 179 million tokens. A core characteristic of this dataset is that it fully retains the hierarchical structure of the original judgment documents: each judgment is systematically divided into five standardized structural sections: preamble (case title, court information), facts (event narration), arguments (lawyers' submissions), analysis (court's reasoning), and orders (final dispositions). The dataset's preprocessing pipeline employs automated rule-based and regular expression methods to generate rich annotation information for each sentence, including token sequences, token types (legal terms, numerals, plain text), clause classification labels (10 categories including bail, penalty, jurisdiction, etc.), and judgment outcome labels (dismissed, allowed, partially allowed). Furthermore, the dataset supports the mining of contradictory opinion pairs across multiple judicial opinions. This dataset is specifically engineered to support joint training for four core NLP tasks: Named Entity Recognition (NER) (identifying entities such as parties, courts, IPC clauses, dates, citations, etc.), clause classification, judgment outcome prediction, and contradiction detection. By introducing innovative mechanisms including script type embeddings, section-type positional encoding, and uncertainty-weighted multi-task learning, HierLegalBERT provides a structurally complete, richly annotated, and reproducible benchmark dataset for Indian legal NLP research.

创建时间:
2026-06-29
原始信息汇总

HierLegalBERT 数据集概述

基本信息

  • 数据集名称: HierLegalBERT (Hierarchical Legal BERT for Indian Supreme Court Judgment Analysis)
  • 语言: 英语 (en)
  • 领域: 法律数据、判决书 (legal-data, judgements)
  • 许可证: MIT License

数据集来源与构成

  • 语料库: OpenNyaya Corpus (1950–2023)
  • 原始文件: 32,877 份判决书文档
  • 有效标注文档: 约 19,000–22,000 份
  • 总词元数: 约 1.79 亿
  • 判决分布: 驳回 (dismissed) 约 60%,支持 (allowed) 约 35%,部分支持 (partly allowed) 约 5%
  • 矛盾检测对: 约 870 个银标签句子对,来自 211 份多法官判决

数据结构

数据集经过管道处理后输出为 JSONL 格式(train.jsonlval.jsonl),每个文档包含:

  • doc_id: 文档唯一标识
  • preamble: 案件名称、日期、上诉编号、引用的法律条文
  • sections: 按 5 个结构章节组织的句子列表,每个句子包含文本、词元、词元类型 ID、子句标签
  • judgment_label: 判决标签(0 或 1)
  • judge_opinions: 法官意见
  • primary_judge: 主审法官

文本结构章节

章节 ID 章节名称 描述
0 Preamble 案件标题、法庭、管辖权、上诉编号
1 Facts 事件叙述、当事人、背景
2 Arguments 律师陈述、提出的争议点
3 Analysis 法院推理、先例引用
4 Order 最终处理、费用、指示

子句分类(10 类)

  • bail(保释)、penalty(刑罚)、jurisdiction(管辖权)、liability(责任)、prosecution_withdrawal(起诉撤回)、tax_assets(税务资产)、constitutional(宪法)、evidence(证据)、precedent(先例)、other(其他)

数据集用途

该数据集支持四项联合任务,训练方式为多任务学习:

  • NER(命名实体识别): BIO 标签标注,包括当事人、法院、IPC 条文、日期、引证
  • 子句分类: 对每个句子进行 10 类子句分类
  • 判决预测: 二元分类(驳回/支持)
  • 矛盾检测: 三分类(矛盾/蕴含/中立)

训练设置

  • 训练/验证划分: 分层 85/15 划分(按判决标签分层)
  • 最大句子数: 每份文档 30 句
  • 最大词元数: 每句 128 个词元
  • 批量大小: 有效批量 8(BATCH_SIZE=4 × ACCUM_STEPS=2)
  • 混合精度: fp16
  • 梯度检查点: 在 BERT 编码器上启用
  • 早停: 耐心值=3,依据验证损失停止
搜集汇总
数据集介绍
HierLegalBERT 数据集图片
构建方式
HierLegalBERT的构建基于OpenNyaya语料库中1950年至2023年间超过19000份印度最高法院判决书。其数据流水线首先对原始文本进行OCR清洗与多法官意见拆分,随后通过规则解析器将每个句子分配到前言、事实、论点、分析和判决五个结构性章节。在此基础上,系统自动为每个词元分配脚本类型标签(法律术语、数字或普通文本),并通过两阶段关键词匹配生成条款分类标签。判决结果通过正则表达式从结语部分提取,而矛盾检测样本则从多法官意见中挖掘。最终,数据以分层的JSONL格式输出,包含完整的句子、词元及标签信息。
特点
该模型的核心创新在于其三重新颖组件:脚本类型嵌入(Script-Type Embedding)为BERT标准输入增加了第四个嵌入表,区分法律术语、数字与普通文本;章节类型位置编码(Section-Type Positional Encoding)以结构角色而非绝对位置赋予句子位置信号;不确定性加权多任务学习(Uncertainty-Weighted MTL)则通过可学习的噪声参数自动平衡命名实体识别、条款分类、判决预测与矛盾检测四个任务的损失权重,无需手动调参。其层次化编码器架构能够处理完整的判决书文本,有效克服了传统LegalBERT因512词元限制而导致的信息截断问题。
使用方法
用户可通过运行数据流水线脚本准备训练数据,生成训练集与验证集JSONL文件。随后执行训练脚本,该脚本支持在NVIDIA T4或P100等GPU上高效运行,单周期训练约需8至12分钟。模型提供了两种判决模式(二分类与三类),并内置了分层优化器(BERT层与新颖层采用不同学习率)及自动早停策略。用户亦可运行架构验证脚本对合成数据进行前向与反向传播测试。训练完成后,模型会输出最佳检查点、损失曲线与F1曲线图,便于评估各任务上的性能表现。
背景与挑战
背景概述
HierLegalBERT数据集由研究团队为应对印度最高法院判决书结构复杂、篇幅冗长(通常5至15页)而创建,旨在突破传统法律自然语言处理(NLP)模型将判决书视为扁平令牌序列的局限。该数据集基于OpenNyaya语料库(1950–2023年间19,000余份印度最高法院判决书),通过分层编码架构显式建模判决书的结构层次(序言、事实、论点、分析、裁决)。其核心研究问题在于如何使模型在保留长文本完整信息的同时,感知判决书各部分的结构角色,并实现多任务联合学习。作为印度法律NLP领域的公开基线,HierLegalBERT对推动低资源法律语言理解、司法判决预测及矛盾检测等任务具有重要影响。
当前挑战
该数据集面临的挑战主要体现在两方面。领域问题层面,传统模型因512令牌限制常截断判决书关键内容,且缺乏对序言与裁决等不同结构部分的区分能力,导致法律语义理解失真。构建过程中,数据管道需处理OCR错误、多法官意见拆分及结构段落的自动解析;此外,四类任务(命名实体识别、子句分类、判决预测、矛盾检测)的难度差异显著,需要设计自适应权重策略(如不确定性加权多任务学习)以平衡训练信号。部分任务如矛盾检测依赖仅约870个银标签样本,且实体识别因缺乏真实标注而暂无法激活,制约了模型性能的全面评估。
常用场景
经典使用场景
HierLegalBERT作为面向印度最高法院判决文书的层次化法律语言模型,其经典使用场景聚焦于对长篇幅、结构化的法律文档进行多任务联合分析。该模型突破了传统LegalBERT仅能处理512个token的瓶颈,通过句子级编码器与文档级编码器的双层架构,完整表征长达5000至15000个token的判决书全文。在此基础上,模型能够同步执行命名实体识别、条款分类、判决结果预测及矛盾检测四项任务,为印度法律自然语言处理领域提供了首个可复现的公开基线方案。
衍生相关工作
HierLegalBERT的发布激发了一系列后续研究工作的开展。其层次化编码理念催生了面向其他司法管辖区的结构化法律文本建模方案,如基于类似架构的英国判例法分析模型。脚本类型嵌入的创新设计被后续工作扩展为多维度领域特征编码方法,应用于合同审查与法规释义等细分任务。不确定性加权多任务学习框架则被迁移至医疗、金融等其他专业领域的文档分析场景,验证了该策略在非平衡任务协同训练中的普适有效性。
数据集最近研究
最新研究方向
当前,法律自然语言处理领域正经历从扁平文本建模向层级结构感知的范式跃迁,HierLegalBERT的应运而生标志着印度最高法院判决分析迈入结构化多任务学习新纪元。该数据集通过开创性地引入脚本类型嵌入与章节类型位置编码,首次实现了对判决书中前言、事实、论点、分析与裁决五重结构层次的显式建模,其不确定性加权多任务学习框架同步攻克了命名实体识别、条款分类、判决预测与矛盾检测四大法律推理任务。依托1950至2023年间超过19000份OpenNyaya语料库的深度训练,HierLegalBERT不仅突破了传统LegalBERT仅512令牌的截断瓶颈,更以层级注意力机制弥合了法律文本中法条援引、金额日期与普通叙述间的语义鸿沟,为印度三权分立体系下的司法透明化与先例智能检索提供了可复现的基线基准,其在无人工标注条件下的全自动数据管道革新,正推动法律AI从浅层特征工程向结构感知推理的深度转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务