遇见数据集

ANNOTARES

收藏
arXiv2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

ANNOTARES是一个专为提取德国法律文本逻辑结构而设计的数据集,由卡尔斯鲁厄应用科学大学创建。该数据集包含539条句子,超过21,500个标注的token,覆盖三部德国联邦法律(BDSG、BAföG、BauGB),并以跨度级别标注了法律条件(Tatbestand)和法律后果(Rechtsfolge)。数据集的创建过程由六名标注员协作完成,采用重叠标注策略并辅以“不确定”标记以排除歧义样本,最终通过自动化工具与人工校正确保高标注质量。该数据集旨在推动法律文本的自动化逻辑结构分析,为法律知识图谱、检索增强生成及神经符号推理等下游任务奠定基础,从而解决现有方法难以精确解析法律规范中条件与后果关系的核心挑战。

ANNOTARES is a dataset specifically designed for extracting the logical structure of German legal texts, created by Karlsruhe University of Applied Sciences. This dataset contains 539 sentences and over 21,500 annotated tokens, covering three German federal laws (BDSG, BAföG, BauGB), and annotates legal conditions (Tatbestand) and legal consequences (Rechtsfolge) at the span level. The dataset's development was a collaborative effort by six annotators, who adopted an overlapping annotation strategy supplemented with "uncertain" markers to exclude ambiguous samples, and ultimately ensured high annotation quality through automated tools and manual verification. This dataset aims to promote automated logical structure analysis of legal texts, lay a foundation for downstream tasks such as legal knowledge graphs, retrieval-augmented generation, and neural-symbolic reasoning, thereby addressing the core challenge that existing methods struggle to accurately parse the relationship between conditions and consequences in legal norms.

创建时间:
2026-08-05
搜集汇总
数据集介绍
构建方式
ANNOTARES数据集的构建基于德国联邦法律文本的精细标注,覆盖了《联邦数据保护法》(BDSG)、《联邦教育培训援助法》(BAföG)和《联邦建筑法典》(BauGB)三部法典。为准确切分句子,研究团队采用自动化分割与人工校正相结合的策略,并设计了一套定制化的Python标注工具,以降低非专业标注者的认知负荷。整个语料由六名标注者协作完成,每句至少获得两名独立标注者的标注,并通过专家基线确保一致性。最终,数据集包含539个句子,超过21,500个标注令牌,其中约43.8%标记为法律后果(Rechtsfolge),42.8%标记为法律条件(Tatbestand),其余为背景类(none)。
特点
ANNOTARES数据集的核心特点在于其专门针对德国成文法的逻辑结构进行跨度级标注,这在现有法律NLP资源中尚属首创。数据集不仅覆盖多个法律领域,还特别设计了跨法规的泛化测试集,以评估模型在不同法律文本间的迁移能力。标注过程中采用了严格的准则,强调法律条件与法律后果的成对出现约束,并通过对标注者间一致性的多维度分析(Krippendorff's alpha介于0.893至0.926之间)确保了数据的高质量。此外,数据集还提供了丰富的语言特征,如依存句法信息,为传统机器学习模型和深度学习模型的研究提供了有力支持。
使用方法
ANNOTARES数据集可用于训练和评估序列标注模型,以实现对德国法律文本中法律条件(Tatbestand)与法律后果(Rechtsfolge)的自动识别与切分。研究者可基于其提供的训练集(BDSG)开发模型,并在域内测试集(BDSG)及跨域测试集(BAföG、BauGB)上评估性能,从而测试模型的泛化能力。该数据集支持多种方法,包括传统的CRF、BiLSTM,以及基于Transformer的模型(如mBERT)和大型语言模型(LLM)。此外,数据集附带的依存句法特征可帮助研究者进行消融实验,以探究语言结构信息对任务性能的影响,进而推动法律智能化处理技术的发展。
背景与挑战
背景概述
ANNOTARES数据集由Karlsruhe University of Applied Sciences的Ronja Schwarz和Jannik Strötgen于2026年创建,旨在解决德国成文法中法律要件(Tatbestand)与法律后果(Rechtsfolge)的自动识别与切分问题。该数据集涵盖三部德国联邦法律,包含超过400条人工标注句子,并以高一致性(Krippendorff's α=0.89)著称。作为首个针对法律文本逻辑结构抽取的序列标注数据集,ANNOTARES填补了LegalNLP领域在逻辑成分提取上的空白,为法律科技中的自动化推理提供了基础资源,并推动了跨法规泛化能力的研究。
当前挑战
该领域面临的核心挑战在于德国法律文本的复杂句法结构,其高度嵌套的表达和隐含的法律语境使得自动解析极为困难,即便现代LLM也难以直接转换。构建过程中,团队需应对句子切分的不确定性、标注准则的歧义性(如条件与后果的依存关系),以及非专家标注的一致性维护。此外,有限的训练数据(351句)对传统模型构成泛化瓶颈,而跨法规测试集则进一步考验模型的迁移能力,凸显了精确边界检测与逻辑结构理解的深层难度。
常用场景
经典使用场景
ANNOTARES数据集的核心应用场景在于德语成文法文本的逻辑结构抽取,具体任务为识别并切分法律规范中的构成要件(Tatbestand)与法律后果(Rechtsfolge)。该数据集提供了来自三部德国联邦法律(联邦数据保护法、联邦教育促进法、联邦建筑法典)的句子级跨度标注,支持对法规条文进行细粒度的序列标注研究。研究者可利用该数据集训练和评估各类序列标注模型,包括条件随机场、双向长短时记忆网络及其变体,以及基于Transformer架构的预训练语言模型,从而探索法律文本中复杂句法结构与逻辑成分之间的映射关系。该数据集的设计兼顾了领域内性能评估与跨法规泛化能力测试,为法律自然语言处理提供了标准化的基准。
衍生相关工作
ANNOTARES的发布催生了若干衍生研究方向,推动了逻辑感知型法律NLP的蓬勃发展。首先,基于该数据集的基准评估激发了对跨法规泛化能力的深入探究,促使研究者开发面向多法域、多语言的法律文本逻辑抽取模型,并探索利用大型语言模型进行零样本或少样本抽取的可行性。其次,该数据集所定义的标注框架被引为范例,启发了对法律文本中其他逻辑元素(如例外条款、定义条款)的识别任务。此外,结合该数据集的结构化特征分析,促进了融合句法依赖信息的混合模型发展,以及针对法律语料微调的领域专用解析器的研发,从而扩展了法律文本自动处理的技术谱系。
数据集最近研究
最新研究方向
ANNOTARES数据集的提出标志着法律文本逻辑结构自动解析领域的一项前沿突破,其核心研究方向聚焦于对德国成文法中法律要件(Tatbestand)与法律后果(Rechtsfolge)的细粒度识别与分割。该数据集覆盖三部重要联邦法律,提供超过21500个标注词元的跨度级注释,并以高信度的注释者间一致性为基准,为法律自然语言处理(LegalNLP)研究提供了高质量的语料支撑。当前研究热点集中于利用预训练Transformer模型(如mBERT)及大规模语言模型(LLM)在零样本与少样本情境下解析复杂法律句法结构,同时通过跨法规泛化实验验证模型在不同法律领域的适应性。这一方向与“法律即代码”(Law as Code)等立法现代化倡议相辅相成,为自动化法律推理、法律知识图谱构建及检索增强生成(RAG)系统奠定了结构化文本基础,对推动智慧司法与合规科技的发展具有重要意义。
相关研究论文
  • 1
    ANNOTARES: A Dataset for Extracting Logical Structures from German Statutory Texts卡尔斯鲁厄应用科学大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务