遇见数据集

joelniklaus/greek_legal_ner

收藏
Hugging Face2023-09-27 更新2024-03-04 收录
官方服务:

资源简介:

该数据集包含希腊法律文本的标注语料,用于命名实体识别任务。这是希腊语言中首个如此大规模的命名实体识别数据集,也是少数几个全面研究法律文本实体识别的数据集之一。数据集的语言为希腊语,格式为jsonl,包含训练、验证和测试三个数据分割。数据字段包括发布日期、政府公报类型、单词列表和命名实体标签列表。数据集的创建目的是为了希腊命名实体识别和实体链接。数据集的来源是希腊政府公报,标注工作由论文作者完成。数据集的使用需遵循Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License。

This dataset contains annotated corpora of Greek legal texts, designed for named entity recognition (NER) tasks. It is the first large-scale NER dataset in the Greek language, and one of the few datasets that comprehensively researches entity recognition in legal texts. The dataset is in Greek, formatted as jsonl, and includes three data splits: training, validation, and test sets. Its data fields cover publication date, government gazette type, word list, and named entity label list. The dataset was developed to support Greek NER and entity linking (EL). It is sourced from Greek government gazettes, with annotation work completed by the paper's authors. Usage of the dataset must adhere to the Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License.

提供机构:
joelniklaus
原始信息汇总

数据集概述

数据集名称

  • 名称: Greek Legal Named Entity Recognition
  • 别名: 希腊法律命名实体识别

数据集基本信息

  • 语言: 希腊语 (el)
  • 许可证: CC-BY-NC-SA-4.0
  • 多语言性: 单语种
  • 数据集大小: 10K<n<100K
  • 源数据: 原始数据
  • 任务类别: 令牌分类
  • 任务ID: 命名实体识别
  • 标签: 法律

数据集内容

  • 描述: 该数据集包含一个用于希腊法律文本中命名实体识别的标注语料库。它是希腊语中首个此类扩展形式的数据集,也是少数全面研究法律文本实体识别的数据集之一。
  • 支持任务: 命名实体识别
  • 数据实例格式: jsonl
  • 数据分割: 训练集、验证集和测试集

数据集结构

  • 数据字段:
    • date: 文档发布日期
    • gazette: 政府公报类型(A或D)
    • words: 通过spacy希腊语分词器处理句子得到的令牌列表
    • ner: 命名实体标签列表,包括以下类别:
      • FACILITY
      • GPE
      • LEG-REFS
      • LOCATION-NAT
      • LOCATION-UNK
      • ORG
      • PERSON
      • PUBLIC-DOCS
      • O

数据分割详情

  • 文档分割:
    • 训练集: 23723个文档
    • 验证集: 5478个文档
    • 测试集: 5084个文档
  • NER标签分割:
    • 各标签在不同分割中的实例数量详细列出

数据集创建

  • 创建理由: 创建一个大型希腊语命名实体识别和实体链接数据集
  • 源数据: 希腊政府公报
  • 标注者: 论文作者

许可证信息

引用信息

@inproceedings{Angelidis2018NamedER, author = {Angelidis, Iosif and Chalkidis, Ilias and Koubarakis, Manolis}, booktitle = {JURIX}, keywords = {greek,legal nlp,named entity recognition}, title = {{Named Entity Recognition, Linking and Generation for Greek Legislation}}, year = {2018} }

搜集汇总
数据集介绍
构建方式
该数据集源自希腊政府公报中发布的立法文本,是首个针对希腊语法律领域的大规模命名实体识别(NER)语料库。数据构建过程中,研究者利用spaCy(v3.3.1)的希腊语分词器对原始文档进行句子级别的分词处理,生成序列化的单词列表,并在此基础上采用IOB(Inside-Outside-Beginning)标注体系对每个词赋予实体标签。标注工作由论文作者团队手工完成,覆盖了设施、地缘政治实体、立法引用、自然与模糊位置、组织、人物及公共文件等七类实体。最终数据以JSONL格式存储,并按照文档数量划分为训练集(23,723篇)、验证集(5,478篇)和测试集(5,084篇),确保各实体类型在三个子集中均有分布。
特点
该数据集的核心特色在于其法律领域的专注性与希腊语言的稀缺性,填补了希腊语法律NER资源的空白。实体类别设计充分契合法律文本特性,如专门针对国内或欧盟立法的“LEG-REFS”标签,以及区分官方出版物与一般公共文件的“PUBLIC-DOCS”标签,体现了对法律语境中语义细粒度的深刻把握。此外,数据集保留了文档的元数据字段(如发布日期与公报类别),为时间序列或政策领域相关的实体分析提供了可能。在分布上,各类实体数量虽不均衡,但组织(ORG)、地缘政治实体(GPE)和立法引用(LEG-REFS)占据主体,反映了法律语言中机构与法规频繁提及的典型模式。
使用方法
该数据集可直接用于训练和评估基于token分类的命名实体识别模型,尤其适合对法律文本进行信息抽取与结构化分析。用户可通过HuggingFace Datasets库加载数据,并利用预定义的train、validation和test三组划分进行模型开发。数据字段包含date、gazette、words和ner,其中ner列表使用IOB格式的标签序列,便于与主流深度学习框架(如PyTorch、TensorFlow)中的序列标注模块无缝对接。研究者在使用时应注意,数据集已由Joel Niklaus等人进行格式统一化处理,可能与原论文中的统计结果存在细微差异,建议参考仓库中的转换脚本(convert_to_hf_dataset.py)以理解数据预处理细节,从而确保实验的可复现性。
背景与挑战
背景概述
在法律人工智能领域,命名实体识别(NER)作为信息抽取的核心任务,对于法律文本的自动化处理与知识挖掘具有举足轻重的意义。希腊语作为欧盟官方语言之一,其法律体系源远流长,然而长期以来,针对希腊立法文本的命名实体识别研究却相对匮乏。为填补这一空白,Iosif Angelidis、Ilias Chalkidis 与 Manolis Koubarakis 于2018年在 JURIX 会议上提出了希腊法律命名实体识别数据集,并由 Joel Niklaus 与 Veton Matoshi 后续整理发布。该数据集以希腊政府公报中的立法文本为语料,覆盖设施、地缘政治实体、法律引用、自然位置、模糊位置、组织、人物及公共文件等八大实体类别,是首个针对希腊法律文本进行全谱系实体标注的大规模资源,为低资源语言的法律自然语言处理研究奠定了坚实基础,推动了欧洲多语言法律信息系统的智能化进程。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:希腊法律文本结构严谨、术语专业且实体类型高度交织,例如法律引用(LEG-REFS)与公共文件(PUBLIC-DOCS)的边界模糊,地理实体(GPE)与自然位置(LOCATION-NAT)在语义上存在交叉,这要求模型具备精细的上下文感知能力。此外,实体分布极度不均衡,如自然位置(LOCATION-NAT)在验证集中仅有两个实例,而组织(ORG)与地缘政治实体(GPE)则占据主导,导致模型易产生偏见。在构建过程中,标注工作由论文作者团队手工完成,受限于人力与专业法律知识,标注一致性与覆盖范围难以保证;同时,原始数据源自希腊政府公报的非结构化文本,需经过复杂的清洗与分词流程(基于 spaCy 希腊语分词器),转换过程中可能引入噪声或丢失细粒度语义信息,进一步增加了模型泛化的难度。
常用场景
经典使用场景
该数据集的核心用途在于为希腊语法律文本提供细粒度的命名实体识别(NER)基准。其经典场景涵盖对希腊政府公报中出现的七类实体进行自动标注与提取,包括组织机构、地理政治实体、法律引用、公共文件、人物、设施及自然与未明确定位的地理位置。研究者可借助该语料库训练序列标注模型,以精准识别法律条文中的关键实体,从而支撑法律信息检索、知识图谱构建及司法文书结构化分析等下游任务。作为首个面向希腊语法律领域的全面NER数据集,它为低资源语言的法律自然语言处理研究奠定了重要基石。
实际应用
在实际应用中,该数据集支持希腊司法与行政系统的智能化升级。例如,法律从业者可利用基于该数据训练的NER模型自动从冗长的政府公报中提取法规引用、机构名称及人物信息,从而大幅提升法律检索与案例匹配的效率。在城市规划领域,针对D类公报中频繁出现的设施与地理位置实体,该技术能辅助自动化审核土地开发文件,减少人工审查的疏漏。此外,该数据集还可用于构建法律知识图谱,为希腊公民提供智能法律咨询,或支撑欧盟跨境法律协作中的多语言实体对齐任务,具有显著的社会与经济价值。
衍生相关工作
该数据集衍生了一系列开创性工作,深化了法律自然语言处理的研究边界。Angelidis等人(2018)在JURIX会议上首次提出该语料库,并配套设计了实体链接与生成任务,为希腊法律文本的语义理解提供了多任务框架。后续研究在此基础上拓展了跨语言迁移学习,探索将希腊语法律NER模型适配至其他欧洲语言的可行性。此外,该数据集被整合进法律NER基准测试平台,促进了不同模型架构(如Transformer与CRF)在复杂法律实体识别上的性能对比分析。这些工作不仅验证了数据集在低资源场景下的有效性,还推动了法律文本中稀有实体(如自然位置)识别技术的突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务