遇见数据集

kathnlp-treebank

收藏
github2026-05-30 更新2026-06-03 收录
官方服务:

资源简介:

kathnlp构建了第一个针对Katharevousa希腊语的可复现NLP管道,这是一种在20世纪希腊法律、行政和议会话语中使用的官方古语化语体。该项目发布了一个冻结的、UD风格的带注释参考集,包含1,697个句子;一个固定的训练/测试分割和一个共享的评估协议;以及用于生成这些数据的构建、注释、训练和评估代码。

KathNLP developed the first reproducible NLP pipeline for Katharevousa Greek, an official archaicized register used in 20th-century Greek legal, administrative, and parliamentary discourse. This project released a frozen, UD-style annotated reference corpus containing 1,697 sentences; a fixed train/test split and a shared evaluation protocol; as well as the code for constructing, annotating, training, and evaluating these datasets.

创建时间:
2026-05-05
原始信息汇总

数据集概述

项目名称:kathnlp — Katharevousa Greek NLP
目标:为Katharevousa Greek(20世纪希腊法律、行政和议会话语中使用的保守官方语域)构建首个可复现的NLP流水线,提供通用依赖(UD)风格的形态和依存解析器。现有希腊语和古希腊语解析器对此语域覆盖不足。


数据集内容与规模

  • 标注数据:一个冻结的、UD风格注释的参考集,包含 1,697 个句子
  • 数据划分:固定训练/测试划分(340个句子作为保留集,随机种子42,对应4,093个词例)。
  • 数据来源:1976–1977年希腊议会书面问题的档案文本。

关键特性与资源

  • 发布资源
  • 论文:发表在 arXiv(编号2605.22978),完整方法论、错误分析和讨论见论文。

基准测试性能(保留集)

模型 UPOS DEPREL F1 UAS LAS
spaCy Greek 0.6721 0.5315 0.5492 0.4183
Stanza Greek (预训练) 0.6125 0.4242 0.6079 0.3396
Stanza Ancient Greek PROIEL 0.5292 0.4044 0.4850 0.3076
mBERT 0.8260 0.6076 0.5886 0.4537
Stanza (自定义训练) 0.7694 0.6588 0.5756 0.4943
基于特征的基线模型 0.9040 0.7451 0.5781 0.5072
XLM-R(发布候选) 0.8893 0.7250 0.6098 0.5162
  • XLM-R 发布候选模型在 LAS 上比最强的现成基线(spaCy Greek)绝对提升了 +0.0980
  • 基于特征的解析器在 UPOS 和依存关系标签上仍为最佳,这本身是低资源历史NLP的一个方法论发现。

状态与未来计划

  • 当前状态:研究预览。参考注释为自动验证,非完全专家审定;保留集较小(340个句子)。
  • 未来更新:正在进行由语言学家注释的专家评审阶段,将发布版本更新,同时发布XLM-R候选模型的Hugging Face模型。

引用信息

若使用本数据集或基准协议,请引用:

bibtex @misc{mikrosfitsilis2026kathnlp, title = {A Reproducible Universal Dependencies-Style Pipeline for Katharevousa Greek Parliamentary Text}, author = {Mikros, George and Fitsilis, Fotios}, year = {2026}, eprint = {2605.22978}, archivePrefix = {arXiv}, primaryClass = {cs.CL}, url = {https://arxiv.org/abs/2605.22978} }

搜集汇总
数据集介绍
kathnlp-treebank 数据集图片
构建方式
该数据集的构建源于对20世纪希腊法律、行政及议会话语中使用的纯正希腊语(Katharevousa)这一古老正式语体的系统性NLP资源空白。研究者从1976-1977年的希腊议会书面问题档案中提取原始语料,通过OCR导出后,遵循通用依存关系(Universal Dependencies)标注规范,人工构建了包含1697个句子的冻结参考集。数据集采用固定的训练/测试划分(种子42),其中保留340个句子(4093个词元)作为独立测试集,并制定了共享评估协议,确保所有系统的评分代码完全一致。构建过程中,数据、标注、训练及评估代码均公开发布,支持完整复现。
特点
该数据集的核心特色在于其专为低资源历史语言NLP设计的参考基准价值。它弥补了现成希腊语和古希腊语解析器对纯正希腊语覆盖不足的缺陷——现代希腊语流水线无法处理1970年代议会问询中常见的形态和依存结构,而古希腊语工具又不匹配现代机构词汇。数据集通过基准测试揭示了有趣发现:基于特征的解析器在UPOS和依存关系标注上表现最佳(UPOS达0.9040),而XLM-R候选模型在LAS上取得0.5162,较最强现成基线(spaCy希腊语)提升0.0980绝对值。这种多样方法间的性能对比为低资源历史NLP提供了方法论洞见。
使用方法
使用者可通过Hugging Face平台直接加载预训练模型进行解析:首先使用`pip install git+https://github.com/gmikros/katharevousa-nlp-tooling.git`安装工具包,随后通过`from kathnlp.hub import load_from_hub`导入解析器,调用`parser.parse()`即可处理纯正希腊语句子。若需复现解析器训练,可运行`scripts/train_transformer_parser.py`脚本,指定gold路径和编码器名称(如xlm-roberta-base)及训练轮次。此外,`scripts/evaluate_external_baselines.py`脚本可一键复现外部库基线评估结果。所有基准报告JSON文件存放于`reports/`目录,实验结果可完全复现。
背景与挑战
背景概述
kathnlp-treebank数据集由希腊学者George Mikros与Fotios Fitsilis于2026年创建,旨在解决纯净希腊语(Katharevousa Greek)这一20世纪希腊法律、行政与议会话语中使用的正式古文体的自然语言处理难题。该数据集聚焦于1976至1977年希腊议会书面质询文本,提供了首个可复现的通用依存树库风格标注资源,包含1697句冻结的参考句集与固定的训练/测试划分。其核心研究问题在于构建适用于低资源历史语言变体的形态与依存解析管道,填补了现代希腊语与古希腊语解析器在该领域表现不佳的空白。该数据集通过发布基准报告与透明特征基线,为稀有语种NLP研究树立了方法论标杆,显著推动了历时文本的计算语言学分析进程。
当前挑战
数据集面临的核心挑战是多方面的:首先,纯净希腊语作为历史语言变体,兼具现代希腊语的机构词汇与古希腊语的形态句法结构,导致现成的现代与古希腊语解析器均难以准确标注其依附关系与词性,性能低下(如spaCy希腊语模型的LAS仅0.4183);其次,构建过程中需从印刷议会档案中通过OCR重建语料,并手工校正自动标注分歧,而当前参考标注仅通过自动验证而非全专家裁定,340句的留出集规模偏小(4093词符),可能影响泛化评估的稳定性;此外,低资源环境下需在数据稀疏与标注成本间取得平衡,原始特征基线虽在UPOS上达0.9040,但依存句法准确率仍受限于训练数据规模与领域专用词汇的覆盖度。
常用场景
经典使用场景
在低资源历史语言变体的自然语言处理研究中,kathnlp-treebank 作为首个面向 Katharevousa 希腊语的通用依存关系树库,被广泛用于词性标注(UPOS)与依存句法分析任务的基准评测。该数据集包含 1,697 句经过精心标注的句子,采用 Universal Dependencies 风格,为研究者提供了一个标准化的训练与评估框架。其典型的实验范式是:在固定训练/测试划分下,对比传统统计模型(如基于特征的基线系统)与预训练语言模型(如 XLM-R、mBERT)在形态句法分析上的表现,从而揭示低资源场景下不同范式的优劣边界。
衍生相关工作
该数据集催生了多项具有启发性的后续工作。首先,其特有的特征基线策略表明,在低资源场景下,精心设计的非神经网络模型在某些指标(如 UPOS 精度达 0.9040)上仍可超越通用预训练模型,这启发了后续针对极小规模树库的混合建模方法。其次,XLM-R 在该数据集上的领先表现验证了跨语言迁移学习对历史语言变体的有效性,促使研究者探索更广泛的中古希腊语与拜占庭文本的零样本迁移。此外,该工作还衍生了面向希腊法律文本的实体关系联合标注协议,以及用于评测句法鲁棒性的对抗性样本生成方法。
数据集最近研究
最新研究方向
在低资源历史语言处理的浪潮中,kathnlp-treebank的发布标志着对现代希腊语变体——纯正希腊语(Katharevousa)——的结构化分析迈出了关键一步。该数据集首次构建了面向20世纪希腊议会文本的通用依存树库,填补了现有现代希腊语与古希腊语解析器在该领域表现欠佳的空白。前沿研究聚焦于利用跨语言预训练模型(如XLM-R)与基于特征的规则方法相结合,在词性标注与依存关系预测上取得了显著提升,其中XLM-R在依存正确率上超越最强基线模型近10个百分点。这一工作不仅为历史语言学与数字人文学科提供了可复用的基础设施,也揭示了在极度稀缺标注资源下,传统特征工程与神经网络方法的互补价值,对理解低资源语种的自然语言处理路径具有重要启示。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务