遇见数据集

morphbench-de

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

MorphBench (German) 是一个用于评估德语形态感知分词器和语言模型的综合性基准测试套件。该数据集包含七个核心任务,旨在系统性地探究德语的形态学能力,包括词形屈折变化、派生词分割、派生词构建、复合词分割、词缀功能分类、派生词定义生成以及派生词定义多选。每个任务作为一个独立的配置,数据被组织为多个分片,如训练集、开发集以及多个具有不同泛化难度的测试集。这些测试分片根据词基和目标任务形式在预训练语料中的暴露频率进行划分,核心评估目标是模型在词基可见而目标形式不可见情况下的组合泛化能力。数据来源于德语维基词典和UniMorph项目,数据集规模可观,例如,任务1(屈折变化)包含约1.5万条样本,任务6a(定义生成)包含约1.2万条样本。该数据集适用于自然语言处理中形态学分析、分词、语言模型理解和生成等任务的评估与研究。

MorphBench (German) is a comprehensive benchmark suite for evaluating German morphology-aware tokenizers and language models. The dataset consists of seven core tasks designed to systematically investigate the morphological capabilities of German, including inflection, derivation segmentation, derivation construction, compound segmentation, affix function classification, derivation definition generation, and derivation definition multiple-choice questions. Each task is organized as an independent configuration, with data split into multiple subsets such as train, dev, and various test sets with different generalization difficulties. These test subsets are divided based on the exposure frequency of lemmas/bases and target forms in pre-training corpora, with the core evaluation goal being the models compositional generalization ability in scenarios where the lemma is seen but the target form is unseen. The data is sourced from the German Wiktionary and the UniMorph project, and the dataset is substantial in scale; for example, Task 1 (inflection) contains approximately 15,000 samples, and Task 6a (definition generation) contains about 12,000 samples. This dataset is suitable for evaluation and research in natural language processing tasks such as morphological analysis, tokenization, and language model understanding and generation.

创建时间:
2026-06-26
原始信息汇总

数据集总览

MorphBench (German) 是一个德语词法评估基准,旨在测试词法感知的分词器和语言模型。数据集遵循 CC BY-SA 4.0 许可,语言为德语,涵盖7个子任务(共8个配置),每个子任务对应一个独立的配置(config)。

子任务详情

配置名称 任务描述 输入字段 输出字段 示例
task1_inflection 根据词元+特征生成屈折形式 lemma, feats, target, status - interagieren + v;ind;pl;1;pstinteragierten
task2_deriv_segmentation 将派生词切分为词基+词缀 word, segmentation, status - Dreher → `drehen
task3_derivation 根据词基+词缀构建派生词 base, affix, target, status - Apotheke + pflichtigapothekenpflichtig
task4_compound 将复合词切分为组成部分 word, segmentation, difficulty, source - Freiheitsheld → `Freiheit
task5_affix_function 分类派生词中词缀的语义功能(13类) word, function, freq, status - stimmloswithout
task6a_definition 生成派生词的词典释义 word, gloss, base, affix, function, derived_freq, base_exposure, status - MalocherArbeitnehmer, der überwiegend körperlich hart … arbeitet
task6b_definition_mcq 多选题版本:从干扰项中选择正确释义 word, base, affix, function, gold_gloss, distractors, pretrain_status, derived_freq, base_exposure - -

数据划分与难度层级

每个子任务包含多个 split,通过预训练暴露度(在BabyLM风格德语语料库中的频率)定义,核心思想是测试组合泛化能力(目标词未见,但其组成部分已见):

配置 划分集合 划分条件 测试目标
task1_inflection train, dev, test, test_rare, test_memorization test: 词元已见,屈折形式未见;test_rare: 词元未见;test_memorization: 词元已见且形式已见 组合泛化 vs. 记忆
task2_deriv_segmentation train, dev, test_main, test_memorization, test_oov test_main: 词基已见,派生词未见;test_oov: 词基未见;test_memorization: 两者均已见 组合泛化 vs. 记忆 vs. OOV
task3_derivation train, dev, test_main, test_memorization, test_oov 同上 同上
task4_compound train, dev, test_main, test_rare, test_memorization, test_hardest test_main: 复合词未见,所有成分已见;test_hardest: 复合词未见,某些成分未见;test_memorization: 复合词已见;test_rare: 混合 组合泛化 vs. 最难 vs. 记忆
task5_affix_function train, dev, test 无难度分层 标准监督
task6a_definition train, dev, test_main, test_main_oov, test_rare, test_memorization main: 派生词频率=0且词基暴露≥300;main_oov: 派生词频率=0且词基暴露<300;rare: 频率1-5;memorization: 频率≥20 泛化 vs. 罕见 vs. 记忆
task6b_definition_mcq dev, main, main_oov, rare, memorization 同上 同上

数据规模与文件

  • 数据集总大小:通过各配置的 download_sizedataset_size 数据,所有配置的总下载大小约为 3,332,690 字节,总数据集大小约为 7,519,799 字节。
  • 数据文件格式:每个配置的数据文件路径为 {config_name}/{split}-*,例如 task1_inflection/train-*

来源与许可证

搜集汇总
数据集介绍
morphbench-de 数据集图片
构建方式
MorphBench-de基准数据集专为德语形态学评估而设计,其构建过程依托于德语维基词典(通过kaikki.org与wiktextract工具提取)以及UniMorph形态学资源。数据集共包含七个核心任务,分别针对屈折变化、派生词分割、派生词生成、复合词拆分、词缀语义分类、派生词释义生成及其多项选择版本,每个任务均以独立的配置(config)形式组织。每个任务内部,数据被划分为训练集、开发集及多个测试集,这些测试集依据目标词或其组成部分在BabyLM风格德语训练语料中的预训练暴露程度进行细分,例如将基础词已见但派生词未见的情况归为组合泛化测试。这种基于语料频率的分层抽样方法,旨在系统评估模型在不同难度和泛化层级上的表现。
特点
MorphBench-de的核心特点在于其精细设计的难度层级与组合泛化评估架构。数据集不仅覆盖了德语形态学中从屈折到派生、复合、再到词义解释的完整谱系,更通过‘已见’(在训练语料中频率高于阈值)与‘未见’(频率为零)的二元条件组合,构建了如‘基础词已见、派生词未见’等特定泛化测试场景。每个任务的测试集均包含主测试(组合泛化)、记忆测试(完全已见)、以及稀有词或完全未知词测试,从而能够剥离模型对训练数据的机械记忆能力与真正的形态学推理能力。此外,数据集还提供了词频、基础词暴露度等元信息,为深入分析模型行为提供了数据支持。
使用方法
使用MorphBench-de时,研究人员可通过Hugging Face的`datasets`库便捷加载,通过指定任务配置名称(如`task1_inflection`)和所需数据划分(如`test_main`)即可获取相应数据。每个任务的数据格式统一,以字符串字段存储输入与目标,如屈折任务中提供词元与特征组合作为输入,对应的屈折形式作为输出。数据集设计为可直接用于序列到序列或分类任务的评估,其中`task6b_definition_mcq`以多项选择形式呈现,包含正解与干扰项。用户应特别关注`status`或`pretrain_cell`字段,这些字段记录了每个样本的暴露条件,便于根据评估目标(如仅测试组合泛化能力)进行筛选,从而精准衡量模型在德语形态学上的真实理解水平。
背景与挑战
背景概述
MorphBench-de(德语版)是由研究者基于德语Wiktionary(通过kaikki.org/wiktextract提取)和UniMorph等资源构建的系统性形态学评估基准,旨在填补德语自然语言处理中形态感知评估的空白。该数据集由八个子任务组成,涵盖屈折变化、派生分割、复合词分解、词缀语义分类及整词释义等核心形态学现象,创建于当前大规模语言模型时代,聚焦于检验分词器和模型在形态学上的组合泛化能力。其通过精心设计的测试集拆分(如基于基词和派生词在BabyLM风格德语语料库中的曝光频率),区分了组合泛化、记忆召回及罕见词处理等不同难度层级,为评估德语形态学理解提供了标准化框架。自发布以来,MorphBench-de已成为德语形态学评估的重要基准,对推动形态学感知模型的发展具有显著影响力。
当前挑战
MorphBench-de所解决的领域挑战在于:当前主流分词器和语言模型在处理德语丰富的形态系统时,往往依赖表面子词频率而缺乏对形态结构的真正理解,导致在屈折变化生成、派生和复合词分割、词缀语义判断等任务上表现不佳。该基准通过设置组合泛化拆分(如基词可见但派生词不可见)来严格测试模型的形态学推理而非记忆。构建过程中面临的挑战包括:从多源(德维基词典、UniMorph)自动提取形态学数据时需保证标注的一致性;为每个子任务定义合理的曝光阈值以区分记忆和泛化;设计具有高区分度的干扰项(如任务6b的选项生成)以评估词义理解深度;以及处理德语特有的复合词复杂度、词缀多功能性和罕见形态组合等问题,确保基准能全面反映真实形态学处理能力。
常用场景
经典使用场景
在自然语言处理领域,德语作为一种形态丰富的语言,其词形变化、派生、复合等复杂现象对模型的语言理解能力构成了严峻挑战。MorphBench-de数据集正是在此背景下应运而生,它专门用于评测形态学感知的分词器与语言模型在德语上的表现。该数据集涵盖了屈折变化生成、派生分割、派生词构建、复合词分割、词缀功能分类以及派生词释义生成等六类核心任务,每一任务均配置了精细化的训练、验证与测试划分。研究者可通过加载不同配置,系统性地评估模型在形态学层面的泛化能力与记忆效应。
衍生相关工作
MorphBench-de的发布催生了一系列围绕德语形态学分析与组合泛化的突破性工作。其英文姊妹数据集morphbench-en为跨语言形态学评估提供了对称参考,而配套的词汇资源wiktionary-morph则直接支撑了形态学特征工程与数据增强研究。基于该数据集的任务设计,研究者陆续提出了融合形态特征的预训练语言模型、针对复合词分割的序列标注方法以及基于词缀功能分类的语义理解架构,这些工作共同推动了形态感知型自然语言处理算法的发展。
数据集最近研究
最新研究方向
在德语形态学的前沿探索中,MorphBench-de数据集聚焦于评估形态感知分词器与语言模型的组合泛化能力,尤其是针对未见词形的形态推理与词法分割任务。该基准紧密关联当前自然语言处理领域对结构化语言知识可迁移性的关注,通过设计词形变化、派生分割、复合词解析及词缀语义分类等八项子任务,系统性地考验模型在零样本或低资源场景下的泛化表现。其不仅服务于德语这一形态丰富语言的深入理解,也为跨语言形态学评测提供了可复制的范式,对推动基于构词规则的神经模型发展与语言学理论的计算机建模具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务