遇见数据集

morphbench-en

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

MorphBench是一个用于评估英语形态学感知分词器和语言模型的基准测试套件。该数据集包含八个独立任务,系统性地评测模型在英语形态学的多个方面的能力,包括屈折变化、词素分割、派生构词、词缀语义功能以及派生词的定义生成与识别。数据内容涵盖训练集、开发集和多个测试集(如主要测试集、罕见词测试集、记忆测试集等),数据总量约6.3 MB,适用于研究组合泛化、词法语义分析和模型在罕见词形上的表现。

MorphBench is a benchmark suite for evaluating English morphological-aware tokenizers and language models. This dataset contains eight independent tasks that systematically evaluate models' capabilities across multiple aspects of English morphology, including inflection, morpheme segmentation, derivational word formation, the semantic functions of affixes, as well as the generation and recognition of derived word definitions. The dataset covers training sets, development sets, and multiple test sets (e.g., main test set, rare word test set, memory test set, etc.), with a total data volume of approximately 6.3 MB. It is suitable for researching compositional generalization, lexical semantic analysis, and model performance on rare word forms.

创建时间:
2026-06-26
原始信息汇总

MorphBench(英文)数据集概述

MorphBench 是一个面向形态学感知的分词器和语言模型的英文评测基准,包含8个编号任务,涵盖屈折变化、词分割、派生、词缀语义及整词释义。

任务详情

任务名称 任务类型 任务描述 特征字段
task1_inflection 屈折生成 根据词元(lemma)和UniMorph特征生成屈折形式 lemma, feats, target, infl_type, status
task2_segmentation 词分割 将单词拆分为语素(以空格分隔) word, segmentation, deriv_type, affix_position, status
task3a_derivation 派生生成 根据基础词和词缀构造派生词 base, affix, target, deriv_type, affix_position, status
task3b_derivation_mcq 派生识别(多选) 从4个选项中选出正确的派生形式 query_base, query_derived, query_affix, query_pos, affix_subset, pretrain_cell, options, correct, demos
task4a_affix_function 词缀功能分类(从词形) 给定派生词,分类其词缀的语义功能(13类) word, function, freq
task4b_affix_function_paraphrase 词缀功能分类(从释义) 给定释义文本,分类词缀功能(无词形线索) meaning, function, freq
task5a_definition 释义生成 生成派生词的词典释义(gloss) word, gloss, base, affix, function, derived_freq, base_exposure, status
task5b_definition_mcq 释义识别(多选) 从多个干扰项中选出正确释义 word, base, affix, function, gold_gloss, distractors, pretrain_status, derived_freq, base_exposure

任务配对

配对 a(生成/从词形) b(识别/从语义)
第3对 派生——生成形式 派生——识别形式(4选1)
第4对 词缀功能——从词形 词缀功能——仅从语义(消除词形线索)
第5对 释义——生成gloss 释义——识别gloss(4选1)

数据划分与测试层次

各任务按预训练语料(BabyLM)中词项的出现频率划分评测层级,核心原则是目标词未见而基础词/词元已见(组合泛化)。

划分层级 通用条件 说明
train 训练集 所有任务均提供
dev 开发集 用于调参和验证
test / test_main base/lemma已见,target未见 组合泛化(核心测试)
test_memorization base/lemma已见,target已见 记忆性测试
test_rare base/lemma未见,target未见 稀有词测试
main_oov(task5) target未见,base出现次数<500 最难的OOV场景

数据规模

配置 训练集 开发集 测试集(含细分) 总样本量 总大小
task1_inflection 9,307 495 1,984 11,786 856KB
task2_segmentation 9,094 918 2,606 12,618 1.01MB
task3a_derivation 9,095 918 2,606 12,619 1.05MB
task3b_derivation_mcq - 495 1,905 2,400 692KB
task4a_affix_function 7,800 946 1,766 10,512 393KB
task4b_affix_function_paraphrase 200 227 407 834 44KB
task5a_definition 6,651 973 1,703 9,327 1.16MB
task5b_definition_mcq - 972 1,702 2,674 998KB
  • 许可证: CC BY-SA 4.0(源自维基词典)
  • 语言: 英语
  • 标签: morphology, tokenization, evaluation, english
  • 关联资源: 德文版 MorphBench-DE,词典资源 wiktionary-morph
搜集汇总
数据集介绍
morphbench-en 数据集图片
构建方式
在自然语言处理领域,形态学分析是理解词汇结构与语义的重要基石。MorphBench-EN数据集正是为了系统评估语言模型在英语形态学任务上的能力而构建,其数据来源于英语维基词典与UniMorph资源库,并通过精细的语料库频率统计设计了严格的难易分层。该数据集包含八个子任务,分别针对屈折变化生成、语素分割、派生词构建、词缀语义分类以及词汇释义等核心形态学能力。每个子任务均设有训练集、验证集和多个测试拆分,这些拆分依据词条在BabyLM训练语料中的出现频率进行划分,确保模型在已知词根与未知形态形式之间的组合泛化能力得到充分检验。
特点
MorphBench-EN最显著的特点在于其多层次、多角度的评估架构。数据集采用任务配对设计,如task3a与task3b分别考察派生词的形式生成与选择题识别,task4a与task4b则对比从词汇直接判断词缀功能与仅凭语义释义判断的差异,后者揭示了模型对词缀意义而非表面拼写的理解程度。每个子任务均包含如test_main、test_rare、test_memorization等精细拆分,对应不同的曝光条件,从而精准区分模型的记忆能力与真正的组合泛化能力。此外,数据集中每个样本都附有status或pretrain_cell字段,直接标注其所属的曝光层级,便于研究者进行深入分析。
使用方法
MorphBench-EN的使用方法简洁且灵活,用户可以通过HuggingFace的datasets库直接加载。加载时需指定子任务名称作为配置参数,例如load_dataset('yuanxin112/morphbench-en', 'task3a_derivation', split='test_main')即可获得派生词生成的测试集。每个子任务的数据结构明确,以字符串字段存储输入与输出,便于直接用于模型推理与评估。对于选择题形式的子任务,数据集已提供四个选项及正确答案,并附有示例样本作为上下文。研究者可以轻松遍历各拆分,利用status字段筛选特定曝光条件的样本,从而开展针对性的模型能力诊断实验。
背景与挑战
背景概述
MorphBench-en是2024年由多伦多大学等机构研究人员创建的英语形态学评估基准,旨在系统性地检验分词器与语言模型对词汇形态结构的理解能力。该数据集涵盖屈折变化、语素切分、派生构词、词缀语义及词汇释义等八个子任务,每个任务均基于UniMorph和英语Wiktionary构建,并设计了严格的组合泛化测试场景。通过对词根本身可见而派生形式不可见等条件的精细调控,可区分模型是真正习得了形态规则,还是仅仅记忆了预训练语料中的表面共现形态。该基准的提出为自然语言处理领域提供了评估语言学泛化能力的重要工具。
当前挑战
MorphBench-en所解决的核心领域问题在于现有分词与语言模型对词汇形态结构的理解往往停留在表面模式匹配层面,难以真正实现组合泛化。例如,模型在基于词形推断词缀功能的task4a上可达到约98%的准确率,但在仅凭语义释义判断词缀功能的task4b上却骤降至约22%,这一巨大落差暴露了当前模型严重依赖表层形态线索而非深层意义的缺陷。构建过程中面临的挑战包括:需要从Wiktionary等异质资源中系统抽取出形态规则与构词实例,确保不同难度层次的数据在语料暴露频率上精确定义,以及设计lemma-disjoint的划分方式以避免训练与测试间的信息泄漏。
常用场景
经典使用场景
在自然语言处理领域,词法分析一直是语言理解的基础性挑战。MorphBench-en作为一套面向英语形态学评估的综合性基准,其经典使用场景聚焦于评测分词器与语言模型的形态学感知能力。该数据集精心设计了八项任务,涵盖屈折变化生成、语素切分、派生词构建、词缀语义分类以及整词定义等核心维度,能够系统性地检验模型在形态层面上的理解与生成水平。每个任务都配置了细致的训练、验证与测试划分,尤其通过引入基于预训练语料暴露频次的分割策略,使得研究者能够精准评估模型在组合泛化、记忆召回以及罕见词处理等不同场景下的表现。
解决学术问题
形态学复杂性长期制约着自然语言处理模型的泛化能力,而现有基准往往忽略了词法层面的系统评估。MorphBench-en的提出,为解决模型在形态组合推理与词缀语义理解方面的学术困境提供了关键工具。该数据集通过将测试样本按基词与派生词的预训练暴露程度进行精细分桶,首次系统性地分离了组合泛化能力与记忆效应,使得研究者能够明确区分模型是真正掌握了形态规则还是仅仅记住了训练数据。这一设计深刻揭示了当前语言模型在词缀语义分类任务中过度依赖表面拼写线索而非深层理解的问题,推动学术界重新审视形态学在语言模型评估中的核心地位。
衍生相关工作
MorphBench-en的构建催生了一系列相关研究工作。其配套发布了来自Wiktionary的详细词法资源数据集wiktionary-morph,为词法分析提供了丰富的训练素材。以此为基础,研究者进一步拓展了德语版本的MorphBench-de,形成了跨语言的形态学评估体系。数据集内部精心设计的任务配对——如派生词生成与多选题识别的对照、基于词形与基于语义释义的词缀功能分类对比——已成为评估语言模型形态学能力的标准范式。这些衍生工作不仅丰富了形态学评估的方法论,更推动了词法分析与深度学习模型在更广泛语言任务中的应用与发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务