遇见数据集

MORFES

收藏
arXiv2026-07-30 更新2026-08-01 收录
官方服务:

资源简介:

MORFES(Morphological Open-class Recognition-and-Formation Evaluation Suite)是由基弗股份公司创建的首个专为现代希腊语屈折形态能力设计的基准测试集。该数据集包含500个经过语言学家验证的条目,覆盖名词、形容词和动词的屈折变化识别与生成任务,其中动词条目占比60%以体现其丰富形态。创建过程中严格把控词干频率,偏向低频词干以确保正确回答反映规则应用而非记忆召回,并通过专家逐条审核与近最小干扰项设计提升评测信度。该基准旨在填补现有希腊语模型评测仅关注事实知识的空白,系统评估语言模型在形态丰富语言中的屈折生成能力,为多语言模型的语言学能力研究提供重要参考。

提供机构:
基弗股份公司
创建时间:
2026-07-30
原始信息汇总

MORFES 数据集概述

基本信息

  • 名称:MORFES(Morphological Open-class Recognition-and-Formation Evaluation Suite)
  • 全称含义:现代希腊语能产性屈折能力基准测试(Benchmark for Productive Inflectional Competence in Modern Greek)
  • 语言:希腊语(el)
  • 规模:500个项目(n<1K)
  • 许可证:CC-BY-4.0
  • 标注来源:专家生成(expert-generated)
  • 任务类型:多项选择(multiple-choice)、文本生成(text-generation)
  • 标签:形态学、屈折、现代希腊语、希腊语、语言学、评估

数据集内容

任务描述

给定一个词元(词典形式)和一个语法说明,每个项目测试模型是否能够识别并生成正确的屈折形式。数据集偏向使用低频词元,以确保正确答案反映能产性规则而非记忆形式。

类别分布

500个项目涵盖六个类别,包括三个屈折丰富的开放词类(名词、形容词、动词),每类包含单形式和全范式两种变体:

类别 项目数
名词变格:单形式 50
名词变格:全范式 50
形容词变格:单形式 50
形容词变格:全范式 50
动词变位:单形式 150
动词变位:全范式 150

数据集以动词为重心(300/500项),因为动词屈折形式远多于名词和形容词。

数据字段

每行一个项目,共10列:

列名 描述
id 稳定的项目标识符(如 gr-00001
category 上述六个类别之一
question 项目提示(希腊语)
ABCD 四个候选形式,顺序随机化
answer 正确选项的字母(A-D)
accepted_answers 正确答案的拼写形式列表(JSON字符串),单形式为扁平列表,全范式为逐单元格列表
lemma 项目所基于的词元形式,每个项目对应一个独立词元

防污染控制

  • 每个项目的 lemma 已提供,使用者可将这些词元从训练数据中排除
  • 每个项目基于不同的词元构建
  • 所请求的形式绝不是词元的词典形式,因此无法通过重复提示词来回答

引用信息

bibtex @misc{perros2026morfes, title = {{MORFES}: A Benchmark for Productive Inflectional Competence in Modern Greek}, author = {Perros, Ioakeim and Papadopoulou, Cleopatra and Kirouane, Ayoub and Petrocheilos, Christos}, year = {2026}, howpublished = {url{https://huggingface.co/datasets/KIEFERSA/MORFES}}, note = {arXiv:2607.28274} }

相关资源

  • 论文:arXiv:2607.28274(https://arxiv.org/abs/2607.28274)
  • 配套模型:Sophea-Genesis-1(https://huggingface.co/KIEFERSA/Sophea-Genesis-1),一个开放的希腊语语言模型,在该基准上的准确率是所评估的开放模型中最高者

许可证

采用知识共享署名4.0国际(CC-BY-4.0)许可证,允许共享和改编(包括商业用途),需提供适当署名。

搜集汇总
数据集介绍
MORFES 数据集图片
构建方式
在现代希腊语这一形态丰富的语言背景下,MORFES基准的构建植根于对语言生产性屈折能力的理论界定,旨在区分规则运用与机械记忆。该基准包含500个由专家验证的测试项,覆盖名词、形容词和动词三大开放词类。每个测试项均设计为双重模式:识别模式提供四个近似的候选形式供模型选择,而生产模式要求模型直接生成正确形式。在设计上,干扰项被精心构造为近最小差异的合理错误形式,且词元选择偏向低频词汇,以确保正确答案反映规则而非记忆。此外,每个词元仅出现一次,并避免使用词典形式,从而有效防止模型通过简单重复提示词作答。
使用方法
使用MORFES基准时,研究者可通过Hugging Face平台获取数据集,并采用标准的lm-evaluation-harness框架进行模型评估。评估过程包括识别准确率、生产准确率(逐形式与逐项)三项核心指标。模型需在零样本条件下分别完成识别与生产任务,生产任务要求模型遵循特定希腊语指令输出格式。为防范数据污染,基准公开了每个词元,便于用户在训练阶段将其剔除。该基准不仅适用于通用模型评估,也可用于检验专为希腊语设计的模型的形态学能力,进而指导后续的定向后训练优化。
背景与挑战
背景概述
现代希腊语作为一种形态高度丰富的语言,其名词、形容词和动词均通过系统性规则生成多种屈折形式,然而现有针对该语言的模型评估多聚焦于事实性知识,缺乏专门衡量屈折形态能力的基准。为此,Sophea AI团队于近期发布了MORFES(词法开放类识别与构形评估套件),由Ioakeim Perros等学者构建,包含500个经专家验证的测试项,通过低频词素的选择与识别、生成双模式设计,旨在区分模型基于规则的生产性能力与基于记忆的检索能力。该基准填补了现代希腊语形态评估的空白,首次实现了对开放词类屈折能力的系统度量,为多语言模型在形态丰富语言上的表现提供了关键参照,推动了对大语言模型文法能力的细粒度评估。
当前挑战
MORFES所应对的核心挑战在于区分模型的规则内化与机械记忆:现代希腊语屈折形式数量庞大,模型若仅复现训练数据中的高频形式,将难以处理低频词素的正确变形,因此基准需通过频率控制与专家审核确保正确作答反映规则掌握。构建过程中,团队面临多重难题:需在覆盖完整屈折轴系的同时保持低频词素偏好,设计近似干扰项以杜绝猜测,处理一形多义对应及重音对比性等语言细节,并确保所有条目经母语语言学家逐项验证。此外,模型在识别与生成模式间的显著差距表明,当前多数模型仅具备部分形态知识,如何在生成维度提升跨类别的准确性与完整性,仍是该领域亟待突破的挑战。
常用场景
经典使用场景
MORFES作为首个专门针对现代希腊语屈折形态能力的评测基准,其经典使用场景在于系统性地评估语言模型在开放词类(名词、形容词、动词)上的生产性屈折能力。该基准通过500个经专家验证的项目,以识别与生产两种模式测试模型能否依据规则而非记忆生成正确的词形变化。研究者可借助MORFES对模型进行0-shot评估,比较不同规模、不同训练策略的开源模型在屈折形态学上的表现,尤其适用于检验模型对于低频率词元的泛化能力,从而揭示其真正的语法规则内化程度。
解决学术问题
MORFES填补了现代希腊语形态学评估的空白,解决了传统评测侧重事实知识而忽视语法能力的学术问题。它区分了识别与生产两种能力,并通过频率控制确保正确答案反映规则而非记忆,从而有效规避了基准污染和记忆偏差。这一设计为评估模型在形态丰富语言上的生产性语法能力提供了可靠工具,推动了多语言模型评估的维度拓展,尤其为低资源语言模型在屈折形态学上的能力量化提供了新范式,其发布也促使研究者关注模型在规则泛化与记忆之间的本质差异。
实际应用
在实际应用中,MORFES可用于检测和改进面向现代希腊语的自然语言处理系统,如机器翻译、拼写检查、语法纠错及语言学习辅助工具。模型开发者可基于该基准定向优化其模型在屈折形态上的表现,从而提升对希腊语复杂词形变化的处理精度。此外,MORFES的构造方法论可推广至其他形态丰富语言,促进跨语言的形态学评测体系构建,为多语言AI产品的质量保障提供参考,尤其在教育科技、智能助手和文本生成等需要精准语法输出的领域具有显著应用价值。
数据集最近研究
最新研究方向
在自然语言处理领域,形态丰富语言的屈折形态能力日益受到关注,特别是对于现代希腊语这类高度屈折的语言。最新研究揭示,尽管大规模语言模型在知识问答上表现出色,但其形态学能力仍未得到充分评估。MORFES基准的提出填补了这一空白,它聚焦于识别和生成屈折形式的生产性能力,并特别强调低频词素以排除记忆效应。当前前沿方向包括:探究模型在开放词类(名词、形容词、动词)上的形态学泛化能力,评估不同规模开放权重模型(如LLaMA、Qwen3、DeepSeek-R1等)在形态学任务上的表现,以及通过对比识别与生成任务来揭示模型的深层语言能力。该基准不仅为现代希腊语提供了首个专门评估工具,还通过设计干扰项、控制词频等措施,推动了形态学评估的规范化,为多语言模型的语言学能力评测提供了新范式。其意义在于强调形态学能力是衡量模型语言掌握程度的独立维度,为未来模型训练和评估提供了重要参考。
相关研究论文
  • 1
    MORFES: A Benchmark for Productive Inflectional Competence in Modern Greek基弗股份公司 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务