MORFES
收藏资源简介:
MORFES(Morphological Open-class Recognition-and-Formation Evaluation Suite)是由基弗股份公司创建的首个专为现代希腊语屈折形态能力设计的基准测试集。该数据集包含500个经过语言学家验证的条目,覆盖名词、形容词和动词的屈折变化识别与生成任务,其中动词条目占比60%以体现其丰富形态。创建过程中严格把控词干频率,偏向低频词干以确保正确回答反映规则应用而非记忆召回,并通过专家逐条审核与近最小干扰项设计提升评测信度。该基准旨在填补现有希腊语模型评测仅关注事实知识的空白,系统评估语言模型在形态丰富语言中的屈折生成能力,为多语言模型的语言学能力研究提供重要参考。
MORFES 数据集概述
基本信息
- 名称:MORFES(Morphological Open-class Recognition-and-Formation Evaluation Suite)
- 全称含义:现代希腊语能产性屈折能力基准测试(Benchmark for Productive Inflectional Competence in Modern Greek)
- 语言:希腊语(el)
- 规模:500个项目(n<1K)
- 许可证:CC-BY-4.0
- 标注来源:专家生成(expert-generated)
- 任务类型:多项选择(multiple-choice)、文本生成(text-generation)
- 标签:形态学、屈折、现代希腊语、希腊语、语言学、评估
数据集内容
任务描述
给定一个词元(词典形式)和一个语法说明,每个项目测试模型是否能够识别并生成正确的屈折形式。数据集偏向使用低频词元,以确保正确答案反映能产性规则而非记忆形式。
类别分布
500个项目涵盖六个类别,包括三个屈折丰富的开放词类(名词、形容词、动词),每类包含单形式和全范式两种变体:
| 类别 | 项目数 |
|---|---|
| 名词变格:单形式 | 50 |
| 名词变格:全范式 | 50 |
| 形容词变格:单形式 | 50 |
| 形容词变格:全范式 | 50 |
| 动词变位:单形式 | 150 |
| 动词变位:全范式 | 150 |
数据集以动词为重心(300/500项),因为动词屈折形式远多于名词和形容词。
数据字段
每行一个项目,共10列:
| 列名 | 描述 |
|---|---|
id |
稳定的项目标识符(如 gr-00001) |
category |
上述六个类别之一 |
question |
项目提示(希腊语) |
A、B、C、D |
四个候选形式,顺序随机化 |
answer |
正确选项的字母(A-D) |
accepted_answers |
正确答案的拼写形式列表(JSON字符串),单形式为扁平列表,全范式为逐单元格列表 |
lemma |
项目所基于的词元形式,每个项目对应一个独立词元 |
防污染控制
- 每个项目的
lemma已提供,使用者可将这些词元从训练数据中排除 - 每个项目基于不同的词元构建
- 所请求的形式绝不是词元的词典形式,因此无法通过重复提示词来回答
引用信息
bibtex @misc{perros2026morfes, title = {{MORFES}: A Benchmark for Productive Inflectional Competence in Modern Greek}, author = {Perros, Ioakeim and Papadopoulou, Cleopatra and Kirouane, Ayoub and Petrocheilos, Christos}, year = {2026}, howpublished = {url{https://huggingface.co/datasets/KIEFERSA/MORFES}}, note = {arXiv:2607.28274} }
相关资源
- 论文:arXiv:2607.28274(https://arxiv.org/abs/2607.28274)
- 配套模型:Sophea-Genesis-1(https://huggingface.co/KIEFERSA/Sophea-Genesis-1),一个开放的希腊语语言模型,在该基准上的准确率是所评估的开放模型中最高者
许可证
采用知识共享署名4.0国际(CC-BY-4.0)许可证,允许共享和改编(包括商业用途),需提供适当署名。

- 1MORFES: A Benchmark for Productive Inflectional Competence in Modern Greek基弗股份公司 · 2026年




