YallaMorph
收藏资源简介:
YallaMorph是一个面向阿拉伯语形态生成的大规模基准数据集,由纽约大学阿布扎比分校等机构创建。数据集涵盖动词、名词、形容词及其附着形式,共计超过60万条精心采样的实例,数据源于CamelMorph MSA词典。构建过程采用语言学驱动的分层采样,平衡了词根类别、词频、范式完整性和词干复杂度等维度。该基准旨在系统评估大型语言模型从显式词汇和特征组合生成正确阿拉伯语词形的能力,尤其侧重于附着形式、未见组合及低频形态的泛化表现。
YallaMorph is a large-scale benchmark dataset for Arabic morphological generation, created by institutions including New York University Abu Dhabi. The dataset covers verbs, nouns, adjectives and their attached forms, comprising over 600,000 carefully sampled instances sourced from the CamelMorph MSA lexicon. Its construction adopts linguistically-driven hierarchical sampling, which balances multiple dimensions such as root category, word frequency, paradigm completeness and stem complexity. This benchmark aims to systematically evaluate the ability of Large Language Models (LLMs) to generate correct Arabic word forms from explicit lexical and feature combinations, with a particular focus on the generalization performance of attached forms, unseen combinations and low-frequency morphological forms.
YallaMorph 数据集概述
基本信息
- 名称:YallaMorph
- 全称:YallaMorph: A Benchmark for Evaluating Arabic Morphological Generation in Large Language Models
- 类型:大规模阿拉伯语形态生成评测基准
- 用途:评估大型语言模型(LLMs)执行受控阿拉伯语形态生成的能力
- 地址:https://github.com/CAMeL-Lab/YallaMorph
任务定义
给定阿拉伯语词元(lemma)、词性(POS)、释义(gloss)以及一组目标形态句法特征,模型需生成对应的完整标音阿拉伯语表层形式。
任务规范可能存在以下情况:
- 单一有效阿拉伯语形式
- 多个有效阿拉伯语形式
- 无形态学上有效的实现形式
输入示例
text Lemma: ... POS: ... Gloss: ...
Morphological Features: ...
期望输出格式
有效配置:
json { "arabic_forms": ["form1", "form2"], "status": "OK" }
形态学上不可能的配置:
json { "arabic_forms": null, "status": "IMPOSSIBLE" }
覆盖范围
- 动词
- 名词
- 形容词
- 基础词形态
- 附缀化形式
- 形态学上无效的配置
数据集规模
- 评测实例总数:663,804
- 采样词元数:4,795
形态特征
动词
- 体(Aspect)
- 人称(Person)
- 性别(Gender)
- 数(Number)
- 语态(Voice)
- 语气(Mood)
名词与形容词
- 性别(Gender)
- 数(Number)
- 格(Case)
- 状态(State)
附缀感知实例额外包含前置附缀(proclitic)与后置附缀(enclitic)的位置特征。
基准设计
YallaMorph 基于 CamelMorph MSA 的词元清单与形态分析构建,通过 CAMeL Tools 访问。
采样策略考虑以下语言与分布维度:
- 词元频率
- 词根类别
- 范式完整性
- 词干复杂度
包含两个互补的评测子集:
- Baseword:评估核心阿拉伯语屈折形态。
- Cliticization:评估屈折形式与阿拉伯语前置/后置附缀之间的交互。
基准统计
| 词性组 | 基础词实例 | 附缀化实例 |
|---|---|---|
| 主动完成体动词 | 9,234 | 45,738 |
| 被动完成体动词 | 8,964 | 8,820 |
| 命令式动词 | 7,794 | 6,480 |
| 主动未完成体动词 | 39,150 | 181,800 |
| 被动未完成体动词 | 39,150 | 37,800 |
| 名词 | 101,898 | 67,950 |
| 形容词 | 32,076 | 76,950 |
| 合计 | 238,266 | 425,538 |
基准总规模:663,804 个实例。
仓库结构
text YallaMorph/ │ ├── sample_data/ │ └── ... │ ├── output_data/ │ └── ... │ ├── prompts/ │ ├── english/ │ │ ├── zero_shot/ │ │ └── few_shot/ │ │ │ └── arabic/ │ ├── zero_shot/ │ └── few_shot/ │ └── README.md
sample_data/
包含 YallaMorph 基准的样本实例。每个实例指定一个词汇项及模型必须实现的形态特征。
output_data/
包含 YallaMorph 实验期间产生的模型预测结果。实验在不同提示配置下评估多语言与阿拉伯语专用 LLM。模型输出使用固定 JSON 输出格式生成,随后经处理用于评测。
prompts/
包含用于评测模型的提示。提示提供以下语言版本:
- 英语
- 阿拉伯语
并提供两种提示设置:
- 零样本(Zero-shot)
- 少样本(Few-shot,10-shot)
提示为词性特定,分别针对以下配置:
- 动词
- 名词
- 形容词
- 附缀感知生成
少样本提示包含 10 个上下文示例,选自与基准评测实例不相交的数据。
引用信息
YallaMorph: A Benchmark for Evaluating Arabic Morphological Generation in Large Language Models
作者:Mahmoud Reda, Salam Khalifa, Reham Marzouk, Nizar Habash
机构:Computational Approaches to Modeling Language (CAMeL Lab), New York University Abu Dhabi
bibtex @inproceedings{reda2026yallamorph, title = {YallaMorph: A Benchmark for Evaluating Arabic Morphological Generation in Large Language Models}, author = {Reda, Mahmoud and Khalifa, Salam and Marzouk, Reham and Habash, Nizar}, year = {2026} }
许可
- 基准数据、样本数据、提示、文档及其他研究产物:Creative Commons Attribution 4.0 International(CC BY 4.0)
- 源代码与脚本:MIT License
YallaMorph 使用 CamelMorph MSA 的形态资源构建,用户还应遵守底层资源的许可与署名要求。
仓库中包含的模型生成输出由各自的语言模型产生,可能额外受相应模型提供方条款与条件的约束。
致谢
本工作于 CAMeL Lab, New York University Abu Dhabi 完成。





