遇见数据集

YallaMorph

收藏
arXiv2026-09-09 更新2026-09-11 收录
官方服务:

资源简介:

YallaMorph是一个面向阿拉伯语形态生成的大规模基准数据集,由纽约大学阿布扎比分校等机构创建。数据集涵盖动词、名词、形容词及其附着形式,共计超过60万条精心采样的实例,数据源于CamelMorph MSA词典。构建过程采用语言学驱动的分层采样,平衡了词根类别、词频、范式完整性和词干复杂度等维度。该基准旨在系统评估大型语言模型从显式词汇和特征组合生成正确阿拉伯语词形的能力,尤其侧重于附着形式、未见组合及低频形态的泛化表现。

YallaMorph is a large-scale benchmark dataset for Arabic morphological generation, created by institutions including New York University Abu Dhabi. The dataset covers verbs, nouns, adjectives and their attached forms, comprising over 600,000 carefully sampled instances sourced from the CamelMorph MSA lexicon. Its construction adopts linguistically-driven hierarchical sampling, which balances multiple dimensions such as root category, word frequency, paradigm completeness and stem complexity. This benchmark aims to systematically evaluate the ability of Large Language Models (LLMs) to generate correct Arabic word forms from explicit lexical and feature combinations, with a particular focus on the generalization performance of attached forms, unseen combinations and low-frequency morphological forms.

创建时间:
2026-09-09
原始信息汇总

YallaMorph 数据集概述

基本信息

  • 名称:YallaMorph
  • 全称:YallaMorph: A Benchmark for Evaluating Arabic Morphological Generation in Large Language Models
  • 类型:大规模阿拉伯语形态生成评测基准
  • 用途:评估大型语言模型(LLMs)执行受控阿拉伯语形态生成的能力
  • 地址:https://github.com/CAMeL-Lab/YallaMorph

任务定义

给定阿拉伯语词元(lemma)、词性(POS)、释义(gloss)以及一组目标形态句法特征,模型需生成对应的完整标音阿拉伯语表层形式。

任务规范可能存在以下情况:

  1. 单一有效阿拉伯语形式
  2. 多个有效阿拉伯语形式
  3. 无形态学上有效的实现形式

输入示例

text Lemma: ... POS: ... Gloss: ...

Morphological Features: ...

期望输出格式

有效配置:

json { "arabic_forms": ["form1", "form2"], "status": "OK" }

形态学上不可能的配置:

json { "arabic_forms": null, "status": "IMPOSSIBLE" }

覆盖范围

  • 动词
  • 名词
  • 形容词
  • 基础词形态
  • 附缀化形式
  • 形态学上无效的配置

数据集规模

  • 评测实例总数:663,804
  • 采样词元数:4,795

形态特征

动词

  • 体(Aspect)
  • 人称(Person)
  • 性别(Gender)
  • 数(Number)
  • 语态(Voice)
  • 语气(Mood)

名词与形容词

  • 性别(Gender)
  • 数(Number)
  • 格(Case)
  • 状态(State)

附缀感知实例额外包含前置附缀(proclitic)与后置附缀(enclitic)的位置特征。

基准设计

YallaMorph 基于 CamelMorph MSA 的词元清单与形态分析构建,通过 CAMeL Tools 访问。

采样策略考虑以下语言与分布维度:

  • 词元频率
  • 词根类别
  • 范式完整性
  • 词干复杂度

包含两个互补的评测子集:

  • Baseword:评估核心阿拉伯语屈折形态。
  • Cliticization:评估屈折形式与阿拉伯语前置/后置附缀之间的交互。

基准统计

词性组 基础词实例 附缀化实例
主动完成体动词 9,234 45,738
被动完成体动词 8,964 8,820
命令式动词 7,794 6,480
主动未完成体动词 39,150 181,800
被动未完成体动词 39,150 37,800
名词 101,898 67,950
形容词 32,076 76,950
合计 238,266 425,538

基准总规模:663,804 个实例。

仓库结构

text YallaMorph/ │ ├── sample_data/ │ └── ... │ ├── output_data/ │ └── ... │ ├── prompts/ │ ├── english/ │ │ ├── zero_shot/ │ │ └── few_shot/ │ │ │ └── arabic/ │ ├── zero_shot/ │ └── few_shot/ │ └── README.md

sample_data/

包含 YallaMorph 基准的样本实例。每个实例指定一个词汇项及模型必须实现的形态特征。

output_data/

包含 YallaMorph 实验期间产生的模型预测结果。实验在不同提示配置下评估多语言与阿拉伯语专用 LLM。模型输出使用固定 JSON 输出格式生成,随后经处理用于评测。

prompts/

包含用于评测模型的提示。提示提供以下语言版本:

  • 英语
  • 阿拉伯语

并提供两种提示设置:

  • 零样本(Zero-shot)
  • 少样本(Few-shot,10-shot)

提示为词性特定,分别针对以下配置:

  • 动词
  • 名词
  • 形容词
  • 附缀感知生成

少样本提示包含 10 个上下文示例,选自与基准评测实例不相交的数据。

引用信息

YallaMorph: A Benchmark for Evaluating Arabic Morphological Generation in Large Language Models

作者:Mahmoud Reda, Salam Khalifa, Reham Marzouk, Nizar Habash

机构:Computational Approaches to Modeling Language (CAMeL Lab), New York University Abu Dhabi

bibtex @inproceedings{reda2026yallamorph, title = {YallaMorph: A Benchmark for Evaluating Arabic Morphological Generation in Large Language Models}, author = {Reda, Mahmoud and Khalifa, Salam and Marzouk, Reham and Habash, Nizar}, year = {2026} }

许可

  • 基准数据、样本数据、提示、文档及其他研究产物:Creative Commons Attribution 4.0 International(CC BY 4.0
  • 源代码与脚本MIT License

YallaMorph 使用 CamelMorph MSA 的形态资源构建,用户还应遵守底层资源的许可与署名要求。

仓库中包含的模型生成输出由各自的语言模型产生,可能额外受相应模型提供方条款与条件的约束。

致谢

本工作于 CAMeL Lab, New York University Abu Dhabi 完成。

搜集汇总
数据集介绍
YallaMorph 数据集图片
构建方式
YallaMorph 的构建根植于阿拉伯语形态生成评估的迫切需求,其数据来源为 CamelMorph MSA 所提供的词元清单与形态分析,并借助 CAMeL Tools 实现范式生成与参考形式验证。为规避组合爆炸,该基准采用语言学动机驱动的分层采样策略,沿词元频率、词根类别、范式完整性与词干复杂度四个维度划定采样层,每层至多抽取十个词元,小层则全部纳入;附缀化子集另从基词子集缩减派生,仅保留完整范式并每类至多选取五个词元。
特点
该基准以超过六十万条评测实例覆盖动词、名词、形容词及其附缀化形式,并显式纳入形态无效配置。其显著特点在于强长的长尾分布,近六成目标形式为未登录形式,约一成三为无效配置所对应的空引用;同时,词元频率、词根类别、范式完整性与词干复杂度等维度均被系统标注,使得评测能够沿语言学与分布性双重视角展开细粒度分析,而非停留于笼统的下游任务表现。
使用方法
在使用上,YallaMorph 将任务定义为槽位级阿拉伯语形态生成:模型接收词元、词性、英文释义及目标形态特征束,输出对应的屈折表层形式,或判定该配置形态上不可实现而返回空结果。特征束依词性而异,动词涉及体、人称、性、数、语态与语气,名词和形容词则涉及性、数、格与状态;附缀配置以位置槽位单独表示,并受词性与特征兼容性约束。评测以 Any Match Accuracy 为主指标,辅以微平均精确率、召回率与 F1,并在带变音符号、不带变音符号及正字归一化三种设定下报告结果。
背景与挑战
背景概述
阿拉伯语的形态生成长期构成语言技术领域的核心难题,其模板式与附加式形态的交互加之词缀与附缀的复杂组合,形成了极为庞大的屈折形式空间。既有阿拉伯语评测多聚焦下游任务或整体生成质量,难以揭示模型能否依据显式词汇与形态特征系统地产出规范词形。在此背景下,纽约大学阿布扎比分校CAMeL实验室联合石溪大学与穆罕默德·本·扎耶德人工智能大学的研究人员于2026年构建了YallaMorph基准,依托CamelMorph MSA的语言资源,涵盖动词、名词、形容词及其附缀形式与无效配置,包含逾60万条评测实例,旨在系统评估大语言模型在受控阿拉伯语形态生成任务上的真实能力。
当前挑战
该基准所应对的领域问题在于,流畅的阿拉伯语生成并不等同于对形态句法特征的精确控制,模型需从词元、词性与特征束映射至正确的屈折表层形式,或判定该配置在形态上不可实现。构建过程中,阿拉伯语庞大的词元清单与特征组合及附缀配置若穷举枚举将产生逾44亿条潜在实例,故须借助基于词元频率、词根类别、范式完整性与词干复杂度的分层抽样框架加以约简,同时需处理多参考形式、无效配置所对应的空值参考以及正字法变体等复杂情形,以确保基准兼具语言覆盖广度与评测可解释性。
常用场景
经典使用场景
在阿拉伯语自然语言处理领域,形态生成长期受制于模板与 concatenative 形态的复杂交互,YallaMorph 应运而生,成为评估大语言模型受控形态生成能力的经典基准。该数据集最典型的用法是:给定词元、词性、英文释义及目标形态特征束,要求模型生成对应的阿拉伯语屈折表面形式,或判定该配置在形态上不可实现。基准覆盖动词、名词、形容词及其附缀化形式,包含超过60万条评测实例,并区分带变音符号与不带变音符号两种设定。研究者借此系统探测模型在主动完成体、被动未完成体、命令式等范式中的形态实现能力,以及处理前附语与后附语组合的句法-形态界面知识。
实际应用
在实际应用层面,YallaMorph 为阿拉伯语自然语言处理系统的开发与诊断提供了关键工具。机器翻译、文本生成、拼写与语法纠错等任务均依赖准确的形态实现,而该基准能够量化模型在真实语言技术场景中的形态可靠性。教育科技场景中,可借助其评测结果优化阿拉伯语学习辅助工具对屈折形式的生成与反馈。此外,该基准覆盖带变音符号的严格设定,直接服务于需要精确读音与形态标注的语音合成、语言档案与宗教文本处理等应用。开发者亦可利用其细粒度分析定位模型在附缀附着、词干选择及变音符号方面的系统性缺陷,从而指导模型微调与数据增强策略。
衍生相关工作
YallaMorph 的构建与发布催生并衔接了一系列经典工作。在资源层面,它直接建立在 CamelMorph MSA 的词汇库与生成引擎之上,并借助 CAMeL Tools 完成参考形式的生成与验证,延续了 Buckwalter 分析器、Aragen/ALMORGEANA 等阿拉伯语形态生成传统。在评测传统上,它与 SIGMORPHON-UniMorph 系列共享任务形成对话,但将后者的多语言屈折评测拓展至阿拉伯语专属的大规模受控场景。同时,该基准与 IMPACT 多语言屈折探针、Alakeel 等人关于词根-模式产出的研究形成互补,推动了以大语言模型为对象的形态评测方法学发展,并为未来扩展至阿拉伯语方言与语境化生成奠定了数据与方法基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务