遇见数据集

CARDAMOM

收藏
arXiv2026-09-28 更新2026-10-01 收录
官方服务:

资源简介:

CARDAMOM是一个面向阿拉伯语微方言的语音数据集,由多所大学研究者联合创建,包含约40小时转录语音,覆盖埃及、约旦、黎巴嫩、毛里塔尼亚、巴勒斯坦、沙特六国21种微方言,共计27,420条话语。数据来自YouTube非脚本化自然对话,由母语者标注,提供微方言标签、语码转换信息及感知性别。数据集旨在支持自动语音识别(ASR)系统的细粒度评估与适配,解决传统粗粒度方言标签无法捕捉的本地化变异问题。

CARDAMOM is a speech dataset targeting Arabic micro-dialects, jointly created by researchers from multiple universities. It contains approximately 40 hours of transcribed speech, covering 21 micro-dialects across six countries including Egypt, Jordan, Lebanon, Mauritania, Palestine, and Saudi Arabia, with a total of 27,420 utterances. The data is sourced from unscripted natural conversations on YouTube, annotated by native speakers, and provides micro-dialect labels, code-switching information, and perceived gender. This dataset is designed to support fine-grained evaluation and adaptation of automatic speech recognition (ASR) systems, addressing the localized linguistic variation issues that cannot be captured by traditional coarse-grained dialect labeling.

创建时间:
2026-09-28
搜集汇总
数据集介绍
CARDAMOM 数据集图片
构建方式
CARDAMOM的构建根植于阿拉伯语方言资源长期受粗粒度国别标签制约的学术背景,旨在捕捉同一国家内部被既有语料所遮蔽的微观方言差异。研究团队以社区众包为核心理念,邀请来自埃及、约旦、黎巴嫩、毛里塔尼亚、巴勒斯坦与沙特六国的母语者,依据自身语言与地理知识拟定候选微观方言清单,并将高度相似者合并以降低标签冗余。随后,标注者从YouTube采集非脚本、非朗读的自然口语素材,经切分后统一导入Label Studio完成标注,全程以书面指南与周会协调保障一致性,最终形成约四十小时、覆盖二十一种微观方言的语音语料。
特点
该数据集最显著的特色在于其超细粒度的方言标注体系。全部语音以独立标注文件形式发布,不直接再分发音频,每条话语附带源视频标识、人工转写、一种或多种微观方言标签、感知性别、语码转换状态及起止时间戳,可经由原始视频标识重建语料。其微观方言标签横跨城乡与地域变体,如埃及的Cairene、Saidi,约旦的Madani、Falahi、Badawi,黎巴嫩的Chamali、Jnoubi、B’albaki,毛里塔尼亚的Western、Northern、Southern,巴勒斯坦的Madani、Falahi、Badawi,以及沙特的Najdi、Hijazi等,并允许一条话语归属多个变体,从而刻画方言连续体之间的真实交叠。
使用方法
CARDAMOM的设计定位为低资源诊断性评测与适配资源,而非大规模预训练语料。使用者可依据官方提供的训练、开发与测试划分,在零样本条件下评估多语言语音识别系统在二十一种微观方言上的词错率与字错率,亦可利用训练集对Whisper、SeamlessM4T及OmniASR等模型进行LoRA或全参数微调,并借助开发集验证。此外,其微观方言标签可直接用于音频级方言辨识任务,包括六国识别、二十一路全局微观方言识别以及给定国家的条件式微观方言识别,亦可结合ALDi等方言度评分工具,分析方言性与识别难度之间的非对称关系。
背景与挑战
背景概述
阿拉伯语语音技术长期以现代标准阿拉伯语为核心,而日常交际实则以方言为主,方言内部又因地理、迁徙与社会接触形成显著的地方变体,仅用国别标签难以刻画此类细微差异。既有Casablanca、SADA等语料多停留于国家级或大区级方言粒度,子国家层面的语音连续体长期缺乏监督信号。CARDAMOM由不列颠哥伦比亚大学等十六家机构于2025年前后联合构建,以母语者社区众包方式从YouTube采集约40小时自然口语,覆盖埃及、约旦、黎巴嫩、毛里塔尼亚、巴勒斯坦与沙特六国的21种微方言,并为每个语段标注转写、微方言标签、语码转换与感知性别。该数据集首次将微方言级监督引入阿拉伯语ASR评测,为零样本评估与方言适配提供了细粒度基准。
当前挑战
CARDAMOM所应对的核心难题,在于微方言之间边界渐变且相互渗透,同一话语常兼容多种地方变体,而YouTube来源又使类型、录音条件与说话人性别分布高度不均,个别微方言如黎巴嫩B'albaki与沙特Northern样本稀少,导致评测结论的稳健性受限。构建过程中的挑战同样突出:方言缺乏统一书写规范,转写者需在忠实语音与可读拼写间权衡;语码转换需并行提供阿拉伯字母与拉丁字母两套转写;跨境微方言如约旦Badawi与沙特Northern共享贝都因音系特征,标注边界模糊;加之社区标注未做全语料双标,标注者一致性难以量化。这些因素共同造成ASR错误率在不同微方言间显著分化,毛里塔尼亚与黎巴嫩变体尤为困难。
常用场景
经典使用场景
在阿拉伯语自动语音识别领域,CARDAMOM 最为经典的用法是作为微方言层面的细粒度评测基准。研究者利用其覆盖埃及、约旦、黎巴嫩、毛里塔尼亚、巴勒斯坦与沙特六国、二十一种次国家方言的约四十小时转写语音,在零样本与适配两种设定下检验 Whisper、Seamless、OmniASR 等多语种系统的识别表现,并借助语句级方言标签、语码转换标记与感知性别元数据,剖析模型在首都主流变体与边缘乡土变体之间的性能落差,从而揭示被国别标签所遮蔽的方言连续体。
衍生相关工作
围绕 CARDAMOM 已衍生出若干相互衔接的经典工作脉络。其微方言标签被直接用作音频端方言辨识的下游学习目标,催生了基于 Whisper 编码器的多任务分类器与经 LoRA 微调的 Qwen3-Omni 辨识系统,在二十一路微方言辨识上取得显著精度;同时,该资源与 Casablanca、NADI 2025、ADI-20 等方言语音基准形成互补,并与 PolyWER、ALDi 等评测与方言度量化工具相衔接,共同推动阿拉伯语语音技术从国别粒度向微方言粒度的范式迁移。
数据集最近研究
最新研究方向
阿拉伯语语音识别长期受制于方言资源在国别粒度上的粗放标注,次国别层面的微观方言变异始终缺乏可计算、可复现的监督信号,CARDAMOM的推出正是对这一结构性缺口的直接回应。该数据集以社区众包方式汇集六国21种微观方言、约40小时真实YouTube语音,并在零样本与适配两种设定下系统评测Whisper-v3、Seamless-v2及OmniASR等主流多语种系统,揭示毛里塔尼亚与黎巴嫩变体错误率显著偏高、首都圈变体因预训练曝光充足而相对易识别的非均衡格局。其前沿意义在于将方言识别由粗粒度国别分类推进至微观方言层级,使模型泛化能力的细粒度诊断成为可能,并为低资源方言的适配与公平性评估提供了可复用的基准资源。
相关研究论文
  • 1
    CARDAMOM: A Micro-Dialectal Arabic Speech Dataset for ASR不列颠哥伦比亚大学; 哈马德·本·哈利法大学; 比尔宰特大学; 贝鲁特美国大学; 阿拉伯政策研究中心; 法赫德国王石油矿产大学; 塔伊巴大学; 高等数字学院; 伊玛目阿卜杜勒拉赫曼·本·费萨尔大学; 北部边境大学; 约旦科技大学; 巴德尔开罗大学; 埃尔塞维迪科技大学; 帝国理工学院; 黎巴嫩大学; 阿尔贝特大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务