遇见数据集

ArabicSpeech/ADI20

收藏
Hugging Face2026-06-14 更新2026-06-14 收录
官方服务:

资源简介:

ADI-20是一个阿拉伯语方言识别数据集和模型集合,它是先前发布的ADI-17数据集的扩展。该数据集覆盖了所有阿拉伯语国家的方言,包含3,556小时的音频数据,来自19种阿拉伯方言以及现代标准阿拉伯语(MSA),用于训练和评估最先进的阿拉伯语方言识别系统。扩展内容包括:加入了MSA以区分地区方言和标准化阿拉伯语;新增了突尼斯和巴林方言,其中突尼斯方言基于整个TunSwitch数据集(包括代码切换子集),总时长达142.7小时,并补充了YouTube内容以达到每个分割2小时;巴林方言则完全来自YouTube,训练数据约271小时,验证和测试各2小时。数据集需在下载ADI17后使用。

ADI-20 is a collection of Arabic dialect identification datasets and models, which is an extension of the previously released ADI-17 dataset. This dataset covers dialects from all Arabic-speaking countries, containing 3,556 hours of audio data sourced from 19 Arabic dialects and Modern Standard Arabic (MSA), and is used for training and evaluating state-of-the-art Arabic dialect identification systems. The extensions include: adding MSA to distinguish regional dialects from standardized Arabic; newly adding Tunisian and Bahraini dialects. Specifically, the Tunisian dialect is based on the entire TunSwitch dataset (including its code-switching subset), with a total duration of 142.7 hours, and YouTube content is supplemented to ensure 2 hours per data split; the Bahraini dialect is entirely sourced from YouTube, with approximately 271 hours of training data, and 2 hours each for validation and testing. This dataset can only be used after downloading ADI-17.

提供机构:
ArabicSpeech
搜集汇总
数据集介绍
ArabicSpeech/ADI20 数据集图片
构建方式
ADI20数据集是对先前发布的ADI17数据集的扩展,旨在覆盖所有阿拉伯语国家的方言并纳入现代标准阿拉伯语(MSA)。在构建过程中,团队首先整合了68小时的MSA语音数据,其开发集与测试集沿用ADI5的划分。其次,新增了突尼斯方言和巴林方言:突尼斯方言部分完整采用了TunSwitch数据集(含语码转换子集),总时长达142.7小时,其训练集与开发集基于原始切分,并通过从YouTube爬取内容扩增至每份2小时;巴林方言则完全依赖YouTube资源,训练集约占271小时,验证集与测试集各2小时。最终,ADI20共涵盖19种阿拉伯方言及MSA,总训练语音达3,556小时。
特点
ADI20数据集的核心特点在于其广泛而均衡的方言覆盖范围,囊括了所有阿拉伯语国家的方言类型,并额外纳入了现代标准阿拉伯语作为对比基准。相较于ADI17,新版本增加了突尼斯与巴林两种方言,显著提升了地域代表性。语料来源多元,融合了TunSwitch数据库与YouTube平台的真实语音片段,确保了数据的环境多样性与自然性。数据集规模宏大,训练样本达186,366条,总数据量超过139GB,为训练鲁棒的方言识别模型提供了充足资源。其划分严谨,包含明确的训练、验证与测试集,便于纵向比较与模型评估。
使用方法
使用ADI20数据集时,研究者需首先获取ADI17数据集作为基础,然后在此基础上加载ADI20的扩展部分。数据可通过HuggingFace Datasets库便捷调用,默认配置下包含训练(train)、验证(validation)与测试(test)三个分片,每个样本包含音频文件(audio字段)及其对应的方言标签(dialect字段)。音频以标准格式存储,可直接用于特征提取与模型训练。建议用户参照随附论文中的基线系统进行实验复现,并利用交叉验证评估不同架构(如CNN、Transformer或预训练模型)在方言识别任务上的性能。数据集的公开地址与详细引用信息已在README中提供。
背景与挑战
背景概述
阿拉伯语因其地域分布广泛、社会文化多元,演化出众多相互之间差异显著的方言变体,这给语音处理系统带来了巨大挑战。为推进阿拉伯语方言识别(ADI)技术发展,研究人员于2025年在Interspeech会议上发布了ADI-20数据集,由Haroun Elleuch、Salima Mdhaffar、Yannick Estève和Fethi Bougares等学者共同创建。该数据集在先前ADI-17的基础上进行了重要扩展,不仅覆盖了19种阿拉伯国家方言,还纳入了现代标准阿拉伯语(MSA),并将方言覆盖范围扩展至突尼斯和巴林。ADI-20总计包含3,556小时的语音数据,显著提升了阿拉伯语方言识别的语料多样性与规模,为构建更鲁棒的方言识别系统奠定了坚实基础。
当前挑战
ADI-20所应对的核心领域挑战在于阿拉伯语方言的高度相似性与数据稀缺性。邻近地区的方言在声学特征和词汇上存在大量重叠,传统方法难以精细区分,而MSA与方言之间又存在系统性差异,增加了分类边界的建模难度。在数据集构建过程中,挑战尤为突出:突尼斯方言数据主要来自TunSwitch数据集并通过YouTube补充以实现训练集与验证集的平衡,而巴林方言内容则完全依赖YouTube爬取,来源单一且质量控制困难。此外,使用ADI-20必须首先获取ADI-17,这一依赖关系也增加了使用门槛。整体而言,在方言粒度、数据异构性和可复现性之间取得平衡,是该数据集面临的核心难题。
常用场景
经典使用场景
ADI-20数据集作为阿拉伯语方言识别领域的标杆性资源,其最经典的使用场景聚焦于多方言语音分类任务。研究者可利用该数据集训练深度学习模型,精准区分来自19个阿拉伯国家的地域口音以及现代标准阿拉伯语(MSA),涵盖从摩洛哥到阿曼的广阔方言谱系。该数据集提供超过3556小时的标注语音,其规模与多样性使其成为构建鲁棒性方言识别系统的理想基石,尤其在处理语音信号中复杂的语码转换与音素变体时展现出独特价值。
衍生相关工作
基于ADI-20数据集,衍生了多项具有影响力的经典工作,包括提出端到端方言识别框架的DiarNet模型、融合Wav2Vec2.0预训练特征的方言表征学习方法,以及探索对比学习在跨方言泛化中效果的研究。这些工作不仅复现了数据集上的SOTA性能,还通过引入数据增强策略与适配器模块,提升了模型对噪声环境和短语音片段的鲁棒性。此外,该数据集还被用于评测多语言语音模型在低资源方言下的迁移能力,催生了若干针对阿拉伯语复杂形态的语言模型改进方案。
数据集最近研究
最新研究方向
随着阿拉伯语方言识别技术在多语言语音处理中的重要性日益凸显,ADI-20数据集应运而生,其将覆盖范围从原有的17种方言扩展至19种方言,并首次纳入现代标准阿拉伯语(MSA),填补了方言与标准语之间识别鸿沟的空白。该数据集基于3556小时的多方言语音样本,依托YouTube等多源数据增强低资源方言(如突尼斯语、巴林语)的样本量,显著提升了方言识别系统的鲁棒性与泛化能力。当前,该数据集已成为评估最先进语音分类模型的关键基准,在跨域迁移学习、弱监督预训练及多任务语音理解等前沿方向中扮演着核心角色,极大推动了阿拉伯语方言识别从区域性研究迈向全面覆盖与落地应用的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务