遇见数据集

UBC-NLP/NADI_2026_ADI20_micro

收藏
Hugging Face2026-06-16 更新2026-06-21 收录
官方服务:

资源简介:

这是一个小型版本的阿拉伯语方言识别数据集,基于ADI-20/ADI-17数据集,专为NADI 2026共享任务设计。数据集包含20种阿拉伯语方言的音频数据,每种方言提供10小时的录音,这些录音源自原始ADI-17数据集以及ADI-20中新增的方言。它旨在用于训练阿拉伯语方言识别模型,覆盖的方言包括:MSA(现代标准阿拉伯语)、BAH(巴林)、TUN(突尼斯)、ALG(阿尔及利亚)、EGY(埃及)、IRA(伊拉克)、JOR(约旦)、KSA(沙特阿拉伯)、KUW(科威特)、LEB(黎巴嫩)、LIB(利比亚)、MAU(毛里塔尼亚)、MOR(摩洛哥)、OMA(阿曼)、PAL(巴勒斯坦)、QAT(卡塔尔)、SUD(苏丹)、SYR(叙利亚)、UAE(阿联酋)和YEM(也门)。

This is a smaller version of the ADI-20/ADI-17 Arabic dialect identification dataset, designed for the NADI 2026 shared task. The dataset consists of audio data from 20 Arabic dialects, with 10 hours of recordings per dialect, sourced from the original ADI-17 dataset and the new dialects introduced in ADI-20. It is intended for training Arabic dialect identification models and covers the following dialects: MSA, BAH, TUN, ALG, EGY, IRA, JOR, KSA, KUW, LEB, LIB, MAU, MOR, OMA, PAL, QAT, SUD, SYR, UAE, YEM.

提供机构:
UBC-NLP
搜集汇总
数据集介绍
UBC-NLP/NADI_2026_ADI20_micro 数据集图片
构建方式
在阿拉伯语方言识别研究领域,数据集的规模与方言覆盖度是模型性能的关键瓶颈。NADI_2026_ADI20_micro数据集作为NADI 2026共享任务的精简版本,从原始的ADI-17与ADI-20数据集中精心抽取而成。其构建策略为:针对ADI-17中原有的每一种方言方言以及ADI-20新增的每一种方言,均采集了10小时的语音片段,从而确保每种方言在数据量上的均等代表性,最终汇聚为包含20种阿拉伯语方言的微型语音集合。
特点
该数据集最显著的特征在于其均衡性与多样性。它涵盖了从现代标准阿拉伯语(MSA)到巴林(BAH)、突尼斯(TUN)、阿尔及利亚(ALG)等共计20种地域方言,全面映射了阿拉伯世界的语言变体光谱。每一方言均被赋予等量时长,有效规避了模型训练中对大语种方言的偏向性。此外,数据集划分为训练集(67,015样本)与验证集(10,806样本),并采用音频与方言标签对应的结构化格式,为后续模型开发奠定了坚实的数据基础。
使用方法
在实际应用中,研究者可通过HuggingFace平台便捷地加载该数据集。使用datasets库的load_dataset函数,指定数据集名称即可获取包含训练与验证拆分的数据对象。数据以字典形式呈现,每条记录包含audio(音频张量或路径)与dialect(方言标签,如'EGY'代表埃及方言)两个字段。鉴于数据量较小,该数据集适用于快速原型验证、跨方言对比实验以及作为完整ADI-20数据集的微调前的探索性测试集,直接支撑方言识别模型的训练与评估流程。
背景与挑战
背景概述
阿拉伯语作为全球使用范围广泛的语言,其方言间差异显著,为自然语言处理领域带来了独特挑战。NADI_2026_ADI20_micro数据集由阿拉伯语音处理社区于近年构建,依托于ADI-17与ADI-20系列工作,核心研究团队包括Elleuch等研究者,相关成果发表于Interspeech 2025等权威会议。该数据集聚焦于阿拉伯语方言识别任务,提供了涵盖20种方言的音频样本,包括现代标准阿拉伯语及海湾、北非、黎凡特地区等代表性变体,旨在推动多方言语音系统的泛化能力。通过缩小数据规模至每方言10小时,该数据集降低了研究门槛,同时保持了方言多样性,已成为NADI 2026共享任务的关键基准,显著促进了阿拉伯语方言识别领域的标准化评估与跨方言技术对比。
当前挑战
该数据集所解决的领域问题核心在于阿拉伯语方言辨识的高度复杂性,方言间在音系、词汇与句法层面呈现连续而非离散的差异,加之资源稀缺方言的数据稀疏性,严重制约了传统声学模型的辨别力。构建过程中,挑战主要体现在三个方面:一是从原始大规模语料中抽取均衡的每方言10小时子集,需在保持声学环境多样性与避免说话人偏向之间寻求平衡;二是确保标注一致性,跨越多个地域的方言标注依赖专业语言学家的协作,难免引入主观偏差;三是处理低资源方言的录音质量差异,部分方言的原始音频信噪比不一,增加了模型鲁棒性设计的难度。
常用场景
经典使用场景
在阿拉伯语方言识别的研究领域中,NADI_2026_ADI20_micro数据集作为ADI-20的紧凑版本,每个方言精心选取了10小时的音频样本,覆盖了从现代标准阿拉伯语到20种区域方言的广泛频谱。该数据集最经典的使用场景是构建多类别方言分类系统,特别是在资源受限或快速原型开发的情境下,研究者能够利用其均衡的方言分布进行模型训练与验证。通过音频特征提取与深度学习架构的结合,该数据集为方言识别任务提供了标准化的评估基准,推动了不同方言间声学差异的量化分析。
解决学术问题
该数据集直面阿拉伯语方言识别中数据稀疏与方言间声学相似性造成的混淆难题,解决了因方言样本不均导致的模型泛化能力不足的学术困境。通过提供包含20种方言的均衡微缩样本,研究者能够在可控实验条件下探索方言特异性声学特征,进而揭示不同方言在音位、韵律和词汇层面的分布规律。这一贡献不仅提升了方言识别的准确率,还深化了对阿拉伯语地域变异模式的认知,为计算语言学中的方言分类理论提供了实证支持。
衍生相关工作
基于该数据集,衍生出的经典工作包括方言自监督预训练模型的提出,例如利用HuBERT和wav2vec 2.0架构在ADI-20微缩版上进行特征学刁,从而在下游分类任务中取得突破性进展。此外,研究者还开发了多任务学习框架,将方言识别与语音情感分析、说话人验证相结合,拓展了语音信号的多维解析能力。这些工作不仅巩固了NADI系列数据集在阿拉伯语语音研究中的核心地位,还催生了跨方言迁移学习的新范式,为低资源语言处理提供了可复现的基准参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务