UBC-NLP/NADI2026_subtask1.1_Robust_ASR
收藏资源简介:
NADI2026_subtask1.1_Robust_ASR是一个多国家阿拉伯语语音识别数据集,用于NADI2026竞赛的子任务1.1,专注于鲁棒自动语音识别(ASR)。数据集包含来自不同阿拉伯语国家/地区的配置,如阿尔及利亚、埃及、约旦、毛里塔尼亚、摩洛哥、巴勒斯坦、阿联酋和也门。每个配置提供音频文件(采样率为16000Hz)和对应的转录文本,并分为训练集和验证集,旨在支持跨方言的语音识别模型训练和评估。
NADI2026_subtask1.1_Robust_ASR is a multi-country Arabic speech recognition dataset for subtask 1.1 of the NADI2026 competition, focusing on robust automatic speech recognition (ASR). The dataset includes configurations from various Arabic-speaking countries/regions such as Algeria, Egypt, Jordan, Mauritania, Morocco, Palestine, UAE, and Yemen. Each configuration provides audio files (with a sampling rate of 16000 Hz) and corresponding transcriptions, split into training and validation sets, designed to support cross-dialect speech recognition model training and evaluation.




