nadi_2026_subtask_4_test
收藏资源简介:
该数据集是一个方言音频数据集,包含2394个训练样本,总大小约为807.75MB。每个样本由三个字段构成:seg_id(片段标识符,字符串类型)、audio(音频数据,采样率为44100Hz)和dialect(方言标签,字符串类型)。数据以单一训练集形式提供,适用于语音处理、方言识别或语音分类等任务。
This dataset is a dialect audio dataset containing 2394 training samples with a total size of approximately 807.75MB. Each sample consists of three fields: seg_id (segment identifier, string type), audio (audio data, sampling rate of 44100Hz), and dialect (dialect label, string type). The data is provided as a single training set and is suitable for tasks such as speech processing, dialect recognition, or speech classification.
数据集概述
数据集名称:NADI 2026 Subtask 4 Test
数据集地址:https://huggingface.co/datasets/UBC-NLP/nadi_2026_subtask_4_test
数据集类型:音频数据
语言/地区:阿拉伯语方言(涵盖8个阿拉伯国家/地区)
数据划分与规模
数据集包含8个子集,分别对应不同国家/地区的语音样本:
| 子集名称 | 样本数量 | 数据大小(字节) |
|---|---|---|
| Algeria | 832 | 105,769,350 |
| Egypt | 824 | 626,706,680 |
| Jordan | 848 | 113,179,786 |
| Mauritania | 948 | 108,089,784 |
| Morocco | 1045 | 319,608,406 |
| Palestine | 667 | 309,779,668 |
| UAE | 813 | 302,012,118 |
| Yemen | 803 | 120,079,324 |
总下载大小:约1.93 GB
总数据集大小:约2.01 GB
数据格式
- 每条样本包含一个字段:
audio(音频数据,dtype为audio) - 数据文件按子集命名(如
data/Algeria-*),可通过Hugging Face Datasets库加载,配置名为default
用途
该数据集为NADI 2026第4子任务的测试集,适用于阿拉伯语方言识别或相关的音频分类任务。




