NADI2026_subtask3_TTS_test
收藏资源简介:
本数据集是一个多方言文本数据集,包含10种不同方言类别(ae、dz、eg、jo、ma、ps、sa、sd、tn、ye)的样本,总规模为4001个文本样本,所有样本仅划分为测试集。每个样本包含text字段存储原始文本内容和dialect字段标注方言类别,适用于方言识别、方言文本分类和方言自然语言处理等任务的研究与评估。
This dataset is a multi-dialect text dataset containing samples from 10 different dialect categories (ae, dz, eg, jo, ma, ps, sa, sd, tn, ye), with a total size of 4001 text samples, all of which are divided only into a test set. Each sample includes two fields: the text field stores the original text content, and the dialect field annotates the dialect category of the text. The dataset is suitable for research and evaluation in tasks such as dialect identification, dialect text classification, and dialect natural language processing.
数据集名称
NADI2026_subtask3_TTS_test
数据集概述
该数据集是NADI2026挑战赛子任务3的测试集,专注于阿拉伯语音频到文本的跨方言任务,包含多个阿拉伯方言的文本和方言标签数据。
数据集结构
- 特征:每个样本包含两个字段:
text(字符串类型):文本内容。dialect(字符串类型):对应的方言标签。
- 数据划分:仅提供测试集(
test)划分。
方言配置与规模
数据集包含10个方言配置,每个配置对应一个独立的测试集文件,具体如下:
| 配置名称 | 方言 | 测试样本数 | 测试集大小 |
|---|---|---|---|
ae |
阿联酋方言 | 537 | 39,853 字节 |
dz |
阿尔及利亚方言 | 293 | 29,816 字节 |
eg |
埃及方言 | 424 | 40,174 字节 |
jo |
约旦方言 | 631 | 60,770 字节 |
ma |
摩洛哥方言 | 201 | 23,456 字节 |
ps |
巴勒斯坦方言 | 750 | 66,539 字节 |
sa |
沙特阿拉伯方言 | 100 | 8,072 字节 |
sd |
苏丹方言 | 114 | 8,876 字节 |
tn |
突尼斯方言 | 623 | 58,645 字节 |
ye |
也门方言 | 100 | 31,164 字节 |
总计:全数据集共包含4,001个测试样本,总数据大小约377,365字节。




