southern-kurdish-asr
收藏资源简介:
Bestun 是一个用于南库尔德语(ISO 639-3: sdh)自动语音识别(ASR)的数据集,旨在支持这一濒危语言的语音处理研究。数据集包含两个主要部分:训练语料库和评估基准。训练语料库(Bestun)包含约30小时的手动验证朗读语音,共18,636条录音,15,273条独特语句,由208名年龄在18至49岁之间的说话者录制。评估基准包含773条经过验证的语句,总时长为86.74分钟,由来自不同方言区域的8名说话者录制。数据集中的每条记录包含音频文件(WAV格式)和元数据,如南库尔德语阿拉伯字母转写、说话者ID、性别、方言区域标签等。数据集采用CC BY-NC-ND 4.0许可协议发布,适用于低资源语言的ASR任务和研究。
Bestun — Southern Kurdish ASR Corpus and Benchmark 数据集概述
数据集基本信息
- 数据集名称: Bestun — Southern Kurdish ASR Corpus and Benchmark
- 语言: 南库尔德语 (ISO 639-3:
sdh) - 许可证: CC BY-NC-ND 4.0
- 主要任务类别: 自动语音识别 (ASR)
- 相关标签: 库尔德语、南库尔德语、sdh、asr、低资源语言、濒危语言
数据集内容与规模
数据构成
数据集包含两个主要部分:
- Bestun 训练语料库: 约 30 小时 经过人工验证的朗读语音。
- 评估基准: 由来自不同南库尔德语方言区的 8 位说话人录制的 773 条已验证话语 (86.74 分钟)。
数据划分
- 训练集 (
train):- 来源: Bestun 训练语料库 (众包朗读语音)
- 样本数量: 18,635
- 数据大小: 4,653,652,602 字节
- 测试集 (
test):- 来源: 南库尔德语评估基准 (100个句子 × 多位说话人;已验证子集)
- 样本数量: 773
- 数据大小: 499,807,823 字节
整体统计
- 下载大小: 4,410,965,191 字节
- 数据集总大小: 5,153,460,425 字节
数据详情
训练语料库 (Bestun) 统计
- 音频格式: 单声道,24 kHz,WAV
- 总录音数: 18,636
- 唯一话语数: 15,273
- 总时长: 约 30 小时
- 说话人数量: 208 (年龄范围 18–49)
评估基准统计
- 说话人数量: 8 (来自不同方言区)
- 已验证话语数: 773
- 总时长: 86.74 分钟
训练数据采集环境
训练数据通过两种众包工具收集:
telegram_bot: 通过 Telegram 机器人录制。web_tool: 通过基于网络的录制工具 jiridastkrd.com 录制。
数据结构与特征
数据集包含以下特征(字段):
file_name: 文件名 (字符串)kurdish: 南库尔德语阿拉伯字母书写体系的转写文本 (字符串)speaker_id: 匿名化的说话人标识符 (字符串)gender: 说话人性别 (当可用时),值为M或F(字符串)region: 方言/地区标签 (当可用时) (字符串)subset: 数据集构建过程中使用的可选来源标签 (字符串)audio: 语音波形 (WAV 格式的音频数据)
使用方式
通过 Python datasets 库加载
python from datasets import load_dataset ds = load_dataset("aranemini/southern-kurdish-asr")
引用信息
如果使用本数据集,请引用以下论文: bibtex @inproceedings{mohammadamini2026southernkurdish, title = {Southern Kurdish speech recognition resources and benchmarking}, author = {Mohammad Mohammadamini and Marie Tahon}, booktitle = {Proceedings of the 2026 Language Resources and Evaluation Conference (LREC 2026)}, year = {2026}, address = {Palma, Mallorca (Spain)}, publisher = {European Language Resources Association (ELRA)}, }



