GigaSpeech 2
收藏资源简介:
GigaSpeech 2是一个针对低资源语言的大规模、多领域自动语音识别语料库,包含自动爬取、转录和精炼过程。数据集包含30,000小时的自动转录语音,涵盖泰语、印尼语和越南语,以及由专业人类注释者转录的10,000小时泰语、6,000小时印尼语和越南语的精炼版本。
GigaSpeech 2 is a large-scale, multi-domain automatic speech recognition corpus designed for low-resource languages, encompassing processes of automatic crawling, transcription, and refinement. The dataset includes 30,000 hours of automatically transcribed speech covering Thai, Indonesian, and Vietnamese, along with refined versions of 10,000 hours of Thai, 6,000 hours of Indonesian, and Vietnamese speech transcribed by professional human annotators.
数据集概述
基本信息
- 数据集名称: GigaSpeech 2
- 版本: 2.0 (发布日期: 2024/06/19)
- 许可证: Apache 2.0
- 支持平台: Linux
- 依赖库: TorchAudio 2.1.0+
数据集内容
- 语言: 泰语 (Thai), 印度尼西亚语 (Indonesian), 越南语 (Vietnamese)
- 音频源:
- GigaSpeech 2 原始: 30,000小时自动转录的语音
- GigaSpeech 2 精炼: 10,000小时泰语, 6,000小时印度尼西亚语和越南语
- DEV & TEST 集: 每种语言10小时的DEV集和10小时的TEST集, 由专业人工标注
训练与评估子集
-
训练子集:
子集 泰语 (小时) 印度尼西亚语 (小时) 越南语 (小时) GigaSpeech 2 原始 12901.8 8112.9 7324.0 GigaSpeech 2 精炼 10262.0 5714.0 6039.0 -
评估子集:
子集 泰语 (小时) 印度尼西亚语 (小时) 越南语 (小时) GigaSpeech 2 DEV 10.0 10.0 10.2 GigaSpeech 2 TEST 10.0 10.0 11.0
数据处理
- 音频处理: 音频文件重采样至16 kHz, 转换为单通道WAV格式
- 文本预处理: 应用NFKC, 转换为大写, 移除标点, 将阿拉伯数字映射为对应语言的单词
- 文本后处理: 应用NFKC, 转换为大写, 移除标点, 合并连续空白或移除所有空白, 以确保不同工具或商业服务间的性能比较
下载地址
- GigaSpeech 2 数据集: HuggingFace
引用信息
@article{gigaspeech2, title={GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement}, author={Yifan Yang and Zheshu Song and Jianheng Zhuo and Mingyu Cui and Jinpeng Li and Bo Yang and Yexing Du and Ziyang Ma and Xunying Liu and Ziyuan Wang and Ke Li and Shuai Fan and Kai Yu and Wei-Qiang Zhang and Guoguo Chen and Xie Chen}, journal={arXiv preprint arXiv:2406.11546}, year={2024}, }




