Firoj112/nepali-asr-whisper
收藏官方服务:
资源简介:
这是一个尼泊尔语自动语音识别数据集,包含了大约252万音频文本对,音频文件为.flac格式,采样率为16 kHz。数据集分为训练集、验证集和测试集,可用于Whisper、Wav2Vec2、Conformer模型的微调,以及语音识别和语言建模的基准测试。
This is a Nepali Automatic Speech Recognition (ASR) dataset containing approximately 2.52 million audio-text pairs, with audio files in .flac format at a sampling rate of 16 kHz. The dataset is split into training, validation, and test sets and can be used for fine-tuning models such as Whisper, Wav2Vec2, and Conformer, as well as for benchmarking speech recognition and language modeling tasks.
提供机构:
Firoj112


