遇见数据集

Firoj112/nepali-asr-whisper

收藏
Hugging Face2025-11-08 更新2025-11-15 收录
官方服务:

资源简介:

这是一个尼泊尔语自动语音识别数据集,包含了大约252万音频文本对,音频文件为.flac格式,采样率为16 kHz。数据集分为训练集、验证集和测试集,可用于Whisper、Wav2Vec2、Conformer模型的微调,以及语音识别和语言建模的基准测试。

This is a Nepali Automatic Speech Recognition (ASR) dataset containing approximately 2.52 million audio-text pairs, with audio files in .flac format at a sampling rate of 16 kHz. The dataset is split into training, validation, and test sets and can be used for fine-tuning models such as Whisper, Wav2Vec2, and Conformer, as well as for benchmarking speech recognition and language modeling tasks.

提供机构:
Firoj112
二维码
社区交流群
二维码
科研交流群
商业服务