nepali-asr-data-noisy
收藏资源简介:
Nepali Noisy Speech Evaluation Dataset 是一个用于尼泊尔语(天城文脚本)自动语音识别(ASR)的多条件噪声语音评估数据集。该数据集基于 FLEURS 尼泊尔语测试集,包含 726 条语音样本,每条样本在 31 种不同条件下(1 种干净语音 + 6 种噪声类型 × 5 种信噪比水平)进行录制。音频格式为 16 位 PCM WAV,单声道,采样率 16 kHz。噪声类型包括咖啡馆、人群、混合、交通、白噪声和风声,信噪比水平为 0dB、5dB、10dB、15dB 和 20dB。数据集包含以下字段:音频文件路径、话语 ID、转写文本(尼泊尔语天城文)、噪声类型、信噪比(dB)、条件标签和数据集划分(测试集)。该数据集适用于噪声鲁棒性 ASR 系统的评估和训练。
Nepali Noisy Speech Evaluation Dataset is a multi-condition noisy speech evaluation dataset for Nepali (Devanagari script) automatic speech recognition (ASR). Built upon the FLEURS Nepali test set, this dataset contains 726 speech samples, with each sample recorded under 31 distinct conditions: 1 clean speech condition, paired with 6 noise types across 5 signal-to-noise ratio (SNR) levels. The audio format is 16-bit PCM WAV, mono channel, with a sampling rate of 16 kHz. The noise types include café noise, crowd noise, mixed noise, traffic noise, white noise, and wind noise, with the SNR levels set as 0dB, 5dB, 10dB, 15dB, and 20dB. The dataset includes the following fields: audio file path, utterance ID, transcribed text (Nepali Devanagari script), noise type, signal-to-noise ratio (dB), condition label, and dataset split (test set). This dataset is suitable for evaluating and training noise-robust ASR systems.
Nepali Noisy Speech Evaluation Dataset 数据集概述
基本描述
- 数据集名称:Nepali Noisy Speech Evaluation Dataset
- 数据集地址:https://huggingface.co/datasets/gam30/nepali-asr-data-noisy
- 许可协议:MIT
- 主要任务类别:自动语音识别
- 语言:尼泊尔语
- 相关标签:speech, noise-robust-asr, audio, snr, nepali, devanagari, fleurs
- 数据规模:10K < n < 100K
数据来源与构成
- 数据来源:基于 FLEURS 数据集的尼泊尔语测试集
- 基线模型:ai4bharat/indic-conformer-600m-multilingual
- 总样本数:每个条件 726 条样本
- 音频格式:16-bit PCM WAV,单声道,16 kHz 采样率
- 数据划分:仅包含测试集,共 726 个样本
噪声条件
数据集包含 31 种条件:1 种干净语音条件 + 6 种噪声类型 × 5 种信噪比水平。
- 干净条件:clean
- 噪声类型:cafe, crowd, mixed, traffic, white, wind
- 信噪比水平:0 dB, 5 dB, 10 dB, 15 dB, 20 dB
数据结构
数据集包含以下特征:
- audio:音频数据
- utterance_id:样本ID,格式为从“0000”到“0725”的零填充索引
- transcription:尼泊尔语文本标注
- noise_type:噪声类型
- snr_db:信噪比值,干净语音为 -1
- condition:完整条件标签
- split:数据划分名称
配置与加载
数据集提供多种配置,可通过 load_dataset 函数加载。
- 配置示例:clean, cafe_0dB, cafe_5dB, ..., wind_20dB
- 加载方式:支持加载单个条件、所有条件或合并特定条件。
文件格式
元数据文件为 JSON Lines 格式,每条记录包含音频文件路径及所有特征信息。音频文件路径为相对于数据集根目录的相对路径。



