WorldSpeech-mn
收藏资源简介:
WorldSpeech Mongolian (cleaned) 是一个针对蒙古语(喀尔喀蒙古语,西里尔字母)的语音数据集,源自 disco-eth/WorldSpeech 的 mn_mn 配置,经过质量过滤和标准化处理,主要用于文本到语音(TTS)模型训练,也可用于自动语音识别(ASR)。数据集包含 4,228 个音频片段,总时长约 5.15 小时,其中训练集 3,828 个片段(4.67 小时),保留集(withheld)400 个片段(0.48 小时)。保留集与训练集在句子级别上无重叠,确保评估时文本不可见。音频为 24 kHz 单声道 WAV 格式,内嵌于 Parquet 分片文件中。每个样本包含 35 个字段,如音频数据、标准化文本(训练目标)、ASR 转录、对齐分数、测量带宽、DNSMOS 感知质量分数、信噪比、平均基频、音高置信度、性别标签(推断或贡献者提供)、来源信息等。数据清洗流程包括时长(1-20 秒)、削波/直流偏移、Silero VAD、SNR、带宽、DNSMOS、MMS-FA 强制对齐和 ASR CER 等多级门控,所有测量值均保留为字段,允许用户自定义阈值。文本使用 MongolianNormalizer 进行标准化,包括数字扩展、小写折叠和缩写扩展。许可证为 CC-BY-NC-4.0,仅限非商业用途。数据集不适合用于语音克隆,且推断的性别标签需谨慎使用。该数据集在 oron-tts 项目中使用,但实际模型并未在此数据集上训练。
WorldSpeech Mongolian (cleaned) is a speech dataset for Mongolian (Khalkha Mongolian, Cyrillic script), derived from the mn_mn configuration of disco-eth/WorldSpeech, with quality filtering and normalization, primarily for text-to-speech (TTS) model training, and also usable for automatic speech recognition (ASR). The dataset contains 4,228 audio clips totaling approximately 5.15 hours, including a training set of 3,828 clips (4.67 hours) and a withheld set of 400 clips (0.48 hours). The withheld set has no sentence-level overlap with the training set, ensuring unseen text during evaluation. Audio is 24 kHz mono WAV format embedded in Parquet shard files. Each sample includes 35 fields such as audio data, normalized text (training target), ASR transcription, alignment score, measured bandwidth, DNSMOS perceptual quality score, signal-to-noise ratio, mean fundamental frequency, pitch confidence, gender label (inferred or provided by contributor), source information, etc. The cleaning pipeline includes multi-stage gating on duration (1-20 seconds), clipping/DC offset, Silero VAD, SNR, bandwidth, DNSMOS, MMS-FA forced alignment, and ASR CER, with all measurements retained as fields allowing custom thresholds. Text normalization uses MongolianNormalizer for digit expansion, lowercasing, and abbreviation expansion. License is CC-BY-NC-4.0, non-commercial only. The dataset is not suitable for voice cloning, and inferred gender labels should be used with caution. The dataset was used in the oron-tts project, but the actual model was not trained on it.
WorldSpeech Mongolian (cleaned) 数据集详情
数据集名称: WorldSpeech Mongolian (cleaned) 数据集地址: https://huggingface.co/datasets/btsee/WorldSpeech-mn
基本信息
- 语言: 蒙古语(Khalkha Cyrillic,单语种)
- 许可协议: CC-BY-NC-4.0(仅限非商业使用)
- 任务类型: 文本转语音(TTS)、自动语音识别(ASR)
- 样本规模: 1K~10K 条(共 4,228 条语音片段)
- 音频格式: 24 kHz 单声道 WAV(内嵌于 parquet 文件)
- 数据来源: 众包和公共记录(议会及广播录音)
数据集规模
| 子集 | 片段数 | 时长 | 说话人数 |
|---|---|---|---|
| train | 3,828 | 4.67 小时 | 0(未识别) |
| withheld | 400 | 0.48 小时 | 0(未识别) |
| 总计 | 4,228 | 5.15 小时 | — |
其他统计:
- 不同句子数:4,218
- 片段时长中位数:3.48 秒
- 实测带宽中位数:7,664 Hz
- DNSMOS OVR 中位数:3.60
- 对齐得分中位数:0.875
- ASR CER 中位数:0.120
性别分布
| 性别 | 片段数 | 时长 |
|---|---|---|
| 女性 | 638 | 0.79 小时 |
| 男性 | 3,005 | 3.67 小时 |
| 未知 | 585 | 0.69 小时 |
性别标签来源包括:贡献者声明、跨片段传播、基于基频(F0)推断(存储在 gender_source 列中)。
数据特征与字段
主要字段示例:
audio: 24 kHz 单声道 WAV,内嵌存储text: 规范化后的文本(训练目标)human_transcript/asr_transcript: 人工转录和 ASR 转录gender_resolved/gender_source: 解析后的性别及来源duration_s: 音频时长(剪裁后)snr_db/bandwidth_hz: 信噪比和实测带宽dnsmos_sig/dnsmos_bak/dnsmos_ovr/dnsmos_p808: 感知质量评分align_score: 强制对齐置信度cer/len_ratio: 与文本的 ASR 一致性source: 数据来源(如 parliament_mn)split: train / withheld 子集标识- 共 37 列,包含丰富的质量和溯源元数据
数据清洗流程
所有片段必须按顺序通过以下质量门控,任一步失败即被丢弃:
- 时长检查 — 超出 1-20 秒的片段被移除
- 削波和直流偏移检测
- Silero VAD — 检测主要为静音的片段
- 信噪比(SNR) — 基于语音区域 RMS 与非语音 RMS 的比值
- 带宽检测 — 实测低通滤波器拐点
- DNSMOS 质量评分 — SIG / BAK / OVR 三个子维度
- MMS-FA 强制对齐 — 核对音频与给定转录文本是否匹配(主要转录门控)
- ASR CER 二次检查
所有度量值均作为独立列保留,用户可按自定义阈值重新筛选。文本通过 MongolianNormalizer 规范化,包括数字展开、大小写折叠缩写和单位展开。
使用注意事项
- 许可证限制: CC-BY-NC-4.0 严格禁止商业用途,任何在此数据集上训练的模型继承此限制
- 声音克隆伦理: 收录者为公众人物,未同意声音克隆,禁止未经同意合成特定可识别个人的声音
- 覆盖范围: 仅涵盖单一方言变体(朗读语音),口音、方言和自发言语未测试
- 推断性别标签:
gender_source为f0的性别标签基于音高推断,需谨慎使用 - 模型状态: 此数据集未用于
btsee/oron-tts模型训练,模型不携带此数据集的非商业限制
引用信息
建议引用本数据集及上游数据集 disco-eth/WorldSpeech。




