遇见数据集

WorldSpeech-mn

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

WorldSpeech Mongolian (cleaned) 是一个针对蒙古语(喀尔喀蒙古语,西里尔字母)的语音数据集,源自 disco-eth/WorldSpeech 的 mn_mn 配置,经过质量过滤和标准化处理,主要用于文本到语音(TTS)模型训练,也可用于自动语音识别(ASR)。数据集包含 4,228 个音频片段,总时长约 5.15 小时,其中训练集 3,828 个片段(4.67 小时),保留集(withheld)400 个片段(0.48 小时)。保留集与训练集在句子级别上无重叠,确保评估时文本不可见。音频为 24 kHz 单声道 WAV 格式,内嵌于 Parquet 分片文件中。每个样本包含 35 个字段,如音频数据、标准化文本(训练目标)、ASR 转录、对齐分数、测量带宽、DNSMOS 感知质量分数、信噪比、平均基频、音高置信度、性别标签(推断或贡献者提供)、来源信息等。数据清洗流程包括时长(1-20 秒)、削波/直流偏移、Silero VAD、SNR、带宽、DNSMOS、MMS-FA 强制对齐和 ASR CER 等多级门控,所有测量值均保留为字段,允许用户自定义阈值。文本使用 MongolianNormalizer 进行标准化,包括数字扩展、小写折叠和缩写扩展。许可证为 CC-BY-NC-4.0,仅限非商业用途。数据集不适合用于语音克隆,且推断的性别标签需谨慎使用。该数据集在 oron-tts 项目中使用,但实际模型并未在此数据集上训练。

WorldSpeech Mongolian (cleaned) is a speech dataset for Mongolian (Khalkha Mongolian, Cyrillic script), derived from the mn_mn configuration of disco-eth/WorldSpeech, with quality filtering and normalization, primarily for text-to-speech (TTS) model training, and also usable for automatic speech recognition (ASR). The dataset contains 4,228 audio clips totaling approximately 5.15 hours, including a training set of 3,828 clips (4.67 hours) and a withheld set of 400 clips (0.48 hours). The withheld set has no sentence-level overlap with the training set, ensuring unseen text during evaluation. Audio is 24 kHz mono WAV format embedded in Parquet shard files. Each sample includes 35 fields such as audio data, normalized text (training target), ASR transcription, alignment score, measured bandwidth, DNSMOS perceptual quality score, signal-to-noise ratio, mean fundamental frequency, pitch confidence, gender label (inferred or provided by contributor), source information, etc. The cleaning pipeline includes multi-stage gating on duration (1-20 seconds), clipping/DC offset, Silero VAD, SNR, bandwidth, DNSMOS, MMS-FA forced alignment, and ASR CER, with all measurements retained as fields allowing custom thresholds. Text normalization uses MongolianNormalizer for digit expansion, lowercasing, and abbreviation expansion. License is CC-BY-NC-4.0, non-commercial only. The dataset is not suitable for voice cloning, and inferred gender labels should be used with caution. The dataset was used in the oron-tts project, but the actual model was not trained on it.

创建时间:
2026-09-04
原始信息汇总

WorldSpeech Mongolian (cleaned) 数据集详情

数据集名称: WorldSpeech Mongolian (cleaned) 数据集地址: https://huggingface.co/datasets/btsee/WorldSpeech-mn

基本信息

  • 语言: 蒙古语(Khalkha Cyrillic,单语种)
  • 许可协议: CC-BY-NC-4.0(仅限非商业使用)
  • 任务类型: 文本转语音(TTS)、自动语音识别(ASR)
  • 样本规模: 1K~10K 条(共 4,228 条语音片段)
  • 音频格式: 24 kHz 单声道 WAV(内嵌于 parquet 文件)
  • 数据来源: 众包和公共记录(议会及广播录音)

数据集规模

子集 片段数 时长 说话人数
train 3,828 4.67 小时 0(未识别)
withheld 400 0.48 小时 0(未识别)
总计 4,228 5.15 小时

其他统计:

  • 不同句子数:4,218
  • 片段时长中位数:3.48 秒
  • 实测带宽中位数:7,664 Hz
  • DNSMOS OVR 中位数:3.60
  • 对齐得分中位数:0.875
  • ASR CER 中位数:0.120

性别分布

性别 片段数 时长
女性 638 0.79 小时
男性 3,005 3.67 小时
未知 585 0.69 小时

性别标签来源包括:贡献者声明、跨片段传播、基于基频(F0)推断(存储在 gender_source 列中)。

数据特征与字段

主要字段示例:

  • audio: 24 kHz 单声道 WAV,内嵌存储
  • text: 规范化后的文本(训练目标)
  • human_transcript / asr_transcript: 人工转录和 ASR 转录
  • gender_resolved / gender_source: 解析后的性别及来源
  • duration_s: 音频时长(剪裁后)
  • snr_db / bandwidth_hz: 信噪比和实测带宽
  • dnsmos_sig / dnsmos_bak / dnsmos_ovr / dnsmos_p808: 感知质量评分
  • align_score: 强制对齐置信度
  • cer / len_ratio: 与文本的 ASR 一致性
  • source: 数据来源(如 parliament_mn)
  • split: train / withheld 子集标识
  • 共 37 列,包含丰富的质量和溯源元数据

数据清洗流程

所有片段必须按顺序通过以下质量门控,任一步失败即被丢弃:

  1. 时长检查 — 超出 1-20 秒的片段被移除
  2. 削波和直流偏移检测
  3. Silero VAD — 检测主要为静音的片段
  4. 信噪比(SNR) — 基于语音区域 RMS 与非语音 RMS 的比值
  5. 带宽检测 — 实测低通滤波器拐点
  6. DNSMOS 质量评分 — SIG / BAK / OVR 三个子维度
  7. MMS-FA 强制对齐 — 核对音频与给定转录文本是否匹配(主要转录门控)
  8. ASR CER 二次检查

所有度量值均作为独立列保留,用户可按自定义阈值重新筛选。文本通过 MongolianNormalizer 规范化,包括数字展开、大小写折叠缩写和单位展开。

使用注意事项

  • 许可证限制: CC-BY-NC-4.0 严格禁止商业用途,任何在此数据集上训练的模型继承此限制
  • 声音克隆伦理: 收录者为公众人物,未同意声音克隆,禁止未经同意合成特定可识别个人的声音
  • 覆盖范围: 仅涵盖单一方言变体(朗读语音),口音、方言和自发言语未测试
  • 推断性别标签: gender_sourcef0 的性别标签基于音高推断,需谨慎使用
  • 模型状态: 此数据集未用于 btsee/oron-tts 模型训练,模型不携带此数据集的非商业限制

引用信息

建议引用本数据集及上游数据集 disco-eth/WorldSpeech

搜集汇总
数据集介绍
WorldSpeech-mn 数据集图片
构建方式
WorldSpeech-mn 数据集源于对 disco-eth/WorldSpeech 的蒙古语子集进行系统性的质量筛选与规范化处理。其构建流程遵循多级级联的门控机制,依次对音频时长、削波与直流偏移、静音比例、信噪比、带宽、DNSMOS 感知质量、MMS-FA 强制对齐置信度及 ASR 词错误率等指标进行严苛审定,任一环节不达标即被剔除。此外,文本经由专用规范化器处理,确保数字、缩写等表达形式的一致性与可复现性,最终以 Parquet 分片格式封装 24 kHz 单声道音频及详尽元数据,形成训练与 withheld 双分割的语料库。
特点
该数据集的核心特质在于其透明性与可定制性。每个样本均附带自原始语料保留并重新计算的四十余项衍生指标,涵盖声学特征、质量评估、对齐评分及性别推断等维度,使研究者能够依据自有阈值进行二次过滤。数据划分策略独具匠心,withheld 分割确保评估文本在训练中完全不可见,为文本到语音模型提供了严谨的泛化测试基准。尤为珍贵的是,该数据集是唯一具备真实全频带内容的蒙古语开源语音资源,其语音多样性涵盖议会辩论及广播节目,虽以男性语音为主,但语料统计信息完备,便于构建性别平衡的后续子集。
使用方法
使用者可通过 HuggingFace datasets 库便捷加载,如 `load_dataset("btsee/WorldSpeech-mn", split="train")` 获取训练样本。鉴于音频内嵌于 Parquet 文件中,用于 oron-tts 微调前需先物化为独立 wav 文件及 manifest 清单,仓库提供 `build_f5_dataset.py` 脚本简化该流程。manifest.jsonl 亦单独提供,便于在不下载音频的情况下进行快速检视与过滤。所有字段均留有原始与处理后对照值,研究者可依据个人需求灵活调整筛选策略,以适应不同的训练场景与质量要求。
背景与挑战
背景概述
WorldSpeech-mn 数据集由 Battseren Badral 于 2026 年构建,源自 disco-eth/WorldSpeech 的蒙古语(喀尔喀蒙古语,西里尔文)子集,旨在为文本到语音合成提供经过严格质量清洗的语料。该数据集共包含 4228 个音频片段,总时长约 5.15 小时,语音来自蒙古国议会及广播录音,由众包方式收集并标注。其核心研究问题在于构建一个干净、规范且可用于训练单语 TTS 模型的蒙古语语音数据集,填补蒙古语开源高质量语音资源的稀缺。该数据集附带了精细的多维质量评分(如 DNSMOS、带宽、信噪比等)以及文本规范化工具(oron-cleaner),为低资源语音合成领域提供了可复现的清洗范式,对蒙古语语音技术及高保真 TTS 模型训练具有重要参考价值。
当前挑战
该数据集所应对的核心挑战在于蒙古语作为低资源语言,公开的语音语料质量参差不齐,包括背景噪声、带宽限制、转录错误及文本规范化歧义(如数词后缀的拓展)等,常导致 TTS 模型训练不稳定。构建过程中,团队需对原始语料实施多重过滤:基于时长、削波、VAD、SNR、带宽、DNSMOS 感知质量以及强制对齐和 ASR 一致性检验的级联门控,每一道门槛均需在语料上精心校准,并保留各测量值供用户自定义阈值。此外,语音数据的性别不平衡(男性时长 3.7 小时,女性仅 0.8 小时)、说话人身份未知、以及部分样本推断性别标签依赖 F0 等,也增加了语料用于零样本语音克隆时的伦理风险。该数据未能达到其设计管线的 15% 通过率门槛,凸显了开源语音数据在质量控制与合规授权两方面的普遍困境。
常用场景
经典使用场景
WorldSpeech-mn是专为蒙古语喀尔喀方言西里尔文本到语音(TTS)系统训练而构建的高质量语音数据集,其经典使用场景在于微调诸如oron-tts等神经TTS模型。该数据集提供了经过精细清洗与标准化处理的音频-文本对,涵盖超过4200条总时长约5.15小时的语音片段,全部源自蒙古国议会等真实广播场景,采样率为24kHz,具备完整的频带信息。研究者可依托其丰富的标注字段,如归一化文本、强制对齐置信度、DNSMOS感知质量评分及基频参数,进行模型训练与效果验证,是低资源蒙古语语音合成研究不可或缺的基石。
解决学术问题
该数据集针对低资源语言语音研究中数据稀缺与质量参差的核心难题,提出了一套严密的自动化清洗pipeline,通过时长限制、削波检测、静音剔除、信噪比评估、带宽测量、DNSMOS评分、强制对齐及ASR交叉验证等多重门控,系统性去除了噪声、口误及不精确转写,确保每条样本的文本与语音高度吻合。其发布的归一化文本统一了数字、缩写等格式,避免了蒙古语词尾变格等歧义问题,为学术界提供了可复现的高标准训练基准,有效推动了低资源TTS与语音识别(ASR)模型在蒙语上的性能提升与公平评估。
衍生相关工作
该数据集催生了一系列围绕低资源语音数据清洗与TTS训练的衍生工作。其构建工具oron-cleaner已成为一套可复用的通用清洗框架,其中关键的指标阈值设定与特征体系被后续研究采纳,用以处理其他低资源语言。与之配套的oron-tts模型训练工具链,亦因该数据集的验证而完善,并在蒙古语语音社区中形成了标准化流程。此外,研究论文常引用该数据集来对比不同清洗策略对TTS性能的影响,推动了基于DNSMOS、强制对齐等自动化质量评估在语音数据筛选中的理论研究,为数据驱动的声音克隆与多语种语音合成提供了方法论借鉴。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务