遇见数据集

mbspeech-mn

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

MBSpeech Mongolian (cleaned) 是一个经过质量过滤和规范化的蒙古语语音数据集,源自 MBSpeech Mongolian(圣经朗读语音),专为训练蒙古语(喀尔喀方言、西里尔字母)文本转语音系统而构建。该数据集由 oron-cleaner 工具清洗生成,所有门控阈值均在此语料库上校准,并随数据提供每个片段的各项测量值。数据集包含 2995 个音频片段,总时长约 5.40 小时,所有音频由一位专业男性叙述者录制,以 24 kHz 单声道 WAV 格式内联存储于 Parquet 分片中。数据分为训练集(2795 个片段,5.05 小时)和保留集(200 个片段,0.35 小时),保留集在句子层面上与训练集不重叠,确保文本评估的无偏性。每个样本提供 24 个字段,包括音频数组、原始和规范化转录文本、对齐分数、ASR 字符错误率、信噪比、带宽、DNSMOS 感知质量分数、F0 均值、音高置信度、时长、性别标签及来源、说话人标识等。文本经过蒙古语规范化处理(数字扩展、小型大写字母折叠、缩写和单位扩展),规范化后的字符串同时作为训练目标和 CER 参考。清洗流程包括八步门控:时长、削波/直流偏移、Silero VAD、信噪比、带宽、DNSMOS、MMS-FA 强制对齐和 ASR CER 二次检查,所有测量值均保留为字段,允许用户自行调整过滤阈值。该数据集适用于文本转语音(TTS)和自动语音识别(ASR)任务,特别是零样本语音克隆训练。需注意:数据集仅包含一种语言变体(朗读风格)、一位说话人,覆盖率有限;推断的性别标签(基于F0)可能不准确;使用者应遵守语音克隆伦理,不得未经同意合成可识别个人身份的语音。数据集采用 MIT 许可证。

MBSpeech Mongolian (cleaned) is a quality-filtered and normalized Mongolian speech dataset derived from MBSpeech Mongolian (Bible reading speech), specifically built for training Mongolian (Khalkha dialect, Cyrillic script) text-to-speech systems. It was cleaned using the oron-cleaner tool, with all gating thresholds calibrated on this corpus, and each fragments measurements are provided along with the data. The dataset contains 2995 audio clips totaling approximately 5.40 hours, all recorded by a professional male narrator in 24 kHz mono WAV format stored inline in Parquet shards. The data is split into a training set (2795 clips, 5.05 hours) and a held-out set (200 clips, 0.35 hours), with the held-out set non-overlapping at the sentence level to ensure unbiased text evaluation. Each sample provides 24 fields including audio array, original and normalized transcription text, alignment score, ASR character error rate, signal-to-noise ratio, bandwidth, DNSMOS perceptual quality score, F0 mean, pitch confidence, duration, gender label and source, speaker identifier, etc. The text undergoes Mongolian normalization (digit expansion, small caps folding, abbreviation and unit expansion), and the normalized string serves as both the training target and CER reference. The cleaning pipeline includes eight gating steps: duration, clipping/DC offset, Silero VAD, SNR, bandwidth, DNSMOS, MMS-FA forced alignment, and ASR CER secondary check, with all measurements preserved as fields, allowing users to adjust filtering thresholds. The dataset is suitable for text-to-speech (TTS) and automatic speech recognition (ASR) tasks, especially zero-shot voice cloning training. Note: The dataset contains only one language variant (reading style), one speaker, limited coverage; inferred gender labels (based on F0) may be inaccurate; users should adhere to voice cloning ethics and not synthesize identifiable personal speech without consent. The dataset is licensed under MIT.

创建时间:
2026-09-05
原始信息汇总

MBSpeech Mongolian(清洗版)数据集概述

基本信息

  • 语言:蒙古语(喀尔喀方言,西里尔字母)
  • 许可证:MIT
  • 任务类型:语音合成(text-to-speech)、自动语音识别(automatic-speech-recognition)
  • 数据规模:1K < n < 10K
  • 来源:对 MBSpeech Mongolian(圣经朗读语音)进行质量过滤和文本规范化处理后得到

数据规模与划分

划分 音频片段数 时长 说话人数
train 2,795 5.05小时 1
withheld 200 0.35小时 1
总计 2,995 5.40小时 1
  • withheld 划分中的句子在 train 中不存在,可作为文本层面的评估集(非说话人层面的保留集)
  • 数据以 parquet 分片格式存储,音频以 24 kHz 单声道 WAV 内嵌

数据特征

  • 音频:24 kHz 单声道 WAV(上游原生为 22.05 kHz,实测带宽上限约 7.7 kHz)
  • 文本:包含规范化文本(text,训练目标)、原始句(sentence_orig)和规范句(sentence_norm
  • 质量指标:包含对齐分数(align_score)、ASR 词错误率(cer)、DNSMOS 感知质量评分、信噪比(snr_db)、带宽(bandwidth_hz)、基频(mean_f0_hz)等
  • 元数据:说话人标识(单一男性叙述者)、性别标签(含来源及推断方式)、时长等
  • 文本多样性:2,983 个不同句子(约 1 倍重复)、覆盖 34/35 个字母(缺少“щ”、罕见“ъ”)

清洗流程

每个音频片段需依次通过以下所有门槛,任一不通过则被剔除:

  1. 时长:超出 1–20 秒范围则剔除
  2. 削波和直流偏移检测
  3. Silero VAD:剔除大部分为静音的片段
  4. 信噪比(SNR):语音区 RMS 与真实非语音区 RMS 之比
  5. 带宽:实测低通拐点频率
  6. DNSMOS(SIG/BAK/OVR)感知质量打分
  7. MMS-FA 强制对齐:语音与文本是否匹配(主要文本质检)
  8. ASR CER 二次验证

所有测量值均保留为数据列,允许用户按自定义阈值重新筛选。

数据质量统计(中位数)

  • 片段时长:5.86 秒
  • 带宽:7,562 Hz
  • DNSMOS OVR:4.10
  • 对齐分数:0.921
  • ASR 词错误率:0.105

使用注意事项

  • 许可:单一专业叙述者朗读公有领域文本,以 MIT 协议发布
  • 语音克隆:适合用于零样本 TTS 训练,但应遵循伦理规范,不合成可识别个体的声音
  • 覆盖范围:仅一种语言变体和朗读式语音,未覆盖口音、方言或自然对话
  • 推断性别:当 gender_sourcef0 时,性别标签是基于音高推断而非自我声明

引用方式

如需引用,可参考 README 中提供的 BibTeX 条目(作者为 Battseren Badral,2026)。上游 MBSpeech Mongolian 原始镜像已删除,无上游链接可提供。

搜集汇总
数据集介绍
mbspeech-mn 数据集图片
构建方式
MBSpeech Mongolian (cleaned) 是基于蒙古语喀尔喀方言圣经朗读语音数据的精细化子集,专为文本转语音(TTS)训练而构建。数据通过严格的级联筛选流程进行清洗,包括时长、削波、静音检测、信噪比、带宽、DNSMOS 感知质量评估、MMS-FA 强制对齐及 ASR 词错误率等多项门控指标。每个音频片段均附带详细的派生列,如对齐分数、基频和性别标签,确保透明度和可追溯性。数据被划分为训练集和保留集,保留集在句子层面与训练集隔离,以保证评估目标真正未见。所有音频以 24kHz 单声道 WAV 格式内嵌于 Parquet 分片中,总计 2,995 个片段,时长约 5.4 小时,由单一专业男性叙述者录制。
特点
该数据集的核心特点在于其高品质和精细化的标注体系。音频经过多重质量门控,如中位 DNSMOS OVR 达到 4.10,中位对齐分数为 0.921,确保音频与文本的高度一致性。数据集中包含丰富的元数据列,涵盖信号带宽、信噪比、感知质量评分、强制对齐置信度及基于 F0 推断的性别标签,这些测量值均保留以供用户自定义再筛选。文本经蒙古语归一化处理,涵盖数字扩展、小写折叠和缩写转换,且归一化结果同时作为训练目标与评估基准,避免不一致性。然而,数据集亦存在局限,仅覆盖单一男性叙述者及一种语音风格,字母'щ'缺失,且总体时长未达 25 小时标准,但在男性语音和最小重复性方面表现优异。
使用方法
该数据集通过 Hugging Face `datasets` 库直接加载,支持 `train` 和 `withheld` 拆分,用户可按需下载。其适用于蒙古语 TTS 微调,尤其在 oron-tts 框架下,需先将内嵌音频物化为 WAV 文件及清单文件,再执行训练脚本。用户还可依据列载的派生指标自行设定阈值进行再过滤,以适应特定应用场景。数据集的许可为 MIT,允许广泛使用,但使用时应遵守伦理规范,特别是鉴于其支持零样本语音克隆的能力,禁止在未获同意的情况下合成特定个人语音。此外,数据集仅代表喀尔喀方言与朗读风格,对于其他方言或自发语音的泛化能力尚未验证。
背景与挑战
背景概述
该数据集由研究者Badral Battseren于2026年创建,源自蒙古语圣经朗读语音,经自动化清洗流水线处理而成,旨在为蒙古语(喀尔喀方言,西里尔字母)文本到语音合成系统oron-tts提供高质量训练数据。其核心研究问题在于解决低资源语言语音合成中数据稀缺与质量参差的瓶颈,通过多维度门控筛选(如持续时间、信噪比、带宽、感知质量DNSMOS、强制对齐置信度及ASR词错误率)产出2,995条、合计5.4小时的标准化语音片段,并公开全部元数据以支持可复现研究。该数据集在蒙古语语音技术领域具有开创性,填补了该语言开源高质量TTS语料的空白,其构建范式也为其他低资源语言的语料清洗提供了可借鉴的参考。
当前挑战
该数据集面临的挑战集中在多层面:领域层面,蒙古语语音合成需跨越录音噪声、语音清晰度、文本-音频一致性等障碍,而单一叙述者、单一性别及有限时长(5.4小时)限制了模型泛化能力,难以覆盖多样化的说话人特征与口语风格;构建层面,清洗流程需在自动门控阈值与手动校准间取得平衡,例如ASR词错误率作为二次校验受识别器本身偏差影响,而其文本归一化需谨慎处理数字后缀、缩写等,以避免错误标注被模型学习;此外,性别与说话人信息部分依赖推断,可能引入噪声。这些挑战要求研究者不断优化自动化工具,并审慎评估语料的适用边界。
常用场景
经典使用场景
MBSpeech Mongolian (cleaned) 数据集是面向蒙古语喀尔喀方言西里尔文语音合成与识别研究的精细语料库。其经典使用场景在于为文本到语音(TTS)系统提供高质量的朗读语音训练数据,尤其适用于零样本语音合成或说话人克隆技术的开发。该数据集包含近3000条经过严格质量筛选的语音剪辑,涵盖5.4小时的纯净男性朗读音频,并附带精细的转录文本。研究者可基于其标准化处理流程,直接用于训练端到端TTS模型,如F5-TTS架构,从而为蒙古语这一低资源语言构建出清晰、自然的语音合成系统,填补该语种在语音技术领域的空白。
实际应用
在实际应用层面,该数据集直接服务于面向蒙古语用户的智能语音产品研发。其高质量语音与规范化文本可被用于构建数字助理、有声读物生成系统以及辅助教育工具中的蒙古语文本朗读功能,使机器能够以自然流畅的喀尔喀方言口音将书面文字转化为语音。由于数据源于公有领域文本(圣经朗读)且采用MIT宽松许可,开发者可自由用于商业与非商业项目,降低了语音技术落地的版权风险。同时,数据集附属的性别推断注释与音频质量元数据,亦支持对语音合成系统的音色选择与质量监控,为打造更人性化的蒙古语交互体验奠定了数据基础。
衍生相关工作
基于该数据集已衍生出专门的蒙古语语音合成系统——oron-tts,该系统利用此清洗后的语料进行模型微调,实现了对西里尔蒙古文的端到端语音合成,展示了数据在推动具体开源项目上的直接效益。数据集构建过程中开发的清洗工具oron-cleaner亦成为通用性成果,其可复现的过滤流程与参数阈值设定,为其他低资源语言的语音语料库建设提供了可借鉴的方法论与工程封装。相关文档中阐述的文本标准化策略,如数字扩展对格后缀的处理、小写折叠及缩写展开,为蒙古语文本规范化研究贡献了实用方案。这些衍生工作共同促进了蒙古语语音技术生态的初步形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务