遇见数据集

common-voice-26-mn

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

Common Voice 26.0 蒙古语(清洗版)是基于 Mozilla Common Voice Corpus 26.0 蒙古语子集,经过质量过滤和文本归一化处理的数据集,专为训练蒙古语(喀尔喀蒙古文西里尔字母)文本转语音(TTS)模型而设计。该数据集由 oron-cleaner 工具构建,所有阈值均针对该语料库校准,并随数据提供每个片段的详细质量指标,支持用户按需重新过滤。 数据集包含15,092个音频片段,总时长约16.33小时,涵盖5,635个不同句子和378个已识别说话人。音频以24 kHz单声道WAV格式内嵌存储在Parquet分片中,便于直接加载。数据划分为训练集(14,515个片段,15.74小时)、验证集(115个片段,0.13小时)、测试集(75个片段,0.07小时)和 withheld 集(387个片段,0.40小时)。其中 withheld 集用于文本级评估,其句子在训练集中被移除,确保评估目标的文本未被模型见过。 每个片段提供丰富的元数据字段,包括:音频本身、说话人信息(性别、年龄、口音)、音频质量指标(SNR、带宽、DNSMOS分数)、对齐置信度(align_score)、ASR转录及CER、音高(F0)等。性别标签经过解析和推断,通过 gender_source 字段标明来源(自我报告、传播或基于F0推断),用户可据此过滤。 清洗流程包含多道门控:时长(1-20秒)、削波/直流偏移、Silero VAD、SNR、带宽、DNSMOS(SIG/BAK/OVR)、MMS-FA强制对齐和ASR CER。所有测量值均保留为列,用户可自行调整阈值。文本经过 oron_tts 的 MongolianNormalizer 归一化,包括数字扩展(拒绝猜测词尾后缀)、小写折叠和缩写扩展,归一化后的文本同时作为训练目标、CER参考和发布的文本。 许可证为 CC0-1.0,但README强调贡献者同意用于语音研究,未同意个别语音克隆,因此禁止在未经个人同意的情况下合成其声音。数据集仅覆盖一种语言变体的朗读语音,口音、方言和自发语音的覆盖范围未经测试。推断的性别标签(基于F0)可能不可靠,建议用户根据 gender_source 字段过滤。

Common Voice 26.0 Mongolian (Cleaned) is a subset of Mozilla Common Voice Corpus 26.0 Mongolian, processed with quality filtering and text normalization, designed for training Mongolian (Khalkha Mongolian Cyrillic) Text-to-Speech (TTS) models. Built with the oron-cleaner tool, all thresholds are calibrated for this corpus, and detailed quality metrics for each segment are provided, allowing users to re-filter on demand. The dataset contains 15,092 audio segments totaling approximately 16.33 hours, covering 5,635 unique sentences and 378 identified speakers. Audio is stored as 24 kHz mono WAV embedded in Parquet shards for easy loading. Data is split into training (14,515 segments, 15.74 hours), validation (115 segments, 0.13 hours), test (75 segments, 0.07 hours), and withheld (387 segments, 0.40 hours) sets. The withheld set is for text-level evaluation, with its sentences removed from the training set to ensure evaluation texts are unseen by the model. Each segment provides rich metadata fields including audio, speaker information (gender, age, accent), audio quality metrics (SNR, bandwidth, DNSMOS scores), alignment confidence (align_score), ASR transcription and CER, pitch (F0), etc. Gender labels are parsed and inferred, with the gender_source field indicating the source (self-reported, propagated, or F0-inferred), allowing user filtering. The cleaning pipeline includes multiple gates: duration (1-20 seconds), clipping/DC offset, Silero VAD, SNR, bandwidth, DNSMOS (SIG/BAK/OVR), MMS-FA forced alignment, and ASR CER. All measurements are kept as columns for user-adjustable thresholds. Text is normalized using oron_ttss MongolianNormalizer, including number expansion (rejecting guessing word-final suffixes), lowercasing, and abbreviation expansion. Normalized text serves as the training target, CER reference, and published text. License is CC0-1.0, but contributors agreed to use for speech research, not individual voice cloning, so synthesizing someones voice without consent is prohibited. The dataset covers only one language variety of read speech; coverage of accents, dialects, and spontaneous speech is untested. Inferred gender labels (based on F0) may be unreliable; users are advised to filter by the gender_source field.

创建时间:
2026-09-04
原始信息汇总

数据集概述

此数据集是 Mozilla Common Voice 26.0 蒙古语(已清洗) 的质量过滤与标准化子集,专为训练蒙古语(喀尔喀方言、西里尔字母)文本转语音(TTS)系统而构建。由 oron-cleaner 工具从 Common Voice 26.0 蒙古语原始语料库中清洗生成,用于训练 oron-tts 模型。

基本信息

  • 许可证:CC0-1.0
  • 语言:蒙古语(单一语言,喀尔喀方言,西里尔字母)
  • 任务类型:文本转语音、自动语音识别
  • 语料规模:10,000-100,000 条音频片段(实际 15,092 条)
  • 数据格式:Parquet 分片,音频以 24 kHz 单声道 WAV 格式内嵌
  • 音频总量:16.33 小时
  • 独立句子:5,635 句
  • 已识别说话人:378 人
  • 音频时长中位数:3.77 秒

数据划分

划分 片段数 时长 说话人数
train 14,515 15.74 小时 252
validation 115 0.13 小时 63
test 75 0.07 小时 63
withheld 387 0.40 小时 95

所有数据均在一个文件集合中,通过 split 列区分划分。withheld 划分中的句子已从 train 中移除,作为文本级留出集。

数据列说明

数据集包含 31 个特征列,涵盖:

  • 音频内容audio(24 kHz WAV)、audio_path(源路径)、path(原始 MP3 路径)
  • 文本信息text(标准化转写文本)、sentence(原始句子)
  • 说话人属性gendergender_resolved(解析后性别)、gender_source(性别来源)、ageaccentsclient_id
  • 质量评分align_score(强制对齐置信度)、cer(ASR 字错误率)、snr_db(信噪比)、bandwidth_hz(实际带宽)
  • 感知质量:DNSMOS 系列指标(dnsmos_sigdnsmos_bakdnsmos_ovrdnsmos_p808
  • 语音特征mean_f0_hz(基频均值)、pitch_confidence(基频置信度)
  • 时长信息duration_s(清洗后时长)、duration_tsv(原始时长)
  • 投票信息up_votesdown_votes
  • 其他标识clip_idsegmentvariantlen_ratiolocalesplit

其中 text 列为训练目标(标准化转写),gender_resolvedgender_source 记录性别推断逻辑(自我报告、跨片段传播或基于 F0 推断)。

基因性别分布

性别 片段数 时长
女性 6,731 7.33 小时
男性 8,194 8.82 小时
未知 167 0.18 小时

清洗流程

每条音频须通过以下全部筛选门槛(按序执行,未通过即丢弃):

  1. 时长:超出 1-20 秒范围的丢弃
  2. 削波与直流偏置:连续满幅样本或直流偏置
  3. Silero VAD:大部分为静音的片段视为录制失败
  4. 信噪比(SNR):对未修剪信号计算语音区 RMS 与非语音区 RMS 之比
  5. 带宽:检测真实低通滤波边界
  6. DNSMOS 感知质量(SIG / BAK / OVR)
  7. MMS-FA 强制对齐:主要转写文本质量门槛
  8. ASR 字错误率(CER):次级检查

所有测量值均保留为数据列,用户可根据自身阈值重新过滤。

文本标准化

使用 oron_tts.text.MongolianNormalizer 进行文本标准化:数字展开(对格后缀拒绝猜测)、小型大写字母折叠(如 ЭЗЭНий 转为 Эзэний)、缩写与单位展开。标准化后的字符串同时作为发布的文本、CER 参考和训练目标,三者保持一致。

注意事项

  • 语音克隆伦理:贡献者同意将录音用于语音研究,并未同意个人声音的克隆。未经本人同意,不应合成具名或可辨识个人的语音。
  • 语料覆盖:仅覆盖一种语言变体的朗读语音,口音、方言和自发语音覆盖未经验证。
  • 推断性别标签:当 gender_sourcef0 时,标签是基于音高的推断而非自我报告。
  • 质量门槛的主观性:阈值是针对此语料校准的,不同应用可能需要不同阈值。
  • 文本覆盖缺口:文本覆盖 34/35 个西里尔字母,щ 字母从未出现。
  • 当前验收状态:总时长未达 25 小时目标(仅 16.3 小时),但男声时长与说话人数已达标准。

引用

如使用此数据集,请引用:

bibtex @misc{orontts_cv_mn, title = {Common Voice 26.0 Mongolian (cleaned)}, author = {Badral, Battseren}, year = {2026}, url = {https://huggingface.co/datasets/btsee/common-voice-26-mn} }

同时请引用上游语料库 Mozilla Common Voice 26.0 Mongolian。此数据集被 btsee/oron-tts(蒙古语 TTS 模型)使用。

搜集汇总
数据集介绍
common-voice-26-mn 数据集图片
构建方式
该数据集源自Mozilla Common Voice Corpus 26.0的蒙古语子集,经系统性质量筛选与文本规范化处理,专为喀尔喀蒙古语(西里尔文)的语音合成与识别任务而构建。构建流程涵盖多级门控:首先依据时长、削波、直流偏移及静音检测剔除低质音频;随后通过信噪比、实测带宽与DNSMOS感知质量评估,并利用MMS-FA强制对齐与ASR词错误率双重校验转录文本的准确性。所有质量指标均以独立列形式保留,以便使用者依据自有阈值重新筛选。文本经MongolianNormalizer规范化,包括数词展开、小型大写字母折叠及缩写扩展,且拒绝猜测带格后缀的模糊情形,确保数据一致性与可追溯性。
特点
该数据集包含15,092条音频片段,总时长约16.33小时,涵盖378位发音人及5,635个不同句子。音频以24kHz单声道WAV格式内嵌存储,并附带丰富元数据,如性别(基于声明或基频推断)、年龄、口音、信噪比、带宽、DNSMOS分数及对齐置信度等。数据划分采用单一文件集,通过'split'列标识训练、验证、测试及文本保留集(withheld),其中保留集句子的文本不出现在训练集中,确保评估目标的真正不可见性。性别标签提供解析版本与来源记录,便于使用者筛选。此外,文本多样性覆盖34/35个字母,但缺少'щ'。
使用方法
该数据集可直接通过HuggingFace datasets库加载,使用load_dataset("btsee/common-voice-26-mn", split="train")即可获取音频与规范化文本对。针对不同任务,用户可依据'split'列过滤所需子集,并利用提供的质量指标列自定义阈值进行二次筛选。此数据集特别适配oron-tts的微调流程,配套脚本可从manifest.jsonl构建F5训练数据并执行预检。鉴于CC0许可,数据可用于商用或研究,但需注意合成语音的伦理边界,避免未经同意克隆个人声音。建议引用原始Common Voice数据集以遵循学术规范。
背景与挑战
背景概述
该数据集为蒙古语(喀尔喀方言,西里尔文字)的语音语料库,源自Mozilla Common Voice Corpus 26.0,由Battseren Badral于2026年构建并整理,旨在支持蒙古语文本转语音(TTS)系统的训练。其核心研究问题在于,针对低资源语言,如何通过严格的质量筛选和文本规范化,获得高可用性的语音数据。该数据集提供了15,092条音频片段,总时长约16.3小时,涵盖378位发音人,并详细标注了性别、年龄、口音、信噪比、带宽、感知质量评分等多种属性。作为蒙古语语音研究的宝贵资源,它填补了该语言在开源语音数据上的空白,对低资源TTS与语音识别的发展具有推动作用。
当前挑战
该数据集所应对的挑战首先在于,蒙古语属于低资源语言,原始众包语音数据常含有背景噪声、录音失真、文本-音频不匹配等问题,直接影响TTS模型的训练效果。因此,构建过程中需设计多级筛选管线,包括时长、削波、直流偏移、静音检测、信噪比、带宽、DNSMOS感知质量评分、强制对齐及ASR一致性校验等八重关卡,每个环节均须精准校准阈值,以确保数据质量。此外,文本规范化面临蒙古语复杂后缀的挑战,需谨慎处理数字后置格,防止猜测性错误。同时,数据集中采用基于F0推断性别标签,可能引入不确定性。最终,当前数据集总量未达预期(16.3小时 vs. 目标25小时),且语料多样性有限,给充分训练鲁棒TTS模型带来一定局限。
常用场景
经典使用场景
该数据集是面向蒙古语(喀尔喀方言,西里尔文字)语音合成与识别任务的高质量清洗子集,源自Mozilla Common Voice 26.0蒙古语语料库。其经典使用场景集中于文本到语音(TTS)与自动语音识别(ASR)模型的训练与评估,尤其为低资源语言蒙古语的端到端语音系统提供了关键数据支撑。数据集中每一条音频均附带精细的声学与文本标注,如信噪比、带宽、对齐得分及感知质量评分,使得研究者能够依据自定义阈值进行二次筛选,从而构建更稳健的语音模型。该子集亦适配零样本语音克隆研究,其转录文本经过规范化处理,保证训练目标的一致性。
实际应用
在实际应用中,该数据集直接服务于蒙古语语音交互产品的开发,例如智能助手、语音导航、无障碍阅读工具及教育软件中的语音朗读功能。其CC0公有领域许可允许商业与学术机构无限制使用,降低了语音技术落地的数据壁垒。结合oron-tts等项目,可用于构建蒙古语语音合成引擎,支持从文本到自然语音的转换,应用于内容创作、有声书生成及辅助沟通设备等场景。此外,数据集中保留的说话人信息与性别推断标签,可为个性化语音定制或多说话人语音系统提供基础,但需遵守语音克隆伦理约束。
衍生相关工作
该数据集直接衍生了蒙古语TTS模型oron-tts,其训练过程与数据清洗工具oron-cleaner相辅相成,形成了一套可复用的低资源语音数据准备框架。该工作启发了后续对Common Voice多语言语料进行自动化质量筛选的研究,推动了基于DNSMOS、强制对齐等技术的清洗流水线在语音领域的标准化应用。相关成果包括针对数据偏差(如性别标签推断)的分析方法,以及文本规范化策略的改进。数据集在HuggingFace上的公开亦促进了蒙古语语音社区的发展,催生了后续关于蒙古语ASR、说话人验证及语音转换等任务的研究,并成为评估数据清洗算法有效性的基准资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务