遇见数据集

common-voice-scripted-speech-25-0

收藏
Hugging Face2026-06-16 更新2026-06-17 收录
官方服务:

资源简介:

Common Voice Scripted Speech 25.0 是一个基于 Mozilla Data Collective 的 Common Voice Scripted Speech 25.0 构建的行归一化多语言自动语音识别(ASR)数据集。其主要目标是整合、规范并提供来自 Common Voice 项目的脚本化语音数据,为 ASR 研究和开发提供一个统一、可追溯的数据源。数据集的核心交付物是归一化后的数据行,每行对应一个音频片段,并保留了原始的分割信息(如训练集、开发集、测试集等)。数据字段包括音频路径、对应文本句子、语言环境代码、语言名称、数据分割类型、源数据集ID、源存档文件,以及丰富的上游元数据(如说话者ID、句子ID、领域、投票信息、人口统计信息等)。数据集规模庞大,覆盖了超过150种语言和方言(如阿布哈兹语、阿非利卡语、阿拉伯语、中文、英语、法语等),当前状态包含150个清单条目和78个已暂存的存档文件。数据集适用于多语言和低资源语言的自动语音识别任务。数据发布遵循 Creative Commons Zero v1.0 Universal (CC0-1.0) 许可证。

Common Voice Scripted Speech 25.0 is a row-normalized multilingual automatic speech recognition (ASR) dataset built upon Mozilla Data Collectives Common Voice Scripted Speech 25.0. Its primary goal is to integrate, standardize, and provide scripted speech data from the Common Voice project, offering a unified and traceable data source for ASR research and development. The core deliverable of the dataset is normalized data rows, each corresponding to an audio segment, while preserving original split information (such as training set, development set, test set, etc.). Data fields include audio paths, corresponding text sentences, locale codes, language names, data split types, source dataset IDs, source archive files, and rich upstream metadata (e.g., speaker IDs, sentence IDs, domains, voting information, demographic data, etc.). The dataset is large-scale, covering over 150 languages and dialects (e.g., Abkhaz, Afrikaans, Arabic, Chinese, English, French, etc.), with a current status of 150 manifest entries and 78 staged archive files. It is suitable for multilingual and low-resource language automatic speech recognition tasks. The data is released under the Creative Commons Zero v1.0 Universal (CC0-1.0) license.

创建时间:
2026-06-16
原始信息汇总

数据集概述

数据集名称:Common Voice Scripted Speech 25.0

标签:common-voice, mozilla-data-collective, scripted-speech, multilingual-asr, asr

许可证:Creative Commons Zero v1.0 Universal (CC0-1.0),详见 CC0-1.0

数据集描述

该数据集是一个多语言自动语音识别(ASR)数据集,基于 Mozilla Data Collective 的 Common Voice Scripted Speech 25.0 构建。主要交付物为行归一化的数据,包含音频、句子、区域设置、语言、分割、源数据集 ID、源归档等字段,并保留上游 Common Voice 元数据。

数据用途

  • 提供统一的多语言 ASR 数据集,方便用户获取 Common Voice Scripted Speech 25.0 的综合集合。
  • 支持通过语言和分割字段进行过滤。
  • 质量过滤作为可选视图或清单,基于上游分割和验证状态,提供 Scribe WER 分级:优秀(≤5%)、良好(≤15%)、可接受(≤25%),以及持续时间和每秒字符数等回退检查。

数据集统计(当前状态)

  • 清单条目数:162
  • 已暂存的归档数:78
  • 仍在下载或缺失的归档数:84
  • 目标数据集层:归一化行,保留上游 train, dev, test, validated, invalidated, other 和报告文件(如有)。

语言覆盖

数据集包含超过170种语言,涵盖多种语言家族和地区,例如:

  • 亚美尼亚语 (hy-AM)
  • 中文 (中国、香港、台湾) (zh-CN, zh-HK, zh-TW)
  • 林加拉语 (lg)
  • 荷兰语 (nl)
  • 意大利语 (it)

详见完整语言列表(languagelanguage_bcp47 字段)。

预期数据列

归一化表格每行对应一个音频片段,预计包含列:

  • audio
  • sentence
  • locale
  • language
  • split / original_split
  • source_dataset_id
  • source_archive
  • 上游 Common Voice 元数据(如 client_id, sentence_id, sentence_domain, 投票, 年龄, 性别, 口音, 变体, 分段等)
  • duration_ms(来自 clip_durations.tsv,如可用)
搜集汇总
数据集介绍
common-voice-scripted-speech-25-0 数据集图片
构建方式
Common Voice Scripted Speech 25.0 数据集源自 Mozilla Data Collective 项目,是对大规模多语种朗读语音语料的规范化整理与汇聚。构建过程中,原始 MDC 压缩包被完整保留,并辅以校验和以确保来源的可追溯性与复现性。通过解析各语种档案中包含的元数据,将音频片段、文本标注、语种标识、分区标签等字段统一为行级规范化格式,形成以 audio、sentence、locale、language、split 为核心的标准化表格。该流程旨在为自动语音识别研究提供一个兼具完整性与可复现性的多语种基础语料。
特点
该数据集涵盖超过 120 种语言与方言,规模宏大且语种分布广泛,从高资源语言如英语、中文到低资源语言如阿布哈兹语、阿贾语均有收录。每条记录保留了上游 Common Voice 的原始分区标签(train、dev、test、validated 等),并额外引入 duration_ms 等实用字段。更重要的是,数据以规范化行格式发布,支持按语言、分区进行灵活筛选,同时提供基于 Scribe 词错误率的分层质量视图(优秀≤5%、良好≤15%、可接受≤25%),为不同训练需求提供可选的质量过滤方案。
使用方法
用户可通过 Hugging Face Datasets 库直接加载该数据集,利用 language 和 split 字段进行语种与分区的筛选。典型的加载方式为指定数据集标识符并调用 load_dataset 函数,随后根据研究目标选择所需语种子集或质量层级。对于需要精细控制质量的训练流程,可应用内置的 Scribe WER 分层视图,剔除低质量样本。该数据集可直接用于多语种 ASR 模型训练、跨语言迁移学习或低资源语音识别系统的构建与评估。
背景与挑战
背景概述
Common Voice Scripted Speech 25.0 数据集由 Mozilla Data Collective 于 2025 年发布,旨在解决多语言自动语音识别(ASR)领域对大规模、高质量、标注语音数据的需求。该数据集汇集了超过 160 种语言的有声朗读语音,涵盖从高资源语言(如英语、中文)到低资源语言(如阿布哈兹语、阿当马瓦富拉语)的广泛语种。其核心研究问题在于通过统一的数据标准化流程,为 ASR 研究提供可复现、可追溯的语料基础,从而推动语音技术的民主化。该数据集在低资源语言 ASR 研究中具有里程碑意义,为跨语言模型训练和评估提供了关键资源,尤其对于缺乏公开语音数据的语言社区而言,极大地促进了语音交互技术的发展。
当前挑战
该数据集面临的挑战首要在于多语言 ASR 领域固有的语言多样性与数据不均衡问题,例如低资源语言的音频质量参差不齐、标注一致性难以保证,以及转录文本存在方言和拼写差异。构建过程中,团队需处理来自 Mozilla Data Collective 的 162 个压缩档案的下载与校验,其中 84 个档案仍处于下载或缺失状态,数据完整性保障成为繁重任务。此外,标准化流程需合并多种元数据格式(如验证状态、说话人信息),并设计 Scribe WER 质量过滤层级(优秀≤5%、良好≤15%、可接受≤25%),这要求精确的自动化管道和手动监督,以避免数据污染,确保训练语料的可靠性。
常用场景
经典使用场景
Common Voice Scripted Speech 25.0数据集作为多语种自动语音识别(ASR)领域的基准资源,其经典使用场景聚焦于构建与评估多语言语音识别模型。研究者可利用该数据集的行标准化格式,直接加载涵盖162种语言变体的音频-文本对,在训练集、验证集和测试集上展开端到端或混合ASR系统的实验。由于数据保留了上游的语种、地域、性别、年龄等元信息,它特别适合用于零资源或低资源语言的声学建模,以及多任务学习框架下的跨语言迁移研究。
解决学术问题
该数据集有效回应了低资源语言ASR研究中的数据匮乏与可复现性危机。Mozilla将分散于Mozilla Data Collective的脚本语音档案统一为可追踪、带校验和的标准化格式,解决了以往多语种数据集因来源散乱、格式不统一而导致的实验对比困难。同时,论文中提出的Scribe词错误率分档(优秀≤5%、良好≤15%、可接受≤25%)为质量过滤提供了量化范式,推动了语音识别中音频-文本一致性自动校验方法的学术进展。
衍生相关工作
围绕Common Voice Scripted Speech 25.0,学术界已衍生出多个关键研究方向。其中,Omni-Curator项目借鉴其质量分层理念,构建了半监督数据清洗流水线;基于此数据集的多语言端到端ASR基线(如Whisper、Wav2Vec2.0的微调变体)成为低资源语音领域的常用对照模型。此外,学者们还利用其跨语种元信息,探索了方言自适应与口音解耦表示学习,催生了诸如语言无关的语音单元发现等前沿课题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务