遇见数据集

common-voice-26

收藏
Hugging Face2026-07-13 更新2026-07-14 收录
官方服务:

资源简介:

该数据集是一个大规模、多语言的语音-文本平行语料库,涵盖多种语言和方言(如南非荷兰语、阿姆哈拉语、阿拉伯语、德语、法语、日语等)。每个样本包含音频文件及其对应的转录文本,并附带丰富的元数据:音频时长、说话人唯一标识符、语言/地区代码、音频片段标识。此外,还提供了说话人的人口统计信息(年龄、性别)和语言特征(变体、口音),以及社区众包的质量评估指标(点赞和点踩数量)。数据集已预先划分为训练集、验证集和测试集,适用于自动语音识别(ASR)、语音合成、多语言语音模型训练、说话人识别以及语音技术中的公平性和多样性研究。数据来源于社区贡献,并通过投票机制进行了初步质量筛选。

This dataset is a large-scale, multilingual speech-text parallel corpus covering multiple languages and dialects (such as Afrikaans, Amharic, Arabic, German, French, Japanese, etc.). Each sample includes an audio file and its corresponding transcription text, along with rich metadata: audio duration, speaker unique identifier, language/region code, and audio segment identifier. Additionally, it provides speaker demographic information (age, gender) and linguistic features (variants, accents), as well as community-crowdsourced quality assessment metrics (number of upvotes and downvotes). The dataset is pre-divided into training, validation, and test sets, making it suitable for automatic speech recognition (ASR), speech synthesis, multilingual speech model training, speaker recognition, and research on fairness and diversity in speech technology. The data is sourced from community contributions and has undergone preliminary quality screening through a voting mechanism.

创建时间:
2026-07-12
原始信息汇总

数据集概述:Common Voice Corpus 26

该数据集是 Common Voice 项目第 26 版的多语种语音语料库,旨在为语音识别系统提供开源、众包的训练数据。数据集由多种语言的音频片段和对应文本转录组成,并包含丰富的 speaker 元数据。

数据集结构

  • 配置 (Configs):数据集按语言或方言划分为多个子集(config),每个子集独立提供数据。支持的语言配置包括:af、am、an、ar、ast、bn、de、eo、es-Caribe、es-MX_female、es-MX_male、es-Rioplatense、eu、fa、fr、gl、hi、hy-AM、id、ig、it、ja、ka、kab、lg、lo、nl、prq 等。
  • 数据划分:每个语言配置均包含三个标准数据集划分:
    • train:训练集,用于模型训练。
    • test:测试集,用于评估模型性能。
    • validation:验证集,用于模型调优。

特征 (Features)

每条数据记录包含以下 12 个字段:

  • audio:音频数据,数据类型为 audio
  • sentence:音频对应的文本转录,数据类型为 string
  • duration:音频时长,以秒为单位,数据类型为 float32
  • client_id:贡献者用户标识,数据类型为 string
  • locale:语言地区代码,数据类型为 string
  • segment:数据段标识,数据类型为 string
  • up_votes:收到的赞同票数,数据类型为 int32
  • down_votes:收到的反对票数,数据类型为 int32
  • age:贡献者年龄分组,数据类型为 string
  • gender:贡献者性别,数据类型为 string
  • variant:语言变体,数据类型为 string
  • accent:口音标注,数据类型为 string

数据集规模(示例)

各语言配置的数据规模差异较大,以下为部分代表性配置的样本数:

  • de (德语):train 623,289 条,test 16,208 条,validation 16,208 条。
  • fr (法语):train 617,587 条,test 16,204 条,validation 16,204 条。
  • en (英语) - 未在列表中明确列出,但已知是该语料库的一部分
  • ig (伊博语):train 666 条,test 606 条,validation 578 条。
  • lo (老挝语):train 126 条,test 39 条,validation 28 条。
  • 其他语言:如 ar、bn、gl、kab、ka、it、lg 等,训练集样本数在数万至数十万不等。

数据用途

  • 适用于训练和评估多语种语音识别(ASR)系统。
  • 支持说话人识别、口音与方言识别研究。
  • 可用于语言多样性相关的语音技术开发。
搜集汇总
数据集介绍
构建方式
Common Voice 26 数据集由Mozilla基金会主导构建,是全球众包语音数据项目的结晶。该项目邀请志愿者通过网站或移动应用录制短句,并对他人录制的音频进行投票验证,确保数据质量。每条语音样本均关联说话人的年龄、性别、口音等元数据,形成多维度的语音特征库。数据集按语种及变体分为多个子集(config),每个子集包含训练、测试和验证三个划分,所有音频均以标准化格式存储,便于跨语言研究。
使用方法
数据集可通过Hugging Face Datasets库便捷加载,用户需指定config_name选择目标语种,例如加载德语子集只需调用load_dataset('common_voice_26', 'de')。加载后的数据以字典形式组织,可直接访问音频路径及其对应文本。研究者利用train/validation/test划分进行模型训练与评估,并可筛选特定年龄或性别组以进行子领域分析。若需自定义实验,可根据up_votes等质量指标过滤低分样本,确保输入的数据质量上乘。
背景与挑战
背景概述
Common Voice 26是Mozilla基金会于2025年初发布的大规模众包多语种语音语料库,旨在通过社区协作构建开放、多元的语音数据集。该项目由Mozilla主导,汇聚全球志愿者的朗读贡献,核心致力于解决语音识别系统对低资源语言覆盖不足、口音与方言多样性匮乏等根本性问题。数据集涵盖近150种语言变体,包括稀有语种如伊博语、卢干达语及西班牙语地域变体,每条录音均附带年龄、性别、口音等精细元数据。作为当前最全面的开源语音资源之一,Common Voice系列已显著推动多语种自动语音识别技术的民主化进程,尤其为学术界和中小开发者提供了可替代商业API的高质量训练材料,深刻影响了低资源语言技术生态的构建。
当前挑战
该数据集面临的核心挑战首先在于解决语音识别领域对长尾语言和方言覆盖严重不足的痼疾,许多低资源语种仅有数千条录音,远不足以支撑鲁棒模型的训练,数据稀疏性成为制约模型泛化能力的首要瓶颈。构建过程中,众包模式引入的噪声问题同样严峻:不同录音环境、设备差异及说话人自发纠错导致音质参差不齐;社区审核机制依赖人工投票,对大量低质量样本的筛选效率与一致性难以保障。此外,年龄、性别等元数据的分布不均衡可能引入偏见,训练出的模型易对主流群体表现优异而对边缘群体失效。这些挑战共同指向如何在海量、异构的众包数据中实现质量管控与公平表征的双重目标。
常用场景
经典使用场景
Common Voice 第26版数据集是一个大规模、多语种的开源语音语料库,涵盖全球数十种语言,包括德语、法语、阿拉伯语、孟加拉语等资源丰富与匮乏的语言。该数据集每一条语音样本都配有相应的文本转录、说话人年龄、性别、口音以及社区投票等元信息。其经典使用场景聚焦于构建和评估基于深度学习的自动语音识别系统,尤其是在多语种和低资源语言场景下,研究者可利用其丰富的声学与语言学特征,训练端到端的语音识别模型,如基于Transformer或Conformer架构的ASR系统。此外,该数据集也广泛用于语音活动检测、说话人识别以及语音情感分析等基础研究任务,为跨语言语音技术的统一评估提供了可靠基准。
解决学术问题
Common Voice 26有效解决了多语种尤其是低资源语言语音数据稀缺的学术困境,推动了语音技术在语言多样性上的公平发展。通过提供标准化、社区验证的高质量语音-文本对,该数据集显著降低了语音识别研究中的数据偏差和领域适应难题,使得研究者能够探索跨语言迁移学习、自监督预训练(如wav2vec 2.0、HuBERT)与少样本学习等前沿方法。其带来的意义在于打破了以往语音研究过度集中于英语等大语种的局限,为全球数百种语言提供了可复现的学术研究平台,从而提升了语音技术在偏远地区方言、老龄化群体及多口音场景下的鲁棒性,促进了语音理解领域的科学纵深。
实际应用
在实际应用层面,Common Voice 26驱动的语音模型已广泛部署于智能语音助手、实时字幕生成、无障碍通讯工具以及语言教学软件中。例如,科技公司利用该数据集训练的多语种ASR系统,能够为视障人士提供精准的语音转文字服务;在公共信息播报、车载语音交互以及远程会议翻译等场景中,基于Common Voice的模型大幅提升了口语内容的可访问性。此外,该数据集还被用于构建低资源语言的输入法工具,帮助母语者通过语音完成数字交流,从而在数字包容、教育普惠和文化遗产数字化保护等领域发挥着不可替代的作用。
数据集最近研究
最新研究方向
Common Voice 26数据集的最新研究聚焦于多语种语音识别技术的公平性与包容性,特别是针对低资源语言(如阿非利卡语、阿姆哈拉语、阿拉贡语等)的语音数据扩充与模型优化。随着全球数字化转型的加速,该数据集被广泛用于构建更鲁棒的跨语种语音助手和翻译系统,尤其在方言(如西班牙语变体)和口音标注上提供了细粒度支持。学术界利用其丰富的元数据(如年龄、性别、口音)探索去偏见训练,推动了语音技术向边缘群体(如年长用户、女性发音人)的普惠发展。最近的先进成果包括基于Common Voice 26的端到端预训练模型(如Wav2Vec 2.0)在下游任务上的突破,以及结合众包质量评级(up_votes/down_votes)的自监督学习范式,显著提升了嘈杂环境下的识别准确率。该数据集还成为评测大语言模型在多模态任务中语音理解能力的基准,呼应了科技巨头对通用人工智能的投入。这些进展不仅巩固了Common Voice作为开源语音数据里程碑的地位,还促进了全球语言生态的数字化保护,尤其对非洲、南亚等地区的本土语言复兴具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务