遇见数据集

taqwa92/cm.trial

收藏
Hugging Face2023-01-28 更新2024-03-04 收录
官方服务:

资源简介:

Common Voice数据集由独特的MP3音频文件和对应的文本文件组成。数据集中的许多录音还包括了说话者的年龄、性别和口音等元数据,这些信息有助于提高语音识别引擎的准确性。目前,数据集包含了100种语言的16413小时已验证的语音数据,并且不断有新的语音和语言被添加进来。数据集支持自动语音识别任务,并且提供了多种语言的语音数据。

The Common Voice dataset comprises unique MP3 audio files and their corresponding text transcripts. Many recordings within the dataset also include metadata such as the speaker's age, gender, and accent, which helps improve the accuracy of speech recognition engines. Currently, the dataset contains 16,413 hours of validated speech data across 100 languages, with new speech samples and languages being added continuously. The dataset supports automatic speech recognition (ASR) tasks and provides speech data in multiple languages.

提供机构:
taqwa92
原始信息汇总

数据集概述:Common Voice Corpus 11.0

数据集描述

数据集摘要

Common Voice Corpus 11.0 是一个包含多种语言的语音数据集,主要用于自动语音识别(ASR)任务。该数据集包含超过24,210小时的录音,涵盖100种语言,每个录音文件都附有相应的文本文件。此外,数据集还包含说话者的年龄、性别和口音等人口统计学元数据,以帮助提高语音识别引擎的准确性。

支持的任务和排行榜

该数据集支持的任务主要是自动语音识别。相关模型训练结果可通过🤗 Speech Bench查看。

语言

数据集涵盖多种语言,包括但不限于:Abkhaz, Arabic, Armenian, Assamese, Asturian, Azerbaijani, Basaa, Bashkir, Basque, Belarusian, Bengali, Breton, Bulgarian, Cantonese, Catalan, Central Kurdish, Chinese (China), Chinese (Hong Kong), Chinese (Taiwan), Chuvash, Czech, Danish, Dhivehi, Dutch, English, Erzya, Esperanto, Estonian, Finnish, French, Frisian, Galician, Georgian, German, Greek, Guarani, Hakha Chin, Hausa, Hill Mari, Hindi, Hungarian, Igbo, Indonesian, Interlingua, Irish, Italian, Japanese, Kabyle, Kazakh, Kinyarwanda, Kurmanji Kurdish, Kyrgyz, Latvian, Lithuanian, Luganda, Macedonian, Malayalam, Maltese, Marathi, Meadow Mari, Moksha, Mongolian, Nepali, Norwegian Nynorsk, Odia, Persian, Polish, Portuguese, Punjabi, Romanian, Romansh Sursilvan, Romansh Vallader, Russian, Sakha, Santali (Ol Chiki), Saraiki, Sardinian, Serbian, Slovak, Slovenian, Sorbian, Upper, Spanish, Swahili, Swedish, Taiwanese (Minnan), Tamil, Tatar, Thai, Tigre, Tigrinya, Toki Pona, Turkish, Twi, Ukrainian, Urdu, Uyghur, Uzbek, Vietnamese, Votic, Welsh。

数据集结构

数据实例

每个数据实例包括音频文件的路径和对应的句子。此外,还包括说话者的口音、年龄、客户端ID、点赞数、点踩数、性别、地区和段落信息。

数据字段

  • client_id (string): 录音客户端的ID。
  • path (string): 音频文件的路径。
  • audio (dict): 包含音频文件路径、解码后的音频数组和采样率。
  • sentence (string): 用户被提示朗读的句子。
  • up_votes (int64): 音频文件获得的点赞数。
  • down_votes (int64): 音频文件获得的点踩数。
  • age (string): 说话者的年龄。
  • gender (string): 说话者的性别。
  • accent (string): 说话者的口音。
  • locale (string): 说话者的地区。
  • segment (string): 通常为空字段。

数据分割

数据集被分为多个部分,包括开发集、训练集、测试集、验证集、无效集、报告集和其他未分类数据。

数据集创建

来源数据

数据集的来源是通过众包方式收集的语音数据。

许可信息

数据集使用CC-0许可,属于公共领域。

引用信息

@inproceedings{commonvoice:2020, author = {Ardila, R. and Branson, M. and Davis, K. and Henretty, M. and Kohler, M. and Meyer, J. and Morais, R. and Saunders, L. and Tyers, F. M. and Weber, G.}, title = {Common Voice: A Massively-Multilingual Speech Corpus}, booktitle = {Proceedings of the 12th Conference on Language Resources and Evaluation (LREC 2020)}, pages = {4211--4215}, year = 2020 }

搜集汇总
数据集介绍
taqwa92/cm.trial 数据集图片
构建方式
Common Voice Corpus 11.0 是一个由 Mozilla 基金会发起的大规模多语言语音数据集,其构建依赖于全球众包模式。志愿者通过在线平台录制朗读给定文本的语音片段,并上传为 MP3 格式的音频文件。每段音频均附带对应的文本转录。为确保数据质量,社区成员通过投票机制对音频进行审核,获得足够赞成票的样本被标记为已验证数据。数据集还收集了说话者的年龄、性别、口音等人口统计学元数据,以增强语音识别模型的鲁棒性。最终,经过验证的高质量音频被划分为训练集、开发集和测试集,形成了覆盖 100 种语言、超过 16000 小时有效语音的语料库。
使用方法
使用该数据集时,可通过 Hugging Face Datasets 库便捷加载,例如指定语言子集如 'en' 进行英语数据加载。由于数据集中部分句子带有首尾引号,且少量句子缺乏结尾标点,官方建议在预处理时统一去除引号,并为无标点句子补全句号。加载后的数据可通过 .map() 方法应用自定义预处理函数,将文本标准化。音频数据以字典形式返回,包含自动解码的音频数组和采样率,推荐优先使用索引访问音频列以避免大量文件解码的性能开销。此外,用户需同意不尝试识别说话者身份,这一伦理约束在数据使用条款中明确声明。
背景与挑战
背景概述
Common Voice Corpus 11.0是由Mozilla基金会主导、于2020年首次发布的大规模多语种语音数据集,其核心研究问题在于降低语音识别技术对少数语种和方言的门槛,通过众包方式构建一个开放、多元且持续增长的语音资源库。该数据集汇聚了超过24,210小时的录音,涵盖100种语言,并附有年龄、性别、口音等人口统计学元数据,为自动语音识别(ASR)领域的研究提供了前所未有的语言多样性与规模。其影响力深远,不仅推动了低资源语言语音模型的开发,还促进了语音技术的民主化,成为学术界与工业界评估多语种ASR系统的重要基准。
当前挑战
该数据集面临的挑战首先体现在领域问题层面:多语种语音识别需应对语言间声学与音系结构的巨大差异,尤其是低资源语言(如沃提克语、桑塔利语)的标注数据稀缺,导致模型泛化能力受限。其次,构建过程中遭遇众包数据质量控制的难题,包括录音环境噪声、发音变异性以及验证机制依赖人工投票(如up_votes与down_votes),可能引入主观偏差。此外,数据集对说话者身份的保护协议限制了元数据的使用深度,而语料库中部分语言(如中文方言)的文本标准化与标点符号处理(如引号、句号缺失)也增加了预处理复杂度,影响训练一致性。
常用场景
经典使用场景
在自动语音识别(ASR)领域,Common Voice Corpus 11.0 被广泛用作多语言声学模型训练与评估的基准数据集。其涵盖100种语言、超过16000小时验证语音的庞大规模,使得研究者能够构建跨语言或低资源语言的语音识别系统。经典的使用方式包括利用其提供的音频-文本对进行端到端模型训练,并借助内置的说话人年龄、性别、口音等元数据,探索说话人自适应与领域泛化技术。该数据集的标准训练/验证/测试划分,为公平比较不同ASR架构(如Conformer、Whisper等)提供了统一平台。
解决学术问题
该数据集系统性地缓解了语音识别研究中长期存在的两大瓶颈:多语言覆盖不足与数据标注成本高昂。通过众包方式收集全球志愿者的语音,它使得低资源语言(如巴什基尔语、卢干达语)的声学建模成为可能,推动了语言平等化进程。同时,其开放许可协议(CC-0)消除了学术机构在数据使用上的法律障碍,促进了可复现研究。研究者借助该数据集揭示了说话人多样性对模型鲁棒性的影响,并量化了口音、年龄等因素导致的性能偏差,为公平性评估提供了实证基础。
实际应用
在实际部署中,Common Voice 数据集已成为商业级语音助手的基石。科技公司利用其多语言语料训练跨语种交互系统,例如智能音箱的指令识别或车载语音导航。其细粒度的口音标注尤其有助于开发面向非母语用户的容错模型,提升全球化产品的用户体验。此外,医疗领域借助该数据集训练方言语音转录系统,辅助病历记录;教育科技则将其用于语言学习应用的发音评测功能,通过对比学习者语音与标准语料实现实时反馈。
数据集最近研究
最新研究方向
当前,多语言自动语音识别(ASR)领域的前沿研究正聚焦于构建大规模、多样化的语音语料库以提升模型的泛化能力与鲁棒性。Common Voice Corpus 11.0作为由Mozilla主导的众包项目,凭借其覆盖100种语言、超过1.6万小时验证时长的庞大规模,成为推动低资源语言ASR技术突破的核心引擎。该数据集不仅囊括了英语、中文等高资源语言,更系统性地收录了如巴什基尔语、埃兹亚语等濒危或小众语言,为打破语言壁垒、促进数字包容性提供了关键数据支撑。近期研究热点围绕利用该数据集进行跨语言迁移学习、自监督预训练(如wav2vec 2.0)以及噪声鲁棒性建模,显著提升了模型在方言、口音及录音环境差异下的识别表现。此外,Common Voice的众包标注机制与CC-0开源许可,加速了学术界与工业界的协作创新,成为评估ASR系统多语言性能的标杆基准,其影响力已延伸至语音合成、说话人识别等关联任务,为构建真正普惠的语音交互生态奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务