common-voice-26
收藏资源简介:
该数据集是一个大规模、多语言的语音-文本平行语料库,涵盖多种语言和方言(如南非荷兰语、阿姆哈拉语、阿拉伯语、德语、法语、日语等)。每个样本包含音频文件及其对应的转录文本,并附带丰富的元数据:音频时长、说话人唯一标识符、语言/地区代码、音频片段标识。此外,还提供了说话人的人口统计信息(年龄、性别)和语言特征(变体、口音),以及社区众包的质量评估指标(点赞和点踩数量)。数据集已预先划分为训练集、验证集和测试集,适用于自动语音识别(ASR)、语音合成、多语言语音模型训练、说话人识别以及语音技术中的公平性和多样性研究。数据来源于社区贡献,并通过投票机制进行了初步质量筛选。
This dataset is a large-scale, multilingual speech-text parallel corpus covering multiple languages and dialects (such as Afrikaans, Amharic, Arabic, German, French, Japanese, etc.). Each sample includes an audio file and its corresponding transcription text, along with rich metadata: audio duration, speaker unique identifier, language/region code, and audio segment identifier. Additionally, it provides speaker demographic information (age, gender) and linguistic features (variants, accents), as well as community-crowdsourced quality assessment metrics (number of upvotes and downvotes). The dataset is pre-divided into training, validation, and test sets, making it suitable for automatic speech recognition (ASR), speech synthesis, multilingual speech model training, speaker recognition, and research on fairness and diversity in speech technology. The data is sourced from community contributions and has undergone preliminary quality screening through a voting mechanism.
数据集概述:Common Voice Corpus 26
该数据集是 Common Voice 项目第 26 版的多语种语音语料库,旨在为语音识别系统提供开源、众包的训练数据。数据集由多种语言的音频片段和对应文本转录组成,并包含丰富的 speaker 元数据。
数据集结构
- 配置 (Configs):数据集按语言或方言划分为多个子集(config),每个子集独立提供数据。支持的语言配置包括:af、am、an、ar、ast、bn、de、eo、es-Caribe、es-MX_female、es-MX_male、es-Rioplatense、eu、fa、fr、gl、hi、hy-AM、id、ig、it、ja、ka、kab、lg、lo、nl、prq 等。
- 数据划分:每个语言配置均包含三个标准数据集划分:
train:训练集,用于模型训练。test:测试集,用于评估模型性能。validation:验证集,用于模型调优。
特征 (Features)
每条数据记录包含以下 12 个字段:
audio:音频数据,数据类型为audio。sentence:音频对应的文本转录,数据类型为string。duration:音频时长,以秒为单位,数据类型为float32。client_id:贡献者用户标识,数据类型为string。locale:语言地区代码,数据类型为string。segment:数据段标识,数据类型为string。up_votes:收到的赞同票数,数据类型为int32。down_votes:收到的反对票数,数据类型为int32。age:贡献者年龄分组,数据类型为string。gender:贡献者性别,数据类型为string。variant:语言变体,数据类型为string。accent:口音标注,数据类型为string。
数据集规模(示例)
各语言配置的数据规模差异较大,以下为部分代表性配置的样本数:
- de (德语):train 623,289 条,test 16,208 条,validation 16,208 条。
- fr (法语):train 617,587 条,test 16,204 条,validation 16,204 条。
- en (英语) - 未在列表中明确列出,但已知是该语料库的一部分。
- ig (伊博语):train 666 条,test 606 条,validation 578 条。
- lo (老挝语):train 126 条,test 39 条,validation 28 条。
- 其他语言:如 ar、bn、gl、kab、ka、it、lg 等,训练集样本数在数万至数十万不等。
数据用途
- 适用于训练和评估多语种语音识别(ASR)系统。
- 支持说话人识别、口音与方言识别研究。
- 可用于语言多样性相关的语音技术开发。



