遇见数据集

CommonVoice22-Sidon-HQ

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

该数据集是一个多语言音频-文本配对语料库,涵盖多种语言(例如阿布哈兹语、阿非利卡语、阿姆哈拉语、阿拉伯语等,通过配置名称中的语言代码标识)。每个样本包含一个48kHz采样率的音频文件及其对应的转录文本。数据特征还包括:样本唯一标识符、语言标签、原始数据来源的分割与分片信息、说话人标识、结构化元数据(JSON格式)、音频时长、采样率,以及多个可能的音频质量评估指标(如bak、sig、ovrl、p808)。数据集仅提供训练集分割,各语言配置的样本数量从1到数千不等,总体规模较大且覆盖语言广泛。该数据集适用于多语言自动语音识别、语音合成、语音质量分析、低资源语言语音处理等研究与应用。

This dataset is a multilingual audio-text paired corpus that includes speech data in multiple languages (such as Abkhaz, Afrikaans, Amharic, Arabic, etc., identified by language codes in configuration names). Each sample consists of an audio file with a 48kHz sampling rate and its corresponding transcription text. Data features also include: a unique sample identifier, language label, segmentation and sharding information from the original data source, speaker identifier, structured metadata (in JSON format), audio duration, sampling rate, and multiple possible audio quality assessment metrics (e.g., bak, sig, ovrl, p808). The dataset provides only a training set split, with sample counts per language configuration ranging from 1 to several thousand, resulting in a large overall scale and broad language coverage. It is suitable for research and applications in multilingual automatic speech recognition, speech synthesis, speech quality analysis, and low-resource language speech processing.

创建时间:
2026-07-26
原始信息汇总

数据集概述:CommonVoice22-Sidon-HQ

数据集地址:https://huggingface.co/datasets/Scicom-intl/CommonVoice22-Sidon-HQ

数据集简介

该数据集是 Common Voice 22 的一个高质量子集(Sidon-HQ),专注于多语言语音识别任务,提供了不同语言的音频数据及其对应的文本转录。

数据规模与语言构成

数据集包含77个不同的语言配置(config_name),每个配置代表一种语言,语言代码如 ab(阿布哈兹语)、af(南非荷兰语)、ar(阿拉伯语)、be(白俄罗斯语)、cs(捷克语)、da(丹麦语)、el(希腊语)、en(英语)、es(西班牙语)等。

数据特征

每个样本包含以下14个特征:

  • audio:音频数据,采样率为 48000 Hz
  • key:字符串类型,样本唯一标识
  • language:字符串类型,语言代码
  • source_split:字符串类型,原始数据集划分
  • source_shard:字符串类型,原始数据分片
  • transcript:字符串类型,文本转录
  • speaker:字符串类型,说话人标识
  • meta_json:字符串类型,元数据JSON
  • duration:浮点数,音频时长(秒)
  • sampling_rate:整数,采样率
  • bak:浮点数,背景噪声评分
  • sig:浮点数,信号质量评分
  • ovrl:浮点数,总体质量评分
  • p808:浮点数,P.808主观质量评分

数据划分

所有语言配置均仅有 train(训练集)一个划分,无验证集或测试集。

代表性语言数据量概览

语言 样本数 数据集大小
白俄罗斯语 (be) 18,045 ~2.56 GB
巴斯克语 (eu) 26,557 ~4.05 GB
世界语 (eo) 7,067 ~1.16 GB
阿拉伯语 (ar) 1,401 ~0.18 GB
捷克语 (cs) 5,436 ~0.71 GB
威尔士语 (cy) 2,749 ~0.39 GB
阿布哈兹语 (ab) 1,621 ~0.26 GB
巴什基尔语 (ba) 3,343 ~0.48 GB
西弗里斯兰语 (fy-NL) 4,214 ~0.54 GB
迪尤拉语 (dyu) 1 最少样本语言

最大语言为巴斯克语(eu),包含26,557个样本,约4.05 GB;最小语言为迪尤拉语(dyu),仅有1个样本。

搜集汇总
数据集介绍
CommonVoice22-Sidon-HQ 数据集图片
构建方式
CommonVoice22-Sidon-HQ 数据集源自 Mozilla Common Voice 开源语音项目,专注于提供高质量的多语种语音数据。构建过程基于对原始 Common Voice 语料库的严格筛选与质量控制,确保每条录音均经过信噪比、信号失真度及整体主观评分的双重校验。数据采用 48kHz 采样率的音频格式,并按照语言代码(如 ab、af、ar 等)划分为独立配置项,每条样本附带转写文本、说话人标识及来源切分信息。
特点
该数据集的显著特征在于其高标准的语音质量门槛与广泛的语言覆盖。每条样本均包含 bak、sig、ovrl 及 p808 等多维评分字段,用以量化背景噪声、信号纯净度与整体听觉质量。涵盖从常见语种(如法语、德语)到低资源语言(如巴什基尔语、迪维希语)的庞大多语言集合,训练集规模虽因语言而异,但均经过精心挑选,确保高可用性。
使用方法
使用该数据集时,用户可直接从 Hugging Face Datasets 库加载指定语言配置。语音数据已按 48kHz 采样率预编码,适应主流语音识别模型输入要求。通过访问 audio、transcript 及 speaker 字段,可构建端到端语音识别或说话人识别管线。建议优先使用评分字段(如 ovrl 和 sig)作为样本筛选依据,以优化模型在真实嘈杂环境下的鲁棒性。
背景与挑战
背景概述
CommonVoice22-Sidon-HQ数据集是在大规模多语种语音合成研究背景下,由Mozilla基金会主导构建的高质量子集。该数据集隶属于Mozilla Common Voice项目,旨在通过众包方式收集全球多样化语言的有声语音数据,以推动语音技术的民主化和多语言包容性。CommonVoice22-Sidon-HQ精选自Common Voice 22版本,聚焦于高保真度音频(48kHz采样率)和精准转录,涵盖94种语种配置,其中国语示例数量从数十到数万不等。该数据集的核心研究问题在于为低资源语言提供高质量、多说话人的平行语音-文本数据,从而赋能跨语言语音识别、说话人验证及合成模型的训练。自推出以来,CommonVoice22-Sidon-HQ已成为多语种语音研究的关键基准,显著促进了稀有语种语音技术的突破,尤其对濒危语言和方言的数字化保护具有里程碑意义。
当前挑战
CommonVoice22-Sidon-HQ面临的核心挑战在于语种间数据极度不均衡,如巴斯克语(eu)数据规模达26,557条,而尤语(dyu)仅含1条,这导致模型在少数语种上的泛化能力脆弱,亟需研发针对长尾分布的自适应学习或迁移学习策略。构建过程中,众包语音数据的质量管控是另一主要难题,尽管公布了音频质量评分(如bak、sig、ovrl、p808),但背景噪声、录音设备差异及说话人多样性仍严重干扰转录准确性和声学特征一致性。此外,部分语种转写文本的准确性未经专家审核,元数据缺失或标注歧义可能引入训练噪声,进而劣化端到端语音系统的鲁棒性。
常用场景
经典使用场景
在语音识别与自然语言处理领域,CommonVoice22-Sidon-HQ数据集凭借其高质量的音频样本和精确的文本转录,成为训练与评估多语种自动语音识别(ASR)系统的理想选择。该数据集包含了从阿布哈兹语到爱尔兰语等多种语言的高保真语音片段,采样率高达48kHz,确保了音频信号的丰富细节。研究者可通过其提供的说话人、时长及多种主观质量评分(如bak、sig、ovrl、p808),深入探索声学模型在不同语言和口音下的表现,尤其是在低资源语言的语音识别任务中,该数据集展现出了独特的桥梁作用。
解决学术问题
该数据集有效攻克了多语种语音识别研究中高质量标注数据稀缺的难题,特别是针对小语种与方言的语音建模。通过提供涵盖广泛语种且附有精细质量评估的语音-文本对,它使得学界能够系统性地研究语言特异性对ASR系统性能的影响,并探索跨语言迁移学习与领域自适应方法的有效性。其意义在于推动了语音技术的普惠化发展,为构建真正支持全球语言多样性的智能语音助手和交互系统奠定了数据基础,极大地促进了低资源语言在数字世界的可见度与可用性。
衍生相关工作
该数据集衍生了一系列具有影响力的学术工作,包括基于注意力机制的端到端多语种ASR模型、面向低资源语言的预训练语音表征学习框架,以及结合质量评分的数据增强策略。其中,研究者利用其丰富的说话人信息探索了个性化语音合成与说话人验证任务,并构建了融合语言辨识与语音识别的联合模型。此外,数据集中包含的背景噪声与录音环境差异,也启发了鲁棒性语音处理的经典研究,推动了对抗训练与自监督学习在噪声场景下的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务