遇见数据集

fixie_accents_16kHz

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

本数据集是开源语音数据集fixie-ai/common_voice_17_0中西班牙语(es)配置的一个处理版本。主要修改包括:移除了原始数据中的部分列;对说话者口音(accents)信息进行了标准化过滤,仅保留Common Voice项目(由Mozilla基金会维护)在用户个人资料创建中定义的官方口音标签;并将所有音频统一重采样至16kHz的采样率。数据集包含367,615个语音样本,划分为训练集(336,051个样本)、验证集(15,823个样本)和测试集(15,741个样本)。每个样本提供音频文件(16kHz单声道)及其对应的转录文本(句子),并附带说话者的元数据,包括匿名客户端ID、年龄、性别和经过过滤的标准口音信息。该数据集适用于西班牙语的自动语音识别(ASR)模型训练与评估,以及语音技术研究中涉及说话者属性(如口音、年龄、性别)分析的任务。数据以CC0 1.0通用公共领域贡献许可发布。

This dataset is a processed version of the Spanish (es) configuration of the open-source speech dataset fixie-ai/common_voice_17_0. The main modifications are as follows: some columns in the original data have been removed; the speaker accent information has been standardized and filtered, only retaining the official accent tags defined by the Common Voice project (maintained by the Mozilla Foundation) during user profile creation; and all audio files have been uniformly resampled to a sampling rate of 16kHz. The dataset contains 367,615 speech samples, which are split into training set (336,051 samples), validation set (15,823 samples), and test set (15,741 samples). Each sample provides an audio file (16kHz mono) and its corresponding transcribed text (sentence), along with speaker metadata including anonymous client ID, age, gender, and filtered standard accent information. This dataset is suitable for training and evaluating automatic speech recognition (ASR) models for Spanish, as well as tasks involving speaker attribute (e.g., accent, age, gender) analysis in speech technology research. The data is released under the CC0 1.0 Universal Public Domain Dedication license.

创建时间:
2026-06-17
原始信息汇总

数据集概述

数据集名称: mmarron14/fixie_accents_16kHz
语言: 西班牙语(es
许可证: CC0-1.0(公共领域)

数据来源

本数据集是对 fixie-ai/common_voice_17_0 数据集中西班牙语(es)配置的加工版本,主要包括以下修改:

  • 移除了一些列(字段)。
  • 仅保留用户资料中由 Mozilla Foundation 定义的官方口音标签(accent 字段)。
  • 将所有音频重采样至 16kHz。

数据集结构

特征(Features)

字段名 类型 描述
client_id string 用户标识符
path string 音频文件路径
audio audio (sampling_rate: 16000) 音频数据,采样率为 16kHz
sentence string 对应的文本句子
age string 说话人年龄
gender string 说话人性别
accent string 说话人口音(仅保留官方标签)

数据集划分(Splits)

划分 样本数 字节数
train 336,051 12,994,843,429
test 15,741 740,016,337
validation 15,823 764,908,014
总计 367,615 14,499,767,780

下载大小: 14,311,641,491 字节(约 13.3 GB)
数据集总大小: 14,499,767,780 字节(约 13.5 GB)

配置(Configs)

数据集包含一个配置 es,对应的数据文件路径模式为:

  • 测试集: data/test-*
  • 训练集: data/train-*
  • 验证集: data/validation-*

引用

  • Fixie-ai (2024). Common Voice (Version 17.0). [Dataset]. Hugging Face. (https://huggingface.co/datasets/fixie-ai/common_voice_17_0)
  • Ardila, R., Branson, M., Davis, K., Henretty, M., Kohler, M., Meyer, J., Morais, R., Saunders, L., Tyers, F. M., & Weber, G. (2020). Common voice: A massively-multilingual speech corpus. LREC 2020 - 12th International Conference on Language Resources and Evaluation, Conference Proceedings, 4218-4222.
搜集汇总
数据集介绍
fixie_accents_16kHz 数据集图片
构建方式
fixie_accents_16kHz数据集是基于Mozilla Foundation旗下Common Voice项目第17.0版本的西班牙语子集构建而成。该数据集在原始数据基础上进行了精简,移除了部分无关列,并依据Common Voice用户档案中的官方口音标签对数据进行严格筛选,仅保留标注明确的口音信息。所有音频样本均被重采样至16kHz的采样率,以确保音频格式的统一性与后续处理的一致性。最终数据集划分为训练集、验证集和测试集,分别包含336051、15823和15741个样本。
特点
该数据集的核心特色在于其高度聚焦于西班牙语口音的多样性,涵盖了来自不同地区使用者的语音特征。每个样本均附带详尽的元数据,包括说话人编号、年龄、性别以及官方认可的口音标签,为口音识别与语音分析研究提供了坚实的基础。音频数据以16kHz的标准化采样率存储,兼容主流语音处理框架。数据集规模宏大,总计超过36万条语音样本,为训练鲁棒的声学模型提供了充足的数据支撑。
使用方法
使用者可通过HuggingFace的datasets库便捷加载该数据集。加载时需指定配置名'es'以获取西班牙语子集,并利用'data_files'参数指向对应的数据分片路径。数据集包含'audio'、'sentence'、'accent'等字段,其中'audio'字段可直接解码为波形的NumPy数组与采样率,便于直接输入到PyTorch或TensorFlow等深度学习框架中。建议研究者基于'accent'标签进行有监督学习任务,如口音分类,或结合'sentence'文本进行语音识别与多任务学习。
背景与挑战
背景概述
fixie_accents_16kHz数据集源自Mozilla Foundation于2024年发布的Common Voice 17.0大规模多语种语音语料库,由Fixie-ai团队进行精心加工而成。该数据集聚焦于西班牙语(es)语言配置,通过对原始语料进行列精简、仅保留用户画像中官方标注的口音标签,并将音频统一重采样至16kHz,构建了一个专注于口音研究的语音资源。作为Common Voice生态的衍生数据,它旨在推动多语种口音识别与语音理解研究,尤其针对西班牙语地区丰富多样的口音变体,为语音技术在不同文化背景下的公平性与鲁棒性提供了关键数据支撑。
当前挑战
该数据集所面临的挑战主要集中在两大层面。在领域问题层面,语音识别系统长期受困于口音多样性导致的性能偏差,特别是西班牙语中跨越欧洲、拉丁美洲等地的口音差异显著,现有模型难以实现泛化识别。在构建过程中,原始Common Voice包含大量未经校验或不合规的口音标签,Fixie-ai需制定严格的过滤策略以剔除噪声标签,同时仅保留官方认可的标签集,这一过程需平衡数据规模与标注质量。此外,音频重采样至16kHz需确保不损失语音特征,对处理流程的精度要求严苛。
常用场景
经典使用场景
fixie_accents_16kHz数据集是Mozilla Common Voice第17.0版西班牙语子集的精炼版本,其核心应用场景聚焦于多口音语音识别与语者特征分析。研究者和工程师常利用该数据集中丰富的口音标签(accent字段),结合统一的16kHz采样率音频,训练能够泛化至不同西班牙语方言的自动语音识别(ASR)模型。例如,通过划分口音类别(如卡斯蒂利亚、安达卢西亚或拉丁美洲口音),可评估模型对地域性发音偏差的鲁棒性,或开发声学特征提取与语速归一化等前端处理技术。该数据集剔除了非官方口音标签且精简了列字段,确保数据纯净度与一致性,成为口音分类、语者年龄与性别预测等副任务的标准评测基准。
实际应用
在实际产业部署中,fixie_accents_16kHz数据集为智能助手、语音搜索及客服系统的本地化适配提供了坚实支撑。以西班牙语市场为例,企业可利用该数据训练的口音鲁棒ASR模型,提升面向墨西哥、阿根廷或智利用户的转写准确率,减少因方言发音差异引发的交互失败。该数据集还赋能教育技术领域:例如,通过分析学习者口音与母语者模式的偏离程度,开发自适应语音纠错工具。在公共安全与医疗场景中,基于口音标签的语者识别系统能辅助追溯紧急呼叫来源区域,或为言语障碍评估提供多口音基线。其16kHz采样率完美匹配移动设备麦克风规格,支持轻量化模型在边缘设备的实时推理。
衍生相关工作
此数据集衍生了一系列开创性学术工作,最典型的是作为Common Voice系列的质量控制与标准化典范。基于其纯净标签策略,Fixie团队在huggingface上展示了如何通过过滤非官方口音标签并重采样至16kHz来提升数据可用性,启发了后续其他语言变体的类似预处理管线。在语音领域,研究者借鉴该数据集的元数据结构,提出了口音迁移学习框架,例如利用预训练Wav2Vec 2.0模型在西班牙语子集上微调,实现跨口音zero-shot识别。此外,该数据集的口音-语者属性关联性催生了多项语者表征学习研究,如使用对比学习捕获口音不变的语者嵌入,进而优化说话人验证系统的域适应能力。其CC0许可也推动了开放语音基准的构建,如与VoxPopuli、ML-SUPERB等数据集联合评测多语言语音系统的口音鲁棒性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务