遇见数据集

ciempiess/ciempiess_test

收藏
Hugging Face2023-08-11 更新2024-03-04 收录
官方服务:

资源简介:

CIEMPIESS TEST Corpus是一个性别平衡的语料库,专门用于测试语音识别任务的声学模型。它由10名男性和10名女性发言者的录音和人工转录组成。该语料库是CIEMPIESS数据集的一部分,仅包含与第一个CIEMPIESS Corpus相同来源的音频,并且仅推荐用于测试目的。数据集包含3558个语音文件,总时长为8小时8分钟,音频文件格式为16khz@16bit单声道。所有发言者均来自墨西哥,除了一个来自萨尔瓦多的发言者。数据集的语言为西班牙语,主要为墨西哥中部口音。

The CIEMPIESS TEST Corpus is a gender-balanced corpus specifically designed for testing acoustic models in speech recognition tasks. It consists of recordings and manual transcriptions from 10 male and 10 female speakers. This corpus is part of the CIEMPIESS dataset, and only contains audio sourced from the same origin as the first CIEMPIESS Corpus, and is solely recommended for testing purposes. The dataset includes 3558 speech audio files with a total duration of 8 hours and 8 minutes, and the audio format is 16 kHz @ 16-bit mono. All speakers are from Mexico, except for one speaker from El Salvador. The language of this dataset is Spanish, primarily featuring central Mexican accents.

提供机构:
ciempiess
原始信息汇总

数据集概述

数据集名称

  • 名称: CIEMPIESS TEST CORPUS
  • 别名: ciempiess_test

数据集描述

  • 摘要: CIEMPIESS TEST CORPUS 是一个专为自动语音识别(ASR)测试设计的性别平衡语料库,包含10名男性和10名女性的录音及人工转录文本。
  • 语言: 西班牙语(墨西哥口音)
  • 许可: CC-BY-SA-4.0
  • 大小: 1K<n<10K(文件数)
  • 来源: 原始数据
  • 任务类别: 自动语音识别
  • 语言: 单语种(西班牙语)

数据集结构

  • 数据实例: 每个实例包含音频ID、音频文件路径、说话者ID、性别、持续时间和标准化文本转录。
  • 数据字段:
    • audio_id: 音频段ID
    • audio: 音频信息,包括路径、音频数组和采样率
    • speaker_id: 说话者ID
    • gender: 说话者性别(男或女)
    • duration: 音频文件持续时间(秒)
    • normalized_text: 音频段的标准化转录文本
  • 数据分割: 仅包含测试集,总计3558个语音文件,总时长8小时8分钟。

数据集创建

  • 采集理由: 用于评估CIEMPIESS数据集社区用户的进展,特别推荐仅用于测试目的。
  • 源数据: 来自UNAM的RADIO-IUS电台的录音,用于学术和研究目的。
  • 注释过程: 由UNAM的学生进行手动分割和转录,主要为西班牙语母语者。

使用考虑

  • 社会影响: 由于包含自发语音,对ASR社区评估西班牙语的声学模型具有挑战性。
  • 偏见讨论: 数据集旨在性别平衡,词汇限于法律问题。
  • 其他已知限制: 转录文本与LDC或CIEMPIESS-UNAM项目官方网站的版本略有不同,建议使用更新后的转录文本。

附加信息

  • 数据集管理: 由UNAM的"Desarrollo de Tecnologías del Habla"社会服务项目的学生收集和整理。

  • 许可信息: CC-BY-SA-4.0

  • 引用信息:

    @misc{carlosmenaciempiesstest2019, title={CIEMPIESS TEST CORPUS: Audio and Transcripts of Mexican Spanish Broadcast Conversations.}, ldc_catalog_no={LDC2019S07}, DOI={https://doi.org/10.35111/xdx5-n815}, author={Hernandez Mena, Carlos Daniel}, journal={Linguistic Data Consortium, Philadelphia}, year={2019}, url={https://catalog.ldc.upenn.edu/LDC2019S07}, }

搜集汇总
数据集介绍
构建方式
在自动语音识别系统的研发中,将测试数据与训练数据严格分离是评估模型泛化能力的关键实践。CIEMPIESS TEST语料库正是基于此需求而构建,旨在为墨西哥西班牙语语音识别社区提供一个标准化的测试基准。该数据集源自UNAM旗下RADIO-IUS广播电台的墨西哥西班牙语自发对话录音,内容聚焦法律与大学相关议题。构建过程历经多阶段精细处理:首先对整段播客进行人工分割,保留高质量语音片段;随后执行第二轮分割以分离不同说话人并归类至独立文件夹;最终由计算机、工程及语言学专业的学生对时长5至10秒的语音文件进行人工转写,转写者虽为母语者但未接受专业转录训练。所有音频以16kHz、16bit单声道格式存储,确保与主流声学模型兼容。
特点
该语料库最显著的特点在于其性别平衡性——包含10名男性和10名女性说话人,共计3558个音频文件,总时长8小时8分钟,其中男性语音1694段(4小时3分钟),女性语音1864段(4小时4分钟),实现完美对称分布。所有说话人均来自墨西哥,仅M_09号说话人来自萨尔瓦多,因此语音以墨西哥中部口音为主导。数据按性别和说话人双重分类,便于研究者针对特定说话人子集进行实验。与原始CIEMPIESS语料库一致,音频内容围绕法律与UNAM法学院相关话题,转写由人工完成且经过2022年的细致修订,确保了文本标注的准确性。此外,该测试集的说话人未出现在任何其他CIEMPIESS数据集中,有效避免了数据泄露风险。
使用方法
在HuggingFace平台上,使用该数据集极为便捷。用户可通过`datasets`库直接加载,例如执行`load_dataset("ciempiess/ciempiess_test")`即可获取包含全部测试样本的数据集对象,也可通过指定`split="test"`参数明确加载测试划分。每个数据实例包含音频ID、音频路径与解码数组(采样率16kHz)、说话人ID、性别、时长及经过归一化的文本转写。研究者可将其直接用于自动语音识别(ASR)任务的模型评估,以词错误率(WER)作为核心指标。需特别注意的是,该数据集仅包含测试划分,强烈建议仅用于测试目的,避免与其他训练数据混合,以维护评估的公正性与可复现性。
背景与挑战
背景概述
CIEMPIESS TEST语料库是由墨西哥国立自治大学(UNAM)工程学院社会服务项目“Desarrollo de Tecnologías del Habla”于2016至2018年间构建的标准化测试集,由Carlos Daniel Hernández Mena主导,并于2019年发布。该语料库聚焦于墨西哥西班牙语广播对话的自动语音识别(ASR)任务,旨在为学术社区提供一个性别平衡、专用于模型评估的基准测试集。其核心研究问题在于如何通过高质量的人工转录和规范化的音频处理,促进ASR技术在墨西哥西班牙语这一低资源语言上的进步。语料库包含20位讲者(10男10女)的3558段音频,总时长约8小时,所有录音来自UNAM的RADIO-IUS电台,内容涉及法律与大学话题。作为CIEMPIESS实验系列的一部分,该数据集在拉丁美洲自然语言处理领域具有重要影响力,为评估声学模型提供了标准化平台,推动了该地区语音技术研究的发展。
当前挑战
CIEMPIESS TEST所解决的领域挑战在于墨西哥西班牙语ASR系统中缺乏标准化测试基准,导致模型性能难以公平比较。构建过程中面临多重挑战:首先,语料来源为自发广播对话,包含大量口语化表达、语速变化及背景噪声,增加了语音分割和转录的难度;其次,需确保性别平衡(各10位讲者)及发音多样性,但多数讲者来自墨西哥中部,仅一位来自萨尔瓦多,可能引入地域口音偏差;此外,转录由不同专业背景的学生完成,虽经2022年人工校验,但仍可能存在标注不一致问题;最后,音频时长限制在5至10秒,虽便于处理,却可能丢失长句的上下文信息,影响ASR模型对连续语音的理解能力。
常用场景
经典使用场景
CIEMPIESS TEST语料库作为墨西哥西班牙语广播对话的音频与转录数据集,其经典使用场景在于为自动语音识别(ASR)系统提供标准化的测试基准。该数据集包含20位发言者(男女各10人)的3558个语音文件,总时长约8小时,音频以16kHz采样率、16位单声道格式分布,并附带人工精校的规范化文本转录。研究者通常将其作为独立测试集,用于评估ASR模型在墨西哥西班牙语自发语音上的词错误率(WER)表现,避免与训练数据混合导致性能评估偏差。
衍生相关工作
CIEMPIESS TEST衍生了一系列推动西班牙语语音研究的重要工作。基于该数据集,研究者提出了针对低资源语言的迁移学习策略,例如利用预训练模型(如wav2vec 2.0)在测试集上微调以适配墨西哥口音。此外,该语料库与同系列数据集(如CIEMPIESS COMPLEMENTARY和CIEMPIESS FEM)共同构成了CIEMPIESS实验套件,支持了跨数据集对比分析,例如探究性别对ASR性能的影响或不同音频来源(广播与对话)的识别难度差异。其标准化评估框架还被应用于国际评测任务,如NIDCP(Native and Indigenous Dialectal Corpus Processing)研讨会中的西班牙语方言识别挑战,进一步拓展了语音技术在方言多样性研究中的边界。
数据集最近研究
最新研究方向
当前,CIEMPIESS TEST语料库在自动语音识别(ASR)领域的前沿研究中扮演着关键角色,尤其聚焦于墨西哥西班牙语的口语对话识别与模型泛化能力评估。随着低资源语言语音技术的蓬勃发展,该数据集因其精心设计的性别平衡结构(10男10女)及对法律议题自发语音的精准转录,成为衡量ASR系统在真实、非正式场景下鲁棒性的黄金标准。近期研究热点围绕利用该测试集对比不同声学模型在墨西哥中部口音上的表现,探索跨方言迁移学习策略,以及通过其更新的转录版本提升词错误率(WER)评估的可靠性。这一工作不仅推动了西班牙语语音技术的区域化落地,也为全球ASR社区在多样化口音与领域适应性研究提供了重要基准,其影响深远,尤其惠及教育、法律等垂直领域的智能交互系统开发。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务