遇见数据集

TED-LIUM 3, Gigapeech, VoxPopuli-en

收藏
arXiv2023-09-26 更新2024-06-21 收录
官方服务:

资源简介:

本研究涉及三个主要的长格式英语自动语音识别(ASR)数据集:TED-LIUM 3、Gigapeech和VoxPopuli-en。这些数据集由Rev.com创建,旨在支持长格式ASR的研究,特别是解决训练与测试数据分割不一致的问题。数据集包含完整的录音和相应的转录,尽管转录的完整性有所不同。创建过程中,通过链接和扩展技术对这些数据集进行了重组,以增强其用于长格式ASR的能力。这些数据集的应用领域包括提高ASR模型在实际未分割音频上的性能,解决模型训练与实际应用中的不匹配问题。

This study involves three primary long-form English automatic speech recognition (ASR) datasets: TED-LIUM 3, Gigapeech, and VoxPopuli-en. These datasets were developed by Rev.com to support long-form ASR research, specifically targeting the resolution of inconsistent segmentation between training and test data. The datasets include complete audio recordings and their corresponding transcriptions, though the completeness of the transcriptions varies across samples. During their development, these datasets were restructured via linking and expansion techniques to improve their suitability for long-form ASR applications. The use cases of these datasets encompass enhancing the performance of ASR models on real-world unsegmented audio, as well as addressing the mismatch between model training and practical deployment.

提供机构:
Rev.com
创建时间:
2023-09-26
搜集汇总
数据集介绍
构建方式
在语音识别领域,多数公开语料库的训练与测试数据均经过预先的短句切分,这与实际应用中音频常以长片段无分割形式出现的情况相悖,从而引发了训练与推理条件之间的失配问题。为应对这一挑战,研究团队对TED-LIUM 3、GigaSpeech和VoxPopuli-en三个标准英文语料库进行了重构。重构过程包含链接与扩展两种策略:链接是将原始语料中相邻且无缺失转录的片段直接拼接,形成更长的语音单元;扩展则通过引入外部转录资源(如TED官网的完整演讲稿)或重新启用原本因对齐问题被标记为无效的音频段,填补原始转录中的空白,从而获得完整的、连续的长语音记录。最终,这些重构后的语料以Lhotse清单格式发布,并附带了通过强制对齐获得的词级时间戳。
特点
重构后的语料库展现出显著区别于原始版本的特点。首先,音频片段的平均长度大幅增加,例如GigaSpeech的200小时子集平均片段长度从原始的4秒跃升至295秒,TED-LIUM的扩展版本平均时长超过800秒,这使其更贴近真实场景中的长语音形态。其次,语料库的总时长也有所增长,尤其是VoxPopuli通过扩展新增了超过500小时的音频数据。此外,这些语料库保留了原始的多领域特性(如TED演讲、有声书和议会录音),并提供了精确的词级对齐信息,使得研究者能够灵活地切分出不同长度的训练片段(如15秒或30秒),从而支持对长语音建模中多种策略的探索。
使用方法
该数据集的使用方法围绕长语音识别中的训练与评估展开。研究者可基于提供的词级时间戳,将长音频切分为固定长度的块(如30秒),用于训练神经换能器或基于注意力的编码器-解码器模型。在推理阶段,推荐采用重叠分块解码策略:将长录音分割为带有边缘扩展的定长片段,解码后丢弃扩展区域,再将剩余结果拼接为完整转录。实验表明,换能器模型对训练-测试失配更具鲁棒性,而将原始短句与重构后的长片段联合训练能显著降低基于注意力模型的删除错误率。但需注意,VoxPopuli的扩展数据因部分转录非逐字对应,可能导致换能器模型性能下降,使用时需谨慎筛选高质量参考文本。
背景与挑战
背景概述
在自动语音识别(ASR)研究领域,绝大多数公开语料库的训练与测试数据均经过预先的语句切分处理,然而真实应用场景中的音频往往呈现为未分割的长篇形式,由此引发了训练与推理条件之间的显著失配问题。为弥合这一鸿沟,Jennifer Drexler Fox、Desh Raj等研究者于2023年对TED-LIUM 3、GigaSpeech及VoxPopuli-en三个标准ASR语料库进行了重新发布,通过链接与扩展技术重构了其长篇版本,并提供了词级时间对齐信息。该工作由Rev.com与约翰霍普金斯大学语言语音处理中心联合完成,旨在为长篇语音识别研究提供标准化基准,其发布的长篇语料库及基线模型评估结果,对推动该领域系统性研究具有重要价值。
当前挑战
该数据集面临的核心挑战源于领域问题与构建过程两个层面。在领域问题方面,长篇语音识别需应对训练与推理时音频长度不匹配导致的模型性能退化,尤其是注意力编码器-解码器(AED)模型在未分段长音频上出现高删除率,而换能器模型虽相对鲁棒,但受限于单调对齐假设,在非逐字转录数据上表现不佳。在构建过程中,原始语料库存在转录不完整或片段缺失等缺陷,例如TED-LIUM中部分音频的转录文本存在间隙,VoxPopuli中大量被标记为无效的片段实际音频质量尚可,需通过外部转录来源的映射与无效片段的复苏来实现语料库的完整重构,同时还需平衡新增数据量与低质量参考文本带来的负面效应。
常用场景
经典使用场景
在自动语音识别(ASR)研究领域,TED-LIUM 3、GigaSpeech 和 VoxPopuli-en 三个数据集经重新发布后,其核心用途聚焦于长语音识别(Long-form ASR)的基准测试与模型评估。传统 ASR 语料库通常将音频预分割为短句,而真实应用场景中,测试音频多为未分割的长篇连续语音,由此引发训练与推理之间的领域不匹配。这些更新后的数据集通过链接与扩展技术,将原始短片段重组为完整的长录音,并配备精确的词级对齐标注,为研究长语音识别中的分割策略、上下文建模及端到端模型鲁棒性提供了标准化、可复现的实验平台。
实际应用
在实际应用中,这些数据集模拟了真实世界中的长音频识别场景,例如会议录音、讲座转写、电话客服对话以及播客内容处理。由于这些场景中的音频通常未经预先分割,且包含自然停顿、语速变化和背景噪声,传统 ASR 系统往往表现不佳。通过利用重构后的长语音数据集,开发者能够训练和评估更鲁棒的语音识别模型,使其在无需外部语音活动检测(VAD)或说话人分割器的情况下,直接对连续语音流进行高效解码。这种能力直接提升了智能语音助手、自动字幕生成、会议纪要记录及多语言翻译等工业级应用的实用性与准确性。
衍生相关工作
基于这些重构数据集,衍生出了一系列具有影响力的研究工作。例如,研究者探索了分块重叠推理(Chunk-wise Overlapped Inference)策略,通过为每个长音频片段添加扩展边界来消除边缘效应,并结合 CTC 预测的空白标签或连续积分触发(CIF)模块实现动态分割。此外,上下文感知的编码器扩展技术被提出,利用历史或后续音频片段来修正当前帧的声学表征,显著提升了长语音识别中的连贯性。语言模型方面,基于扩展上下文的重评分方法被引入,通过第二遍解码修正初次假设中的错误。这些工作共同构建了长语音 ASR 的技术生态,推动了从短句识别向连续语音处理的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务