遇见数据集

VoxPopuli

收藏
arXiv2021-07-27 更新2024-06-21 收录
官方服务:

资源简介:

VoxPopuli是由Facebook AI创建的大型多语种语音数据集,包含23种语言共计40万小时的未标记语音数据,是目前最大的开放数据集,用于无监督表示学习和半监督学习。该数据集还包含15种语言的1.8K小时转录演讲及其对15种目标语言的口头解释,总计17.3K小时。VoxPopuli旨在通过提供丰富的多语种音频数据,推动多语种自动语音识别(ASR)和语音翻译(ST)的研究进展,解决现有数据集在多语种支持上的不足,并特别关注实时语音翻译(解释)的质量与延迟平衡问题。

VoxPopuli is a large-scale multilingual speech dataset developed by Facebook AI. It contains 400,000 hours of unlabeled speech data spanning 23 languages, making it the largest open dataset currently available for unsupervised representation learning and semi-supervised learning. Additionally, the dataset includes 1.8K hours of transcribed speeches in 15 languages, paired with verbal explanations for 15 target languages, totaling 17.3K hours. VoxPopuli aims to advance research in multilingual automatic speech recognition (ASR) and speech translation (ST) by providing abundant multilingual audio data, addressing the limitations of existing datasets in multilingual support, with a particular focus on balancing quality and latency in real-time speech translation (interpretation).

提供机构:
Facebook AI
创建时间:
2021-01-02
搜集汇总
数据集介绍
构建方式
VoxPopuli的构建源于对2009至2020年欧洲议会活动录音的系统性采集,涵盖了全体会议、委员会会议等多种场景。原始音频经过能量检测的语音活动分割算法,切分为15至30秒的短片段,并剔除静音部分,最终形成约40万小时的无标签语音数据。对于有标签部分,利用说话人日志技术校准原始时间戳,将音频按说话人切分为段落,再通过语音识别系统进行强制对齐,依据标点或静音进一步分割为不超过20秒的语句,并以字符错误率低于20%为阈值筛选高质量片段。语音到语音的对齐则借助LASER句子嵌入计算源文本与解码文本的余弦相似度,选取最佳匹配片段,最终构建出覆盖23种语言的大规模多语语料库。
特点
VoxPopuli的显著特点在于其规模与多语覆盖的均衡性,提供了迄今为止最大的公开无标签语音数据,总量达40万小时,均匀分布于23种欧盟语言,每种语言均拥有8千至2.4万小时的数据,有效缓解了低资源语言数据匮乏的问题。此外,该数据集还包含1.8万小时的有标签语音,覆盖16种语言,并创新性地提供了15种目标语言的同声口译对齐数据,总计1.73万小时。这些口译数据与传统的书面翻译不同,呈现出概括性与信息压缩的‘口译语’特征,为研究质量与延迟权衡的语音翻译模型提供了独特资源。数据集的说话人多样性丰富,总计超过4千名说话人,且测试与开发集通过精心设计保证了较高的说话人异质性。
使用方法
VoxPopuli的使用方法灵活多样,主要面向无监督表示学习、半监督学习以及语音翻译研究。研究者可利用其大规模无标签数据,通过wav2vec 2.0等自监督框架进行预训练,随后在特定语言的有标签数据上进行微调,尤其适用于低资源场景,实验表明预训练可显著降低词错误率。对于半监督学习,可采用自训练策略,利用监督模型为无标签数据生成伪标签,并与原始有标签数据联合训练,提升域内与域外性能。此外,语音到语音对齐产生的弱标签数据可直接用于端到端语音翻译模型的训练,其信息密度高于伪标签数据,能带来更显著的性能提升。数据集通过官方GitHub仓库公开,并提供了基于fairseq和wav2letter的基线模型与实验配置,便于复现与扩展。
背景与挑战
背景概述
VoxPopuli数据集由Facebook AI的研究团队于2021年创建,核心研究人员包括Changhan Wang、Morgane Rivière等。该数据集聚焦于多语言语音表征学习、半监督学习及同声传译领域,旨在解决非英语语言资源匮乏的瓶颈问题。其研究背景源于当前语音识别与翻译任务过度依赖英语数据(如LibriSpeech、MuST-C),而多语言场景下高资源语言与低资源语言数据量悬殊。VoxPopuli从2009至2020年欧洲议会会议录音中采集了400K小时未标注语音,覆盖23种欧盟语言,并提供了1.8K小时转录语音及17.3K小时的口译对齐数据,成为迄今规模最大的开源多语言语音语料库。该数据集通过大规模无监督预训练与半监督学习范式,显著推动了低资源语言的ASR与ST性能提升,在跨语言表征泛化与域外迁移任务中展现出卓越影响力。
当前挑战
VoxPopuli所解决的领域挑战包括:多语言语音识别与翻译中高资源与低资源语言数据严重不均衡,导致模型在低资源语言上识别错误率极高(如斯洛文尼亚语WER接近100%);同时,同声传译数据稀缺且现有语料库(如CIAIR)规模有限或不再公开,制约了端到端语音翻译模型对实时口译策略的学习。在构建过程中,数据集面临多重技术挑战:原始欧洲议会录音存在音频缺失、转录不完整及时间戳不准确等问题,需通过语音活动检测与说话人分离技术进行精细分割与校准;语音到口译的对齐需依赖ASR系统进行强制对齐,而ASR错误会导致对齐质量下降,需借助LASER语义相似度阈值过滤低质量匹配;此外,跨语言数据分布不均衡(如立陶宛语仅2小时转录数据)与计算资源消耗(最大模型需128块V100 GPU训练10天)也构成显著障碍。
常用场景
经典使用场景
在语音研究领域,大规模多语言无标注数据始终是推动自监督表示学习与半监督学习突破的关键瓶颈。VoxPopuli作为迄今最大的开源多语言语音语料库,提供了涵盖23种欧盟语言的400K小时无标注语音,以及15种语言的1.8K小时转录语音和对应的口译对齐数据。其最经典的使用场景在于作为预训练基石,研究者可基于其海量多语言数据进行wav2vec 2.0等自监督模型的训练,进而通过微调或自训练范式显著提升下游自动语音识别与语音翻译的性能,尤其在低资源语言和跨领域泛化任务中展现出卓越的适应性。
解决学术问题
VoxPopuli的提出有效解决了多语言语音研究中标注数据稀缺与领域迁移困难两大核心学术问题。此前,大规模无标注语料仅局限于英语(如LibriLight),而多语言数据集或因规模有限或因许可限制难以支撑前沿探索。该语料库通过提供均衡覆盖高资源与低资源语言的400K小时无标注数据,使得研究者得以系统性地探索跨语言表示学习的泛化能力,并验证半监督方法在域外场景(如从议会演讲迁移至众包朗读语音)中的鲁棒性。其意义在于推动了从单语言向多语言、从同领域向跨领域语音理解范式的转变,为低资源语言ASR与端到端语音翻译的实用化铺平了道路。
衍生相关工作
VoxPopuli的出现催生了一系列具有深远影响的衍生工作。在自监督表示学习方面,基于其数据训练的wav2vec 2.0多语言模型(如VP-100K)在跨语言音素判别任务中展现出与XLSR-53相媲美的性能,推动了“一模型适配所有语言”范式的进展。在半监督学习领域,研究者利用其无标注数据通过自训练方法在EuroParl-ST与CoVoST 2基准上同时提升了域内与域外的语音翻译BLEU值,验证了弱监督数据相较于伪标签数据的更高信息密度。此外,其口译对齐数据为研究“翻译腔”与“口译腔”的差异提供了独特资源,启发了后续关于实时语音翻译质量-延迟权衡策略的建模工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务