遇见数据集

Custom Common Voice 16.0 dataset using RVC 14min data

收藏
arXiv2024-03-01 更新2024-06-21 收录
官方服务:

资源简介:

本研究创建了一个名为‘Custom Common Voice 16.0 dataset using RVC 14min data’的数据集,由MES工程学院的Aniket Tathe主导。该数据集包含从YouTube视频中提取的14分钟个性化音频,通过Retrieval-Based Voice Conversion (RVC)模型处理,用于训练ASR模型。数据集的创建过程涉及音频提取、转换和格式化,以适应模型训练。该数据集主要用于个性化语音的自动语音识别和翻译,特别是在低资源语言如印地语中,旨在提高语音识别的准确性和翻译的流畅性。

This study developed a dataset named 'Custom Common Voice 16.0 dataset using RVC 14min data', led by Aniket Tathe from MES College of Engineering. The dataset contains 14 minutes of personalized audio extracted from YouTube videos, processed via the Retrieval-Based Voice Conversion (RVC) model for training Automatic Speech Recognition (ASR) models. The dataset creation process involves audio extraction, conversion, and formatting to meet the requirements of model training. This dataset is primarily intended for automatic speech recognition and translation of personalized speech, particularly in low-resource languages such as Hindi, with the goal of improving the accuracy of speech recognition and the fluency of translation.

提供机构:
MES工程学院
创建时间:
2024-03-01
搜集汇总
数据集介绍
Custom Common Voice 16.0 dataset using RVC 14min data 数据集图片
构建方式
该数据集基于Mozilla Common Voice 16.0语料库构建,旨在实现个性化语音的自动语音识别。研究者从YouTube视频中提取14分钟的自定义音频,转换为WAV格式后,利用Ozen工具包进行语音提取与转录,其中Whisper模块被调整以支持印地语转录。随后,通过检索式语音转换(RVC)模型对音频进行训练与推理,将Common Voice 16.0中的原始音频转换为具有独特个性化音色的语音样本。关键参数如音量包络缩放、滤波半径及搜索特征比率被精细调校,最终生成一个定制化的Common Voice 16.0数据集,并在Hugging Face平台上公开共享。
特点
该数据集的核心特点在于其极低的数据需求量与高度个性化。仅凭14分钟的定制音频,即可通过RVC技术生成一个完整的语音语料库,显著降低了低资源语言(如印地语)ASR模型的训练门槛。数据集中的音频均经过声纹转换,保留了原始说话人的独特音色,同时与Common Voice 16.0的原有结构兼容,便于后续模型微调。此外,数据集整合了说话人日记化信息,支持多说话人场景下的精准分割,增强了在真实视频内容处理中的实用性。
使用方法
该数据集专为微调跨语言自监督表示(XLSR)Wav2Vec2模型设计,用于印地语语音识别。用户可将数据集加载至Hugging Face平台,结合预训练的XLSR-Wav2Vec2模型进行训练,典型配置包括40个训练周期、1×10⁻⁴学习率及2.5×10⁻⁶权重衰减。训练后的模型可集成至端到端流水线中:输入印地语视频后,通过pyannote进行说话人分割,依次经XLSR Wav2Vec2转写为印地语文本,再由mBART翻译为英语字幕,最终生成带时间戳的VTT字幕文件并叠加至原视频。
背景与挑战
背景概述
在低资源语言自动语音识别(ASR)领域,尤其是像印地语这样数据稀缺的语言,训练一个能够准确转录并翻译个性化语音的模型始终是一项艰巨的挑战。2024年,来自印度MES工程学院、美国佛罗里达州立大学和德国英戈尔施塔特应用技术大学的研究团队,在Aniket Tathe等人的带领下,提出了一种创新的解决方案。该研究通过仅利用14分钟的个性化自定义音频,结合检索式语音转换(RVC)技术,生成了一个定制的Common Voice 16.0语料库。这一数据集不仅突破了传统ASR模型对大规模标注数据的依赖,还为低资源语言的个性化语音处理开辟了新路径。其核心研究问题聚焦于如何在极少量数据条件下,训练出高精度的多语言语音识别与翻译系统,对推动低资源语言语音技术的民主化具有重要影响力。
当前挑战
该数据集面临的挑战主要体现在两个层面。首先,在领域问题层面,低资源语言如印地语的ASR模型训练面临数据极度匮乏的困境,且个性化语音的声学特征与标准语音差异显著,导致模型泛化能力不足,转录准确率(约0.80)和词错误率(0.53)仍有较大提升空间。其次,在构建过程中,仅14分钟的自定义音频难以覆盖丰富的语音变体,RVC模型训练对音频质量要求极高,需精细调整音量包络缩放、滤波半径等参数以避免语音失真;同时,数据增强时需手动修改Whisper模块以适应印地语转录,且模型在微调XLSR Wav2Vec2时出现了过拟合现象,进一步增加了构建可靠数据集的复杂性。
常用场景
经典使用场景
Custom Common Voice 16.0 dataset using RVC 14min data的核心应用场景在于为低资源语言(如印地语)构建个性化自动语音识别(ASR)模型。通过仅利用14分钟的个人定制音频,结合检索式语音转换(RVC)技术,该数据集实现了对Common Voice 16.0语料库的定制化增强,从而支持对XLSR-Wav2Vec2模型进行微调。这一流程使得在数据匮乏的情况下,仍能训练出针对特定说话者声音的高精度语音识别系统,尤其适用于需要个性化语音转录的场景,如个人视频内容处理。
衍生相关工作
该数据集衍生了一系列相关经典工作,包括利用RVC进行语音转换与数据增强的研究,以及基于XLSR-Wav2Vec2的低资源ASR微调方法。后续工作可探索将类似策略应用于其他低资源语言(如孟加拉语、斯瓦希里语),或结合LibriSpeech等通用语料库进行跨域迁移学习。此外,该数据集启发了对说话者日志与神经机器翻译联合优化的探索,推动了端到端视频字幕生成系统的演进,为个性化语音助手和实时翻译设备提供了技术基础。
数据集最近研究
最新研究方向
在低资源语言与个性化语音处理领域,Custom Common Voice 16.0 dataset using RVC 14min data 的构建标志着一种前沿研究范式:利用极少量个性化音频数据(仅14分钟),通过检索式语音转换(RVC)技术生成定制化语料库,进而微调跨语言自监督表示模型(XLSR Wav2Vec2)以实现高精度自动语音识别(ASR)。该研究紧密结合了多语言神经机器翻译模型mBART与说话人日志技术,构建出端到端的视频转录与翻译管道,尤其针对印地语等低资源语言,突破了传统ASR对大规模标注数据的依赖。这一方向不仅推动了低资源场景下个性化语音转换与多语言内容分发的实用化进程,也为跨语言视频字幕生成、人机交互及数字包容性提供了创新性解决方案,彰显了自监督学习与数据增强技术在极小样本条件下的巨大潜力。
相关研究论文
  • 1
    Transcription and translation of videos using fine-tuned XLSR Wav2Vec2 on custom dataset and mBARTMES工程学院 · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务