相关数据集
大规模转换语音数据库
本研究构建了一个名为‘大规模转换语音数据库’的数据集,由16种表现良好的语音转换方法生成,旨在推动源说话人验证任务的发展。数据集包含约327,600条转换语音样本,这些样本通过随机选择三个源语音样本对同一目标语音进行语音转换生成,模拟了三种不同的攻击者。创建过程中,采用了多种语音转换技术,确保数据集的多样性和实用性。该数据集主要应用于源说话人验证领域,旨在解决语音转换技术对自动说话人验证系统安全性
arXiv2024-06-07 更新320
laion/voices-with-captions
合成语音描述数据集包含3180个合成的语音样本,每个样本都配有一个简短的描述,描述内容大致包括声音的年龄、性别、口音以及一些语音的一般特征(例如“老妇人,爱尔兰口音”)。所有语音均为合成生成,不代表任何真实个人,适合用于训练和评估语音转换模型,而不会侵犯个人身份或权利。
Hugging Face2025-03-21 更新220
Custom Common Voice 16.0 dataset using RVC 14min data
本研究创建了一个名为‘Custom Common Voice 16.0 dataset using RVC 14min data’的数据集,由MES工程学院的Aniket Tathe主导。该数据集包含从YouTube视频中提取的14分钟个性化音频,通过Retrieval-Based Voice Conversion (RVC)模型处理,用于训练ASR模型。数据集的创建过程涉及音频提取、转换和格式化
arXiv2024-03-01 更新290
accent_coach_training_dataset
该数据集包含句子ID、句子内容、输入和输出说话者、源音频和目标音频等特征。音频的采样率为16000。数据集分为训练、验证和测试集,分别包含72000、9000和9000个样本。数据集的总下载大小为5603210527字节,总数据集大小为16185571242.0字节。
Hugging Face2024-12-12 更新190



