相关数据集
大规模转换语音数据库
本研究构建了一个名为‘大规模转换语音数据库’的数据集,由16种表现良好的语音转换方法生成,旨在推动源说话人验证任务的发展。数据集包含约327,600条转换语音样本,这些样本通过随机选择三个源语音样本对同一目标语音进行语音转换生成,模拟了三种不同的攻击者。创建过程中,采用了多种语音转换技术,确保数据集的多样性和实用性。该数据集主要应用于源说话人验证领域,旨在解决语音转换技术对自动说话人验证系统安全性
arXiv2024-06-07 更新320
laion/voices-with-captions
合成语音描述数据集包含3180个合成的语音样本,每个样本都配有一个简短的描述,描述内容大致包括声音的年龄、性别、口音以及一些语音的一般特征(例如“老妇人,爱尔兰口音”)。所有语音均为合成生成,不代表任何真实个人,适合用于训练和评估语音转换模型,而不会侵犯个人身份或权利。
Hugging Face2025-03-21 更新220
azerbaijani-tts-dataset-audio
Azerbaijani TTS 数据集是一个用于文本到语音(TTS)和自动语音识别(ASR)任务的阿塞拜疆语数据集。该数据集包含阿塞拜疆语的音频样本及其对应的转录文本。数据集采用 MIT 许可证发布,可通过 HuggingFace 的 datasets 库加载使用。
Hugging Face2026-02-09 更新140
filipinospeechcorpus
菲律宾语音语料库(Filipino Speech Corpus, FSC)是一个用于自动语音识别(ASR)和文本转语音(TTS)任务的句子级语音数据集。该数据集以Hugging Face Parquet格式存储,包含16kHz单声道音频片段。数据集总大小约为6GB,由139个分片组成。每个样本包含音频文件、对应的文本转录、音频时长、单词数量、说话者ID、性别、年龄组、语音类型(朗读/自发/机器生成
Hugging Face2026-03-22 更新240
large-scale in-the-wild Japanese laughter corpus
我们提供了一个大规模的野外日语笑声语料库和一种笑声合成方法。此前的笑声合成工作不仅缺乏数据,也缺乏适当的笑声表示方法。为了解决这些问题,我们首先提出了一个包含3.5小时笑声的野外语料库,据我们所知,这是为笑声合成设计的最庞大的笑声语料库。然后,我们提出了伪音素令牌(PPTs)来通过一系列离散令牌表示笑声,这些令牌是通过在从笑声中提取的特征上训练一个预训练的自监督模型上的聚类模型获得的。笑声可以通过
github2023-07-17 更新200



