相关数据集
filipinospeechcorpus
菲律宾语音语料库(Filipino Speech Corpus, FSC)是一个用于自动语音识别(ASR)和文本转语音(TTS)任务的句子级语音数据集。该数据集以Hugging Face Parquet格式存储,包含16kHz单声道音频片段。数据集总大小约为6GB,由139个分片组成。每个样本包含音频文件、对应的文本转录、音频时长、单词数量、说话者ID、性别、年龄组、语音类型(朗读/自发/机器生成
Hugging Face2026-03-22 更新240
large-scale in-the-wild Japanese laughter corpus
我们提供了一个大规模的野外日语笑声语料库和一种笑声合成方法。此前的笑声合成工作不仅缺乏数据,也缺乏适当的笑声表示方法。为了解决这些问题,我们首先提出了一个包含3.5小时笑声的野外语料库,据我们所知,这是为笑声合成设计的最庞大的笑声语料库。然后,我们提出了伪音素令牌(PPTs)来通过一系列离散令牌表示笑声,这些令牌是通过在从笑声中提取的特征上训练一个预训练的自监督模型上的聚类模型获得的。笑声可以通过
github2023-07-17 更新200
1,796小时德语手机采集语音数据
德国德语语音数据_朗读(手机),基于给定的脚本朗读并模拟录制,涵盖通用、交互、车载、家居等多类别,内容丰富。此数据集标注了文本内容等多种属性,由3,442名来自不同地域和文化背景的德国本土人参与录制,口音正宗,文本经过人工校对,准确率高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储
数据堂140
laion/voices-with-captions
合成语音描述数据集包含3180个合成的语音样本,每个样本都配有一个简短的描述,描述内容大致包括声音的年龄、性别、口音以及一些语音的一般特征(例如“老妇人,爱尔兰口音”)。所有语音均为合成生成,不代表任何真实个人,适合用于训练和评估语音转换模型,而不会侵犯个人身份或权利。
Hugging Face2025-03-21 更新220
azerbaijani-tts-dataset-audio
Azerbaijani TTS 数据集是一个用于文本到语音(TTS)和自动语音识别(ASR)任务的阿塞拜疆语数据集。该数据集包含阿塞拜疆语的音频样本及其对应的转录文本。数据集采用 MIT 许可证发布,可通过 HuggingFace 的 datasets 库加载使用。
Hugging Face2026-02-09 更新140



