AI Audio Datasets List (AI-ADL)
收藏资源简介:
这是一个包含语音、音乐和声效的数据集列表,用于生成AI、AIGC、AI模型训练、智能音频工具开发和音频应用。主要用于语音识别、语音合成、歌唱语音合成、音乐信息检索、音乐生成、音频处理、声音合成等。
This is a dataset list encompassing speech, music, and sound effects, utilized for generative AI, AIGC, AI model training, intelligent audio tool development, and audio applications. It is primarily employed in speech recognition, speech synthesis, singing voice synthesis, music information retrieval, music generation, audio processing, and sound synthesis.
数据集概述
数据集名称
AI Audio Datasets List (AI-ADL) 🎵
数据集内容
AI-ADL 是一个包含语音、音乐和音效的数据集列表,主要用于生成AI、AIGC、AI模型训练、智能音频工具开发和音频应用。该数据集适用于语音识别、语音合成、歌唱语音合成、音乐信息检索、音乐生成、音频处理、声音合成等领域。
数据集分类
- Speech
- Music
- Sound Effect
主要数据集详情
Speech
-
AISHELL-1
- 描述:用于普通话语音识别研究和构建语音识别系统的语料库。
- 链接:AISHELL-1
-
AISHELL-3
- 描述:由北京Shell Shell Technology Co.,Ltd发布的大规模、高保真多说话人普通话语料库,用于训练多说话人文本到语音(TTS)系统。
- 链接:AISHELL-3
-
Arabic speech Corpus
- 描述:现代标准阿拉伯语(MSA)语音语料库,用于语音合成。
- 链接:Arabic speech Corpus
-
AudioMNIST
- 描述:包含60个不同说话者的30000个语音数字样本。
- 链接:AudioMNIST
-
AVSpeech
- 描述:大规模音视频数据集,包含无干扰背景信号的语音片段。
- 链接:AVSpeech
-
ATIS (Airline Travel Information Systems)
- 描述:包含关于人类询问自动航空旅行查询系统的音频记录和相应手动转录的数据集。
- 链接:ATIS
-
Carnatic Varnam Dataset
- 描述:用于研究卡纳提克拉加调音分析的28个独唱录音集。
- 链接:Carnatic Varnam Dataset
-
Casual Conversations
- 描述:帮助研究人员评估其计算机视觉和音频模型在多样化的年龄、性别、明显肤色和环境光照条件下的准确性的数据集。
- 链接:Casual Conversations
-
CN-Celeb
- 描述:大规模野外说话人识别数据集,包含1000名中国名人的超过130,000条语音。
- 链接:CN-Celeb
-
Clotho
- 描述:音频字幕数据集,包含4981个音频样本,每个样本有五个字幕。
- 链接:Clotho
-
Common Voice
- 描述:包含9,283小时录音的音频数据集,包括年龄、性别和口音等人口统计元数据。
- 链接:Common Voice
-
CoVoST
- 描述:大规模多语言语音到文本翻译语料库,涵盖21种语言到英语和15种语言从英语的翻译。
- 链接:CoVoST
-
CVSS
- 描述:大规模多语言到英语的语音到语音翻译(S2ST)语料库,涵盖21种语言到英语的句子级平行S2ST对。
- 链接:CVSS
-
EasyCom
- 描述:首个旨在帮助缓解增强现实(AR)驱动的多传感器自我中心世界观中的鸡尾酒会效应的数据集。
- 链接:EasyCom
-
ESD (Emotional Speech Database)
- 描述:用于语音转换研究的情感语音数据库,包含350个平行语句,由10名母语为英语和10名母语为中文的说话者以5种情感类别(中性、快乐、愤怒、悲伤和惊喜)表达。
- 链接:ESD
-
FPT Open Speech Dataset (FOSD)
- 描述:包含25,921个越南语演讲录音(及其转录和每个演讲的标记开始和结束时间)的数据集,手动编译自2018年公开发布的3个子数据集。
- 链接:FOSD
-
Free Spoken Digit Dataset (FSDD)
- 描述:一个免费的语音数字音频数据集,类似于音频的MNIST。
- 链接:FSDD
-
Fluent Speech Commands
- 描述:一个开源音频数据集,用于口语理解(SLU)实验,每个话语都标有“动作”、“对象”和“位置”值。
- 链接:Fluent Speech Commands
-
Genshin Datasets
- 描述:用于SVC/SVS/TTS的Genshin数据集。
- 链接:Genshin Datasets
-
GenshinVoice
- 描述:原神语音数据集。
- 链接:GenshinVoice
-
GigaSpeech
- 描述:一个多领域的英语语音识别语料库,包含10,000小时的高质量标记音频,适合监督训练,以及40,000小时的总体音频,适合半监督和无监督训练。
- 链接:GigaSpeech
-
GigaSpeech 2
- 描述:一个针对低资源语言的进化、大规模和多领域自动语音识别(ASR)语料库,具有自动爬取、转录和细化功能。
- 链接:GigaSpeech 2
-
How2
- 描述:包含13,500个视频或300小时语音的数据集,分为185,187个训练、2022个开发和2361个测试话语。
- 链接:How2
-
inaGVAD
- 描述:一个具有语音活动检测(VAD)和说话者性别分割(SGS)注释的法语电视和广播数据集,附有评估脚本和详细的注释方案。
- 链接:inaGVAD
-
KdConv
- 描述:一个中文多领域知识驱动对话数据集,将多轮对话中的主题与知识图谱相结合。
- 链接:KdConv
-
Libriheavy
- 描述:一个包含50,000小时ASR语料库,具有标点符号、大小写和上下文。
- 链接:Libriheavy
-
LibriSpeech
- 描述:一个包含大约1,000小时有声读物的语料库,主要来自LibriVox项目。
- 链接:LibriSpeech
-
LibriTTS
- 描述:一个多说话人英语语料库,包含大约585小时的英语朗读语音,采样率为24kHz,专为TTS研究设计。
- 链接:LibriTTS
-
LibriTTS-R
- 描述:通过应用语音恢复技术从LibriTTS语料库中派生的多说话人文本到语音语料库。
- 链接:LibriTTS-R
-
LJSpeech (The LJ Speech Dataset)
- 描述:一个公共领域语音数据集,包含13,100个短音频片段,由单个说话者朗读7本非虚构书籍的段落。
- 链接:LJSpeech
-
LRS2 (Lip Reading Sentences 2)
- 描述:牛津-BBC唇读句子2(LRS2)数据集,是最大的公开可用唇读句子数据集之一。
- 链接:LRS2
-
LRW (Lip Reading in the Wild)
- 描述:一个大规模音视频数据库,包含来自1,000多名说话者的500个不同单词。
- 链接:LRW
-
MuAViC
- 描述:一个多语言音视频语料库,用于鲁棒语音识别和鲁棒语音到文本翻译。
- 链接:MuAViC
-
MuST-C
- 描述:目前最大的公开可用多语言语料库(一




