IndicVoices-R
收藏资源简介:
IndicVoices-R是一个大规模的多语言多说话人语音数据集,旨在支持印度TTS(文本到语音)技术的扩展。该数据集包含1,704小时的高质量语音,来自10,496名说话人,涵盖22种印度语言,旨在提高TTS模型在印度语言中的零样本、少样本和多样本说话人泛化能力。
IndicVoices-R is a large-scale multilingual and multi-speaker speech dataset designed to support the expansion of Indian TTS (Text-to-Speech) technology. The dataset comprises 1,704 hours of high-quality speech from 10,496 speakers, covering 22 Indian languages, and aims to enhance the zero-shot, few-shot, and diverse-sample speaker generalization capabilities of TTS models in Indian languages.
数据集概述
数据集名称
IndicVoices-R (IV-R)
数据集描述
IndicVoices-R 是针对印度语言的大规模多语种多说话人语音数据集,用于扩展印度文本到语音(TTS)合成。该数据集包含1,704小时的高质量语音,来自10,496名说话人,涵盖22种印度语言。IV-R 数据集的质量与 LJSpeech, LibriTTS, 和 IndicTTS 等黄金标准TTS数据集相匹配。
数据集用途
用于评估TTS模型在印度语音上的零样本、小样本和大样本说话人泛化能力。通过将英语预训练模型与高质量的IndicTTS和IV-R数据集结合进行微调,可以改善零样本说话人泛化能力。
数据集结构
数据集中的每个条目包含以下信息:
- 文件名:指向wav文件的路径
- 文本:音频的转录文本
- 持续时间:音频的持续时间(秒)
- 语言:ISO代码表示的语言
- 样本数:样本数量
- 逐字文本:转录文本的逐字版本
- 标准化文本:转录文本的标准化版本
- 说话人ID:唯一说话人标识
- 场景:数据类型
- 任务名称:任务描述
- 性别:说话人的性别
- 年龄组:说话人的年龄范围
- 职业类型:说话人的职业类型
- 学历:说话人的学历
- 地区:说话人所属地区
- 区:说话人所属区
- 州:说话人所属州
- 职业:说话人的职业
- 验证报告:质量保证团队提供的验证标记
- 块名称:音频块名称
- SNR、C50、语音平均音高、语音音高标准差、字错误率等音频质量指标
数据集下载
数据集可通过以下链接下载:IndicVoices-R
许可协议
数据集遵循CC-BY-4.0许可协议。




