irodori-clones-3m-v2
收藏资源简介:
Irodori TTS Clones v2 是一个大规模日语文本转语音(TTS)合成数据集,包含3,290,000个克隆语音样本。该数据集使用Aratako/Irodori-TTS-500M-v2模型生成,基于来自配套数据集SynData-2/irodori-refs-10k-v2的10,000个参考语音。每个参考语音对应生成329个克隆语音,每个克隆都配有一段独特的日语对话文本。数据集以Apache 2.0许可证发布,适用于文本转语音模型的训练与评估。数据以训练集形式组织,每个样本包含三个字段:48kHz采样率的音频、对应的文本内容以及说话人ID。
Irodori TTS Clones v2 is a large-scale Japanese text-to-speech (TTS) synthesis dataset containing 3,290,000 cloned speech samples. This dataset is generated using the Aratako/Irodori-TTS-500M-v2 model, based on 10,000 reference speech samples from the supporting dataset SynData-2/irodori-refs-10k-v2. Each reference voice corresponds to 329 cloned speech samples, with each clone paired with a unique piece of Japanese dialogue text. The dataset is released under the Apache 2.0 license and is suitable for the training and evaluation of text-to-speech models. The data is structured as a training set, where each sample includes three fields: audio at a 48kHz sampling rate, corresponding textual content, and speaker ID.
数据集概况
- 名称: Irodori TTS Clones v2 (3.29M)
- 许可证: Apache-2.0
- 任务: 文本转语音 (text-to-speech)
- 语言: 日语
数据集规模
- 总样本数: 3,290,000 条克隆语音
- 类别: 1M < n < 10M
数据集构成
- 参考语音来源: 10,000 个参考说话人 (来自 SynData-2/irodori-refs-10k-v2)
- 克隆模型: Aratako/Irodori-TTS-500M-v2
- 生成方式: 每个参考语音对应 329 条克隆语音,每条包含独特的日语对话文本
- 数据划分: 仅训练集 (train),包含 3,290,000 个样本
数据特征
audio: 音频数据,采样率 48,000 Hztext: 文本内容 (字符串)speaker_id: 说话人标识 (字符串)
文件格式
- 数据文件路径: data/train-*.parquet (Parquet 格式)




