SynData-2/echo-clones-4m-en
收藏资源简介:
echo-clones-4m-en 是一个英语文本转语音(TTS)克隆数据集,包含约400万条语音话语,使用EchoTTS(jordand/echo-tts-base)模型生成。音频采样率为44,100 Hz,采用16-bit PCM WAV格式,存储在Parquet文件中。数据集包含4000个参考说话人(spk_0000-spk_3999),文本按长度分桶:短文本(≤100字符)、中等文本(100-300字符)、长文本(300-420字符)。说话人分配采用轮询方式,即文本[i]分配给spk_{i % 4000}。数据集特征包括音频、文本和说话人ID,仅提供训练集分割。
echo-clones-4m-en is a dataset of ~4 million English TTS clone utterances generated with EchoTTS (jordand/echo-tts-base). The audio has a sample rate of 44,100 Hz, stored as 16-bit PCM WAV in Parquet format. It includes 4,000 reference speakers (spk_0000-spk_3999), with text bucketing into categories: quip (≤100 chars), mid (100-300 chars), and ramble (300-420 chars). Speaker assignment follows a round-robin pattern: text[i] -> spk_{i % 4000}. The dataset features audio, text, and speaker_id, with a train split only.
数据集概述:echo-clones-4m-en
- 发布机构:SynData-2 (Synthetic Data Research Lab-2)
- 任务:文本转语音 (Text-to-Speech)
- 模态:音频、文本
- 格式:Parquet
- 语言:英语
- 数据规模:100K - 1M(实际行数:884,500 行)
- 许可证:Apache-2.0
数据集内容
该数据集包含约 400 万条英语文本转语音(TTS)克隆语句,由 EchoTTS 模型(jordand/echo-tts-base)生成。
- 采样率:44,100 Hz,16-bit PCM WAV(存储于 Parquet 文件中)
- 说话人数量:4,000 个参考说话人(ID 为 spk_0000 至 spk_3999)
- 文本长度分桶:
- quip:<=100 字符
- mid:100-300 字符
- ramble:300-420 字符
- 说话人分配方式:轮询分配(text[i] -> spk_{i % 4000})
配套数据集
- 参考说话人音频:SynData-2/echo-ref-speakers-4k-en(用于说话人条件输入的 4,000 个参考 WAV 文件)
- 文本来源:SynData-2/echo-4m-text-en(400 万条输入文本)
文件信息
- 总文件大小:389 GB
- 近月下载量:1,191 次




