lonesamurai/emilia_clean_10k
收藏资源简介:
EMILIA Clean 10k是从amphion/Emilia-Dataset(英语部分)过滤出来的一个子集,专为单说话人TTS训练设计。数据集包含10,000个剪辑,来自200个英语说话人,每个剪辑时长3-10秒,采样率为24kHz(单声道)。数据集经过严格的过滤流程,包括候选选择(基于时长和DNSMOS质量)、重叠检测(确保每个剪辑只有一个说话人)和最终选择(每个说话人选择50个剪辑)。预处理内容包括提取文本标记、韵律嵌入、F0/能量、RVQ代码和说话人嵌入。数据集分为8,000个训练剪辑和2,000个验证剪辑。
EMILIA Clean 10k is a filtered subset of the amphion/Emilia-Dataset (English split), designed for single-speaker TTS training. The dataset contains 10,000 clips from 200 English speakers, with each clip lasting 3-10 seconds at a 24 kHz sample rate (mono). The dataset underwent a rigorous filtering pipeline including candidate selection (based on duration and DNSMOS quality), overlap detection (ensuring exactly one speaker per clip), and final selection (50 clips per speaker). Preprocessing includes extraction of text tokens, prosody embeddings, F0/energy, RVQ codes, and speaker embeddings. The dataset is split into 8,000 training clips and 2,000 validation clips.




