moss-local-voice-acting-top3-with-neutral-refs
收藏资源简介:
该数据集名为“MOSS-本地语音表演—前3名片段与生成的中性参考语音”,旨在为语音克隆和情感迁移文本转语音模型训练提供高质量的配对数据。其创新点在于解决了原始语料库的“无参考音频”问题:为来自三个MOSS本地语音表演源语料库的14,944组“前3名情感语音片段”,每个片段生成了一个对应的、使用相同音色的“合成中性参考音频”。数据集总共包含44,832个目标情感片段和44,832个中性参考音频,形成一一对应关系。每个中性参考音频通过一个4.55B参数的TTS模型,以对应情感片段为语音克隆参考,朗读从维基百科筛选的中性句子生成,并基于ECAPA-TDNN说话人相似度选择了最佳候选。数据以48 kHz单声道FLAC格式存储,并提供丰富的元数据,包括参考音频的说话人相似度、朗读句子,以及目标片段的57维VoiceNet维度回归分数和BUD-E-Whisper生成的字幕。适用于需要学习从中性语音到富有情感语音转换的TTS模型训练任务。
The dataset is named MOSS-Local Voice Acting — top-3 takes with generated neutral reference voices and aims to provide high-quality paired data for voice cloning and emotional transfer text-to-speech model training. Its core innovation addresses the lack of reference audio issue in original reference-free audio corpora: for each of the 14,944 groups of top-3 emotional speech clips from three MOSS local voice acting source corpora (v2, v4, repro), a corresponding synthetic neutral reference audio with the same timbre is generated. Thus, the dataset contains a total of 44,832 target emotional clips and 44,832 neutral reference audios, forming a one-to-one correspondence. Each neutral reference audio is generated by a 4.55B-parameter TTS model, using the corresponding emotional clip as a voice cloning reference to read a neutral sentence selected from Wikipedia, with the best candidate chosen based on ECAPA-TDNN speaker similarity (median approximately 0.784). Data is stored in 48 kHz mono FLAC format. The dataset provides rich metadata: reference audio metadata includes speaker similarity and read sentences; target clip annotations contain 57-dimensional VoiceNet dimension regression scores and BUD-E-Whisper generated subtitles. It is suitable for TTS model training tasks that require learning to convert from neutral to emotional speech.
数据集概述
数据集名称:MOSS-Local Voice Acting — top-3 takes with generated neutral reference voices
许可证:Apache-2.0
任务类别:文本转语音 (text-to-speech)、音频分类 (audio-classification)
语言:英语 (en)
数据集规模:10K < n < 100K (44,832 对音频)
数据集内容
本数据集为每三个 MOSS-Local 语音表演语料库组成的组,配对其前 3 个情感表演与3 个合成的中性参考音频(每个表演对应一个参考音频,音色相同)。参考音频解决了无参考语料库的“无参考音频”问题:每个最佳表演用作语音克隆参考,以完全中性的语气朗读一句平淡的维基百科句子,从而形成干净的(参考音频 → 情感表演)配对,用于训练语音克隆/情感迁移 TTS。
数据规模:
- 44,832 个目标音频 + 44,832 个中性参考音频
- 共 14,944 个组(每个音频有其参考;中位 ECAPA 说话人相似度为 0.784)
- 音频格式:48 kHz 单声道 FLAC
来源语料库与分组:
| 来源语料库 | 组数 | 选择奖励 |
|---|---|---|
| laion/moss-local-voice-acting-64x100 (v2) | 4,000 | (n(blend)+n(genu)+n(target-EI)) × invWER |
| laion/moss-local-voice-acting-v4-emorant-64x200 (v4) | 7,991 | (n(blend)+n(genu)+n(target-EI)) × invWER |
| laion/moss-local-dramabox-full-reinterpretations-64 (repro) | 2,953 | (n(blend)+n(genu)+n(emotion-cos)) × invWER |
中性参考音频生成方法
- 对于每个组的前 3 个表演,使用同一个 4.55B 模型(
laion/moss-tts-local-transformer-4.55b-voice-acting)生成 3 个候选中性片段:表演本身作为语音克隆参考,文本是独特的“平淡”维基百科句子(7–15 词,从sentence-transformers/wikipedia-en-sentences筛选),指令要求完全中性、平静、均匀的朗读音色。 - 每个表演选择与表演 ECAPA-TDNN 说话人相似度最高的候选(三选一);记录
spk_sim和所有cand_sims。试点中位数:v2 约 0.79 / v4 约 0.82 / repro 约 0.73(每组最佳)。
数据结构
data/<unit>.tar 110 个 tar 包(每个源情感/repro 桶一个): <unit>/targets/<gid>_v<take>.flac 每个组的前 3 个情感表演 <unit>/refs/<gid>_t<rank>_v<take>_ref.flac 匹配的中性参考音频 <unit>/refs.parquet 每个单元的中性参考元数据 <unit>/targets_annot.parquet 每个单元的目标标注 references_meta.parquet 所有参考音频行:gid, take_seed, rank, reward, sentence, spk_sim, cand_sims targets_annotations.parquet 所有目标音频行:gid, seed + 57 个 VoiceNet 维度 + BUD-E 字幕
单元命名规则:v2/v4 为 <ds>__<ds>_<Emotion>,DramaBox 为 repro__repro_bucket_<n>。
元数据
references_meta.parquet:每行对应一个中性参考音频,包含其克隆的表演(gid,take_seed,rank)、选择reward、朗读的sentence、与表演的spk_sim(ECAPA 余弦相似度)以及两个被丢弃候选的cand_sims。targets_annotations.parquet:每行对应一个目标表演,包含 57 个 VoiceNet 维度回归分数(来自laion/voicenet-dimension-predictors-commercial)和一个 BUD-E-Whisper 字幕(来自laion/BUD-E-Whisper_V1.1)。- 每个目标表演的 WER、VoiceCLAP blend/genuineness 分数以及 42 维 Empathic-Insight-Voice-Plus 向量存在于源语料库的
scores.parquet中——可通过gid+seed连接。
使用示例
python import pandas as pd refs = pd.read_parquet("references_meta.parquet") ann = pd.read_parquet("targets_annotations.parquet")
训练对:(refs/<gid>_t<rank>_v<seed>_ref.flac -> targets/<gid>_v<seed>.flac)
源语料库指令作为情感提示
注意事项与局限性
- 中性参考音频是合成语音的合成表演;说话人身份在 ECAPA 相似度约 0.7–0.85 时保持良好,但同一组内的三个表演并非位精确匹配(每个表演独立克隆)。
- 所有分数均为模型信号,非人工真实标注。




