laion/moss-local-voice-acting-top3-with-neutral-refs
收藏资源简介:
该数据集名为MOSS-Local Voice Acting — top-3 takes with generated neutral reference voices,是一个用于语音合成和情感语音处理的音频数据集。它针对每组三个MOSS-local语音表演数据,提供了前三名情感表演录音与三个合成中性参考音频的配对。每个中性参考音频是通过使用对应的情感表演录音作为语音克隆参考,生成一个中性语调的维基百科句子录音而创建的,解决了无参考音频语料库的无参考音频问题。数据集包含44,832个目标表演录音和44,832个中性参考音频,覆盖14,944个组,音频格式为48 kHz单声道FLAC。数据来源于三个语音表演语料库:laion/moss-local-voice-acting-64x100(v2)、laion/moss-local-voice-acting-v4-emorant-64x200(v4)和laion/moss-local-dramabox-full-reinterpretations-64(repro)。数据集提供详细的元数据,包括参考音频的元数据(如组ID、表演种子、排名、奖励分数、句子内容、说话人相似度等)和目标表演的注释(如57个VoiceNet维度回归分数和BUD-E-Whisper字幕)。此外,目标表演的WER、VoiceCLAP混合/真实性分数以及42维Empathic-Insight-Voice-Plus向量存储在源语料库的scores.parquet文件中。数据集的目的是为训练语音克隆或情感转换的文本到语音系统提供干净的参考音频到情感表演的配对。生成中性参考音频的方法包括使用4.55B模型生成三个候选音频,并选择与情感表演录音说话人相似度最高的音频。数据集结构以tar文件组织,包含目标和参考音频文件及元数据文件。注意事项包括中性参考音频是合成语音的合成表演,说话人身份相似度在ECAPA约0.7-0.85之间,但并非完全一致,且所有评分都是基于模型的信号而非人工标注。许可证为Apache-2.0,音频完全合成,维基百科句子文本使用CC-BY-SA许可。
The dataset, titled MOSS-Local Voice Acting — top-3 takes with generated neutral reference voices, is an audio dataset designed for text-to-speech and emotion-transfer applications. It pairs the top-3 emotional takes from each group of three MOSS-local voice-acting corpora with 3 synthetic neutral reference audios—one per take, in the same voice. Each neutral reference is generated by using the corresponding emotional take as a voice-clone reference to speak a boring Wikipedia sentence in a completely neutral tone, addressing the no reference audio problem in no-ref corpora. The dataset comprises 44,832 target takes and 44,832 neutral references across 14,944 groups, in 48 kHz mono FLAC format. It is sourced from three voice-acting corpora: laion/moss-local-voice-acting-64x100 (v2), laion/moss-local-voice-acting-v4-emorant-64x200 (v4), and laion/moss-local-dramabox-full-reinterpretations-64 (repro). Detailed metadata is provided, including reference metadata (e.g., group ID, take seed, rank, reward, sentence, speaker similarity) and target annotations (e.g., 57 VoiceNet dimension regression scores and a BUD-E-Whisper caption). Additionally, WER, VoiceCLAP blend/genuineness, and 42-dim Empathic-Insight-Voice-Plus vectors for target takes are stored in the source corporas scores.parquet file. The dataset aims to provide clean (reference → emotional performance) pairs for training voice-cloning or emotion-transfer TTS systems. The neutral references are generated using a 4.55B model to produce three candidate clips per take, with the highest ECAPA-TDNN speaker similarity to the take selected. The repository is organized into tar files containing target and reference audio files alongside metadata files. Notes include that neutral references are synthetic voices of synthetic performances, with speaker similarity around ECAPA sim ≈ 0.7–0.85 but not bit-exact, and all scores are model-based signals. The license is Apache-2.0, with fully synthetic audio and Wikipedia sentences under CC-BY-SA for text only.
数据集概述:MOSS Local Voice Acting Top-3 with Neutral Refs
该数据集由 LAION 发布,旨在为语音克隆和情感迁移文本转语音(TTS)模型提供训练数据,将顶级情感音频与合成中性参考音频配对。
- 任务类型: 文本转语音 (Text-to-Speech),音频分类 (Audio Classification)
- 语言: 英语 (English)
- 数据规模: 10K < n < 100K,具体包含 44,832 条目标音频 (target takes) 和 44,832 条中性参考音频 (neutral refs),分为 14,944 组 (groups)。
- 许可证: Apache-2.0
- 文件总大小: 55.6 GB
- 下载量 (上月): 28
数据集结构与内容
数据集由三个源语料库的顶级情感样本组成,并为每个样本生成匹配的中性参考音频。整体布局如下:
- 数据文件 (
data/): 包含110个tar包 (<unit>.tar)。每个单元包含:targets/<gid>_v<take>.flac: 每组中排名前三的情感音频。refs/<gid>_t<rank>_v<take>_ref.flac: 与每个情感音频匹配的、由同一声线生成的中性参考音频。
- 元数据文件:
references_meta.parquet: 包含所有中性参考音频的元数据,如组ID (gid)、音频种子 (take_seed)、排名 (rank)、奖励值 (reward)、文本句子 (sentence)、与原始音频的说话人相似度 (spk_sim) 等。targets_annotations.parquet: 包含所有目标情感音频的标注,如57维 VoiceNet 维度回归分数和BUD-E-Whisper标题。
数据生成方法
- 情感音频选择: 从三个源语料库 (
laion/moss-local-voice-acting-64x100,laion/moss-local-voice-acting-v4-emorant-64x200,laion/moss-local-dramabox-full-reinterpretations-64) 中,根据特定奖励函数(主要结合情感混合/真实度评分和词汇错误率的倒数)选出每组的top-3情感音频。 - 中性参考音频合成: 对每个选中的情感音频,使用同一个4.55B参数的TTS模型 (
laion/moss-tts-local-transformer-4.55b-voice-acting) 生成3个候选中性音频。生成的文本来自维基百科中性句子。 - 最佳候选筛选: 使用 ECAPA-TDNN 模型,从3个候选中选择与原始情感音频说话人相似度最高(
spk_sim)的一个作为最终的中性参考音频。整体中位数相似度在0.73至0.82之间。
使用说明
数据集的配对方式为:
(refs/<gid>_t<rank>_v<seed>_ref.flac -> targets/<gid>_v<seed>.flac)
用户可以将中性参考音频作为语音克隆的参考,结合情感音频进行情感迁移TTS模型的训练。
注意事项
- 所有中性参考音频和情感音频均为合成语音。
- 说话人身份在组内三个音频之间并非完全一致,因为每个音频是独立克隆的。
- 数据集中所有评分均为模型打分,并非人工标注真值。




