遇见数据集

moss-local-voice-acting-top3-with-neutral-refs

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

该数据集名为“MOSS-本地语音表演—前3名片段与生成的中性参考语音”,旨在为语音克隆和情感迁移文本转语音模型训练提供高质量的配对数据。其创新点在于解决了原始语料库的“无参考音频”问题:为来自三个MOSS本地语音表演源语料库的14,944组“前3名情感语音片段”,每个片段生成了一个对应的、使用相同音色的“合成中性参考音频”。数据集总共包含44,832个目标情感片段和44,832个中性参考音频,形成一一对应关系。每个中性参考音频通过一个4.55B参数的TTS模型,以对应情感片段为语音克隆参考,朗读从维基百科筛选的中性句子生成,并基于ECAPA-TDNN说话人相似度选择了最佳候选。数据以48 kHz单声道FLAC格式存储,并提供丰富的元数据,包括参考音频的说话人相似度、朗读句子,以及目标片段的57维VoiceNet维度回归分数和BUD-E-Whisper生成的字幕。适用于需要学习从中性语音到富有情感语音转换的TTS模型训练任务。

The dataset is named MOSS-Local Voice Acting — top-3 takes with generated neutral reference voices and aims to provide high-quality paired data for voice cloning and emotional transfer text-to-speech model training. Its core innovation addresses the lack of reference audio issue in original reference-free audio corpora: for each of the 14,944 groups of top-3 emotional speech clips from three MOSS local voice acting source corpora (v2, v4, repro), a corresponding synthetic neutral reference audio with the same timbre is generated. Thus, the dataset contains a total of 44,832 target emotional clips and 44,832 neutral reference audios, forming a one-to-one correspondence. Each neutral reference audio is generated by a 4.55B-parameter TTS model, using the corresponding emotional clip as a voice cloning reference to read a neutral sentence selected from Wikipedia, with the best candidate chosen based on ECAPA-TDNN speaker similarity (median approximately 0.784). Data is stored in 48 kHz mono FLAC format. The dataset provides rich metadata: reference audio metadata includes speaker similarity and read sentences; target clip annotations contain 57-dimensional VoiceNet dimension regression scores and BUD-E-Whisper generated subtitles. It is suitable for TTS model training tasks that require learning to convert from neutral to emotional speech.

提供机构:
LAION eV
创建时间:
2026-07-19
原始信息汇总

数据集概述

数据集名称:MOSS-Local Voice Acting — top-3 takes with generated neutral reference voices

许可证:Apache-2.0

任务类别:文本转语音 (text-to-speech)、音频分类 (audio-classification)

语言:英语 (en)

数据集规模:10K < n < 100K (44,832 对音频)


数据集内容

本数据集为每三个 MOSS-Local 语音表演语料库组成的组,配对其前 3 个情感表演3 个合成的中性参考音频(每个表演对应一个参考音频,音色相同)。参考音频解决了无参考语料库的“无参考音频”问题:每个最佳表演用作语音克隆参考,以完全中性的语气朗读一句平淡的维基百科句子,从而形成干净的(参考音频 → 情感表演)配对,用于训练语音克隆/情感迁移 TTS。

数据规模

  • 44,832 个目标音频 + 44,832 个中性参考音频
  • 共 14,944 个组(每个音频有其参考;中位 ECAPA 说话人相似度为 0.784)
  • 音频格式:48 kHz 单声道 FLAC

来源语料库与分组

来源语料库 组数 选择奖励
laion/moss-local-voice-acting-64x100 (v2) 4,000 (n(blend)+n(genu)+n(target-EI)) × invWER
laion/moss-local-voice-acting-v4-emorant-64x200 (v4) 7,991 (n(blend)+n(genu)+n(target-EI)) × invWER
laion/moss-local-dramabox-full-reinterpretations-64 (repro) 2,953 (n(blend)+n(genu)+n(emotion-cos)) × invWER

中性参考音频生成方法

  1. 对于每个组的前 3 个表演,使用同一个 4.55B 模型(laion/moss-tts-local-transformer-4.55b-voice-acting)生成 3 个候选中性片段:表演本身作为语音克隆参考,文本是独特的“平淡”维基百科句子(7–15 词,从 sentence-transformers/wikipedia-en-sentences 筛选),指令要求完全中性、平静、均匀的朗读音色。
  2. 每个表演选择与表演 ECAPA-TDNN 说话人相似度最高的候选(三选一);记录 spk_sim 和所有 cand_sims。试点中位数:v2 约 0.79 / v4 约 0.82 / repro 约 0.73(每组最佳)。

数据结构

data/<unit>.tar 110 个 tar 包(每个源情感/repro 桶一个): <unit>/targets/<gid>_v<take>.flac 每个组的前 3 个情感表演 <unit>/refs/<gid>_t<rank>_v<take>_ref.flac 匹配的中性参考音频 <unit>/refs.parquet 每个单元的中性参考元数据 <unit>/targets_annot.parquet 每个单元的目标标注 references_meta.parquet 所有参考音频行:gid, take_seed, rank, reward, sentence, spk_sim, cand_sims targets_annotations.parquet 所有目标音频行:gid, seed + 57 个 VoiceNet 维度 + BUD-E 字幕

单元命名规则:v2/v4 为 <ds>__<ds>_<Emotion>,DramaBox 为 repro__repro_bucket_<n>


元数据

  • references_meta.parquet:每行对应一个中性参考音频,包含其克隆的表演(gid, take_seed, rank)、选择 reward、朗读的 sentence、与表演的 spk_sim(ECAPA 余弦相似度)以及两个被丢弃候选的 cand_sims
  • targets_annotations.parquet:每行对应一个目标表演,包含 57 个 VoiceNet 维度回归分数(来自 laion/voicenet-dimension-predictors-commercial)和一个 BUD-E-Whisper 字幕(来自 laion/BUD-E-Whisper_V1.1)。
  • 每个目标表演的 WER、VoiceCLAP blend/genuineness 分数以及 42 维 Empathic-Insight-Voice-Plus 向量存在于源语料库的 scores.parquet 中——可通过 gid + seed 连接。

使用示例

python import pandas as pd refs = pd.read_parquet("references_meta.parquet") ann = pd.read_parquet("targets_annotations.parquet")

训练对:(refs/<gid>_t<rank>_v<seed>_ref.flac -> targets/<gid>_v<seed>.flac)

源语料库指令作为情感提示


注意事项与局限性

  • 中性参考音频是合成语音的合成表演;说话人身份在 ECAPA 相似度约 0.7–0.85 时保持良好,但同一组内的三个表演并非位精确匹配(每个表演独立克隆)。
  • 所有分数均为模型信号,非人工真实标注。
搜集汇总
数据集介绍
moss-local-voice-acting-top3-with-neutral-refs 数据集图片
构建方式
该数据集基于MOSS本地语音表演语料库构建,从每组三个语料中筛选出表现最佳的三条情感录音,并利用4.55B参数规模的语音克隆模型,以每条最佳录音为参考,生成三段对应的中性参考音频。生成过程中,模型被指令以完全中性、平静的语调朗读一句来自维基百科的平淡句子,确保音色与原始情感录音一致。随后从三位候选中性音频中,通过ECAPA-TDNN说话人相似度评估选取与原始录音最相似的一条。最终整理形成44,832对目标情感录音与中性参考音频,覆盖14,944个分组。
特点
数据集的核心特色在于每一条情感目标录音都配有同音色的中性参考音频,解决了此前无参考音频语料库的训练难题。参考音频与目标录音的说话人相似度中位数达0.784,保证了音色一致性。所有音频均为48kHz单声道FLAC格式,质量优异。此外,数据集中每条目标录音均附带57维VoiceNet维度回归分数与BUD-E-Whisper描述,参考音频则记录了说话人相似度等详细元数据,极大便利了后续分析与训练。
使用方法
使用时,用户可直接通过参考音频与目标录音的配对关系构建训练样本,即从中性参考音频序列映射至对应的情感目标音频,并利用源语料库中的情感指令作为条件。通过Pandas读取parquet格式的元数据文件即可获取所有配对信息与标注。该数据集特别适用于语音克隆、情感迁移文本转语音模型的训练,研究者可基于ECAPA说话人相似度分数筛选高保真度的训练子集,或结合VoiceNet维度分数进行精细化的情感控制建模。
背景与挑战
背景概述
MOSS-Local Voice Acting数据集由LAION机构于2024年创建,旨在解决语音克隆与情感迁移文本到语音(TTS)系统中的关键瓶颈——缺乏配对的情感语音与中性参考语音。该数据集汇集了来自三个子语料库的44,832条情感语音及其对应的合成中性参考语音,共计14,944组,填补了无参考语音语料库中“情感-中性”对齐数据的空白。通过ECAPA-TDNN模型验证,参考语音与情感语音间的说话人相似度中位数达到0.784,为情感TTS、语音克隆及多模态情感识别研究提供了高质量基准。其影响力体现在:1) 简化了情感迁移模型训练中参考语音的获取流程;2) 推动了合成语音在情感表达领域的标准化评估;3) 为低资源语种的情感语音合成开辟了新路径。
当前挑战
该数据集面临的核心挑战包括:1) 领域问题层面:现有情感TTS模型因缺乏配对的“中性-情感”参考语音,难以精准迁移说话人音色与情感强度,导致合成语音情感表现力不足且身份一致性不稳定;2) 构建过程中,合成中性参考语音依赖单一TTS模型(4.55B参数),其生成质量受限于模型本身对中性语调的刻画能力,ECAPA相似度在0.7-0.85间波动,无法达到比特级精确;3) 所有评分(WER、VoiceCLAP、VoiceNet维度)均基于模型而非人工标注,可能引入系统偏差,影响下游模型对真实情感分布的泛化能力;4) 来自不同子语料库的语音在情感类别、数据量及选择策略上的差异(如奖励函数不同),增加了跨库联合训练时的领域适应难度。
常用场景
经典使用场景
该数据集专为语音克隆与情感迁移文本转语音任务而设计,其核心价值在于提供了成对的‘中性参考语音—情感化表演’数据。每一条目标情感音频都配有相同音色的合成中性参考音频,这一结构天然适用于训练基于参考语音的情感迁移模型。研究者可直接将中性参考作为声纹锚点,驱动模型学习从平淡语调到特定情感表达的映射关系,从而实现高保真的情感化语音合成。
衍生相关工作
该数据集衍生了一系列代表性研究工作。其依赖的MOSS-TTS系列模型(如4.55B参数的情感迁移模型)是该领域的重要基准;VoiceNet维度预测器与BUD-E-Whisper描述模型的联合标注方案,开创了多维情感量化与自然语言描述相结合的评价体系。ECAPA-TDNN相似度筛选策略则被后续研究广泛借鉴,用于保证克隆语音的身份一致性。这些工作共同推动了可控情感语音合成技术向更精细、更鲁棒的方向发展。
数据集最近研究
最新研究方向
在当前语音合成领域,情感迁移与语音克隆的耦合研究正成为前沿热点,该数据集通过为每组top-3情感语音片段配对一个合成的中性参考音频,巧妙解决了无参考音频时的训练瓶颈。这一设计深度契合了零样本语音克隆与情感控制TTS系统的最新进展,尤其在LAION社区推动的开放语音模型生态中,其采用ECAPA-TDNN进行说话人相似度筛选并辅以VoiceNet维度预测和BUD-E语义描述,为构建高保真、细粒度情感迁移模型提供了可复现的基准资源。该数据集的出现不仅加速了多情感语音合成从实验室走向应用,也为人机交互中更自然的情感表达奠定了数据基石,对降低AI语音的机械感和提升用户情感共鸣具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务