遇见数据集

laion/moss-local-voice-acting-top3-with-neutral-refs

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集名为MOSS-Local Voice Acting — top-3 takes with generated neutral reference voices,是一个用于语音合成和情感语音处理的音频数据集。它针对每组三个MOSS-local语音表演数据,提供了前三名情感表演录音与三个合成中性参考音频的配对。每个中性参考音频是通过使用对应的情感表演录音作为语音克隆参考,生成一个中性语调的维基百科句子录音而创建的,解决了无参考音频语料库的无参考音频问题。数据集包含44,832个目标表演录音和44,832个中性参考音频,覆盖14,944个组,音频格式为48 kHz单声道FLAC。数据来源于三个语音表演语料库:laion/moss-local-voice-acting-64x100(v2)、laion/moss-local-voice-acting-v4-emorant-64x200(v4)和laion/moss-local-dramabox-full-reinterpretations-64(repro)。数据集提供详细的元数据,包括参考音频的元数据(如组ID、表演种子、排名、奖励分数、句子内容、说话人相似度等)和目标表演的注释(如57个VoiceNet维度回归分数和BUD-E-Whisper字幕)。此外,目标表演的WER、VoiceCLAP混合/真实性分数以及42维Empathic-Insight-Voice-Plus向量存储在源语料库的scores.parquet文件中。数据集的目的是为训练语音克隆或情感转换的文本到语音系统提供干净的参考音频到情感表演的配对。生成中性参考音频的方法包括使用4.55B模型生成三个候选音频,并选择与情感表演录音说话人相似度最高的音频。数据集结构以tar文件组织,包含目标和参考音频文件及元数据文件。注意事项包括中性参考音频是合成语音的合成表演,说话人身份相似度在ECAPA约0.7-0.85之间,但并非完全一致,且所有评分都是基于模型的信号而非人工标注。许可证为Apache-2.0,音频完全合成,维基百科句子文本使用CC-BY-SA许可。

The dataset, titled MOSS-Local Voice Acting — top-3 takes with generated neutral reference voices, is an audio dataset designed for text-to-speech and emotion-transfer applications. It pairs the top-3 emotional takes from each group of three MOSS-local voice-acting corpora with 3 synthetic neutral reference audios—one per take, in the same voice. Each neutral reference is generated by using the corresponding emotional take as a voice-clone reference to speak a boring Wikipedia sentence in a completely neutral tone, addressing the no reference audio problem in no-ref corpora. The dataset comprises 44,832 target takes and 44,832 neutral references across 14,944 groups, in 48 kHz mono FLAC format. It is sourced from three voice-acting corpora: laion/moss-local-voice-acting-64x100 (v2), laion/moss-local-voice-acting-v4-emorant-64x200 (v4), and laion/moss-local-dramabox-full-reinterpretations-64 (repro). Detailed metadata is provided, including reference metadata (e.g., group ID, take seed, rank, reward, sentence, speaker similarity) and target annotations (e.g., 57 VoiceNet dimension regression scores and a BUD-E-Whisper caption). Additionally, WER, VoiceCLAP blend/genuineness, and 42-dim Empathic-Insight-Voice-Plus vectors for target takes are stored in the source corporas scores.parquet file. The dataset aims to provide clean (reference → emotional performance) pairs for training voice-cloning or emotion-transfer TTS systems. The neutral references are generated using a 4.55B model to produce three candidate clips per take, with the highest ECAPA-TDNN speaker similarity to the take selected. The repository is organized into tar files containing target and reference audio files alongside metadata files. Notes include that neutral references are synthetic voices of synthetic performances, with speaker similarity around ECAPA sim ≈ 0.7–0.85 but not bit-exact, and all scores are model-based signals. The license is Apache-2.0, with fully synthetic audio and Wikipedia sentences under CC-BY-SA for text only.

提供机构:
laion
原始信息汇总

数据集概述:MOSS Local Voice Acting Top-3 with Neutral Refs

该数据集由 LAION 发布,旨在为语音克隆和情感迁移文本转语音(TTS)模型提供训练数据,将顶级情感音频与合成中性参考音频配对。

  • 任务类型: 文本转语音 (Text-to-Speech),音频分类 (Audio Classification)
  • 语言: 英语 (English)
  • 数据规模: 10K < n < 100K,具体包含 44,832 条目标音频 (target takes) 和 44,832 条中性参考音频 (neutral refs),分为 14,944 组 (groups)。
  • 许可证: Apache-2.0
  • 文件总大小: 55.6 GB
  • 下载量 (上月): 28

数据集结构与内容

数据集由三个源语料库的顶级情感样本组成,并为每个样本生成匹配的中性参考音频。整体布局如下:

  • 数据文件 (data/): 包含110个tar包 (<unit>.tar)。每个单元包含:
    • targets/<gid>_v<take>.flac: 每组中排名前三的情感音频。
    • refs/<gid>_t<rank>_v<take>_ref.flac: 与每个情感音频匹配的、由同一声线生成的中性参考音频。
  • 元数据文件:
    • references_meta.parquet: 包含所有中性参考音频的元数据,如组ID (gid)、音频种子 (take_seed)、排名 (rank)、奖励值 (reward)、文本句子 (sentence)、与原始音频的说话人相似度 (spk_sim) 等。
    • targets_annotations.parquet: 包含所有目标情感音频的标注,如57维 VoiceNet 维度回归分数和BUD-E-Whisper标题。

数据生成方法

  1. 情感音频选择: 从三个源语料库 (laion/moss-local-voice-acting-64x100, laion/moss-local-voice-acting-v4-emorant-64x200, laion/moss-local-dramabox-full-reinterpretations-64) 中,根据特定奖励函数(主要结合情感混合/真实度评分和词汇错误率的倒数)选出每组的top-3情感音频。
  2. 中性参考音频合成: 对每个选中的情感音频,使用同一个4.55B参数的TTS模型 (laion/moss-tts-local-transformer-4.55b-voice-acting) 生成3个候选中性音频。生成的文本来自维基百科中性句子。
  3. 最佳候选筛选: 使用 ECAPA-TDNN 模型,从3个候选中选择与原始情感音频说话人相似度最高(spk_sim)的一个作为最终的中性参考音频。整体中位数相似度在0.73至0.82之间。

使用说明

数据集的配对方式为: (refs/<gid>_t<rank>_v<seed>_ref.flac -> targets/<gid>_v<seed>.flac) 用户可以将中性参考音频作为语音克隆的参考,结合情感音频进行情感迁移TTS模型的训练。

注意事项

  • 所有中性参考音频和情感音频均为合成语音。
  • 说话人身份在组内三个音频之间并非完全一致,因为每个音频是独立克隆的。
  • 数据集中所有评分均为模型打分,并非人工标注真值。
搜集汇总
数据集介绍
laion/moss-local-voice-acting-top3-with-neutral-refs 数据集图片
构建方式
本数据集基于多个情感语音语料库构建,选取每个语料组中奖励得分最高的三条情感录音作为目标样本。为解决无参考音频问题,每条目标录音均通过4.55B参数的语音克隆模型,以同一音色朗读一段来自维基百科的平淡中性句子,生成对应的中性参考音频。每条目标录音从三个候选中性音频中筛选出与原始录音ECAPA-TDNN说话人相似度最高者,最终形成44,832对(目标-参考)语音配对,覆盖14,944个语料组。
使用方法
使用时,可通过pandas读取references_meta.parquet和targets_annotations.parquet元数据文件,以gid和take_seed为键关联目标录音与参考音频。训练配对为refs目录下的中性参考音频与targets目录下的对应情感录音,结合来源语料库的情感指令作为提示。数据按来源和情感类别分置于110个tar包中,每个单元包含目标音频、参考音频及对应的parquet元数据文件,支持灵活的批次加载与实验配置。
背景与挑战
背景概述
在文本到语音合成与语音克隆领域,情感表达的控制与参考音频的缺失一直是阻碍模型性能提升的关键瓶颈。2024年,由LAION社区主导构建的MOSS-Local Voice Acting数据集系列应运而生,旨在为情感迁移与语音克隆提供高质量、多风格的训练资源。该数据集中的top3情感录音与合成中性参考语音配对版本,进一步解决了无参考音频场景下的训练难题。其核心研究问题是:如何利用合成中性语音作为参考,精准建模从中性到特定情感的声学映射,从而提升语音克隆模型的情感表现力与自然度。该数据集以44832组参考-目标语音对覆盖14,944个情感组,并附有VoiceNet维度回归分数与BUD-E字幕注释,为语音情感迁移、语音克隆与情感语音合成研究提供了标准化、可复现的基准资源。
当前挑战
该数据集所面临的挑战主要集中在领域问题解决与构建过程两方面。在领域问题层面,其核心任务是应对情感语音合成与语音克隆中参考音频缺失的困境:传统语音克隆依赖目标说话人的自然中性参考,而情感语音数据往往缺乏匹配的中性样本,导致模型难以分离声学身份与情感状态。此外,现有数据集多采用人工标注情感标签,标注成本高且情感维度覆盖不足。在构建过程中,挑战体现为:1) 从大规模合成语料库中筛选高质量情感片段时,需综合语音混合度、真实感得分与情感强度等多维奖励信号;2) 利用语音克隆模型生成中性参考音频时,需确保在完全保持说话人音色的前提下实现情感中性化,并通过ECAPA-TDNN相似度约束(中位数0.784)保证身份一致性;3) 所有评分均基于模型预测而非人类标注,引入不可避免的标注噪声与偏差,需在元数据中明确记录以指导后续研究的数据筛选策略。
常用场景
经典使用场景
在语音合成与情感迁移研究领域,该数据集被广泛用作训练语音克隆与情感传递文本转语音系统的核心配对资源。其独特之处在于为每一条情感表现录音精心匹配了一条由相同音色合成的中性参考语音,从而构建起(中性参考→情感表现)的完整映射对。研究人员可以利用这逾四万四千组高质量配对,在保持说话人身份不变的前提下,精准学习从平淡语调到丰富情感表达之间的声学转换规律,进而提升语音克隆模型在情感控制方面的表现力与自然度。
解决学术问题
该数据集精准回应当前语音合成研究中的两个关键瓶颈:一是缺乏配套中性参考语音的情感语料库,导致语音克隆模型难以解耦音色与情感编码;二是合成语音的说话人一致性难以度量与保证。通过系统性地为每条情感录音生成说话人相似度高达0.78以上的中性参考,该数据集为情感迁移、零样本语音克隆及情感可控TTS提供了标准化训练基准,推动了从情感识别到情感生成的全链路研究进展,显著促进了语音合成领域对细粒度情感维度的建模能力。
实际应用
在实际应用中,该数据集直接赋能情感化人机交互系统的构建,适用于虚拟助手、有声读物制作、游戏角色配音及辅助沟通工具等场景。开发人员可基于该数据集训练能够根据上下文自动切换语音情感色彩的TTS引擎,使智能设备不仅听得懂用户的意图,更能以恰当的情感语调做出回应,极大提升用户体验的自然度与亲和力。在无障碍技术领域,该数据集支持为失语症患者生成富有情感变化的合成语音,帮助他们以更丰富的方式表达自我。
数据集最近研究
最新研究方向
该数据集聚焦于语音克隆与情感迁移文本转语音的前沿方向,通过为每组高表现力的语音表演生成对应的合成中性参考音频,巧妙化解了无参考音频场景的难题。研究热点在于利用大规模Transformer模型实现音色保持下的情感传递,并借助ECAPA-TDNN等声纹相似度指标优化参考音频选择。这一创新不仅为低资源语音合成提供了高质量的训练对,还推动了可控情感表达TTS系统的发展,对增强语音助手的表现力与自然度具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务