遇见数据集

moss-local-voice-acting-v4-emorant-64x200

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

MOSS-Local Voice Acting v4 "emorant" 是一个专注于最大化情感表达的合成语音数据集,旨在通过高强度、戏剧化的情感传递来推动语音合成的情感表现力。数据集包含40种不同情感类别,每种情感包含200组数据,每组生成64个语音样本,总计目标为512,000个音频片段。音频为48 kHz单声道FLAC格式,由合并后的4.55B参数MOSS-TTS本地Transformer语音表演模型生成,未使用参考音频,模型根据对普通人类说话者的角色描述自主生成每组的声音。该版本核心特点是情感强度最大化,生成指令基于进化提示研究重写,包括情感映射到表达类别、直接情感命名、逐句增强、非语言声音提示和清晰度保障条款。数据集适用于文本到语音和音频分类任务,提供详细的评分表格,包含多种自动化评分指标。已知局限性包括极端情感表达可能影响清晰度,脚本为戏剧独白,评分基于模型预测。数据集采用Apache-2.0许可证,所有音频均为完全合成。

MOSS-Local Voice Acting v4 "emorant" is a synthetic speech dataset focused on maximizing emotional expression, aiming to advance the emotional expressiveness of speech synthesis through high-intensity, dramatic emotional delivery. The dataset contains 40 distinct emotion categories, with 200 groups of data per emotion, and 64 speech samples generated per group, with an overall target of 512,000 audio clips. The audio is in 48 kHz mono FLAC format, generated by the merged 4.55-billion-parameter MOSS-TTS local Transformer voice acting model, without using reference audio. The model autonomously generates the voice for each group based on character descriptions of ordinary human speakers. The core feature of this version is maximizing emotional intensity. The generation instructions were rewritten based on evolutionary prompting research, including emotion mapping to expression categories, direct emotion naming, sentence-by-sentence enhancement, non-verbal audio prompts, and clarity guarantee clauses. This dataset is applicable for text-to-speech and audio classification tasks, and provides detailed scoring sheets containing multiple automated evaluation metrics. Known limitations include that extreme emotional expressions may compromise clarity, the scripts are dramatic monologues, and the scoring is based on model predictions. The dataset is released under the Apache-2.0 license, and all audio is fully synthetic.

提供机构:
LAION eV
创建时间:
2026-07-17
原始信息汇总

数据集概述

数据集名称:MOSS-Local Voice Acting v4 "emorant" — maximally emotional deliveries

许可证:Apache-2.0

任务类别:文本转语音(text-to-speech)、音频分类(audio-classification)

语言:英语(en)

数据集规模:100K < n < 1M(目标生成 512,000 个音频片段)

数据集大小:40 种情绪 × 200 组 × 64 次录制,每个 FLAC 文件为 48 kHz 单声道,原始模型输出(温度 1.0),无参考音频。


数据集特点

  • 核心目标:v4 版本专注于最大强度的情感表达,通过重写指令,对每个情绪采用特定的“投送类别”(delivery class),包括 RANT(暴怒)、DISTRESS(痛苦)、GRIEF(悲伤)、JOY(喜悦)、TENDER(温柔)、WONDER(惊奇)以及 SPECIAL(特殊,如陶醉/戏谑/狂喜)。
  • 情感命名:情感名称直接且具体(如“mid-explosion in an unhinged furious rant”),避免抽象描述。
  • 升级弧线:指令中嵌入“随着每一句话更加……”的渐进式情感升级提示。
  • 声音爆发提示:脚本中包含括号标注的非言语声音爆发提示(如喘息、啜泣、狂笑)。
  • 可懂度保障:每条指令末尾强调“但每个词依然清晰可辨”,使 WER(词错误率)可作为过滤依据。
  • 角色设置:所有角色均为“普通人类”(无奇幻生物),脚本为全新的单句提示,不使用 v2/v3 的脚本。

数据文件结构

data/<Emotion>.tar 每个情绪一个 tar 文件(约 14 GB,共 40 个): <Emotion>/<Emotion>_<group>_v<take>.flac 64 次录制 × 200 组,48 kHz 单声道 FLAC <Emotion>/scores.parquet 每个情绪对应的评分表子集 <Emotion>/cells.jsonl 每个情绪对应的生成单元 scores.parquet 完整评分表(运行完成后添加) cells.jsonl 全部 8,000 个生成单元


评分表(scores.parquet)字段说明

字段 描述
gid, emotion, ei_head, prompt_idx, seed 组 ID、目标情绪、EI 头、提示索引、录制索引(匹配文件名中的 _v<take>
vocal_burst 脚本中命名的非言语爆发提示
wer, inv_wer, hyp 与脚本的词错误率(NVIDIA Parakeet-TDT-0.6b-v3 ASR 模型)、1/(1+WER)、ASR 转录结果
blend, genu VoiceCLAP-commercial 情感混合度和真实性 MLP 分数
prompt_sim VoiceCLAP 音频-文本余弦相似度(音频与样式指令)
ei_*(42 列) Empathic-Insight-Voice-Plus 分数:40 个情感维度 + ei_Arousalei_Valenceei_Authenticity
target 该组提示的目标情感的 EI-Plus 分数
rms_db, peak_db, dur 响度(dBFS)和持续时间(秒)
finished 生成是否以 EOS 结束(推荐过滤条件)

最佳选择(Best-of-N)建议

python import pandas as pd

df = pd.read_parquet("scores.parquet") n = lambda s: (s - s.min()) / (s.max() - s.min()) df["reward"] = (n(df["blend"]) + n(df["genu"]) + 1.25 * n(df["target"])) * df["inv_wer"] best3 = df[df.finished].sort_values("reward", ascending=False).groupby("gid").head(3)


生成细节

  • 模型:融合基础模型与 rank-256 LoRA 的 4.55B moss_tts_local 架构,12 码本 RVQ、MOSS-Audio-Tokenizer-v2 编解码器,原生 48 kHz。
  • 采样:温度 1.0,每批 64 条,bf16 + SDPA 注意力。
  • 令牌预算单词数 × 6.0 个码本帧(12.5 Hz),max_new_tokens = 2.2 × budget + 300
  • 评分:生成时融合 Parakeet ASR、VoiceCLAP 二元/真实性/提示相似度、Empathic-Insight-Voice-Plus 42 维向量、RMS/峰值响度。
  • 计算资源:8 × A100-80GB,每个音频片段端到端约 2.0 秒(生成+完整评分),约 36 小时墙钟时间。
  • 推理代码LAION-AI/laion-moss-local-1.5-voice-acting-4.55b

系列版本对比

版本 特点 数据地址
v2(255,746 片段) 单提示脚本,中等情感提示 laion/moss-local-voice-acting-64x100
v3(255,272 片段) 每组一个独有语音克隆参考(4,000 个说话人),双倍长度配对脚本 laion/moss-local-voice-acting-v3-refs-64x100
v4(当前) 最大强度投送类别提示,每种情绪 200 组 当前仓库
DramaBox 再诠释(188,125 片段) 2,953 个完整人类表演,每个表演 ×64 次再诠释,从原表演克隆 laion/moss-local-dramabox-full-reinterpretations-64

已知限制

  • 极端投送(尖叫、啜泣、含糊)会刻意牺牲部分清晰度以换取强度——可使用 wer/finished 过滤。
  • 脚本为戏剧独白,非对话式语音。
  • 所有评分为模型评分,非人工真实值。

样本预览

搜集汇总
数据集介绍
moss-local-voice-acting-v4-emorant-64x200 数据集图片
构建方式
本数据集由LAION团队基于MOSS-TTS本地Transformer语音表演模型(4.55B参数)生成,采用4.55B参数的基础模型与秩256的LoRA融合架构,结合MOSS-Audio-Tokenizer-v2编解码器,以48 kHz单声道FLAC格式输出。生成过程中未使用参考音频,模型仅依据普通人类说话者的人物描述自动为每组赋予独特声线。数据集包含40种情感类别,每类下设200个分组,每个分组生成64条语音片段,目标总量达512,000条。生成时采用温度1.0的采样策略,每批次并行处理64条语音,并融合了自动语音识别、情感混合度、真实度及共情洞察等多维度评分管道,整体计算耗时约36小时,使用了8块A100-80GB GPU。
特点
该数据集的核心特点在于其极富情感强度的语音表达。有别于前代版本对情感的温和引导,v4通过三轮演化提示研究重新设计了指令体系,引入六大递送类别(如愤怒、悲痛、喜悦等),每类对应独特的嗓音力学语言,并采用直白而具象的情感命名方式取代抽象描述。生成指令中嵌入了升级弧线(如“每行愈发狰狞”)及括号化声爆发提示(如抽泣、狂笑),在保持语音可懂度的前提下大幅提升情感表现力。每个分组采用全新脚本,所有文本均为小写英文,人物设定限于普通人类,确保了样本的多样性与自然度。
使用方法
本数据集可通过HuggingFace页面直接下载,数据以按情感类别打包的tar文件形式存储,每个文件约14 GB,内含FLAC音频及相应的评分表格(scores.parquet)。用户可基于评分表中包含的词错误率、情感混合度、真实度、提示相似度及共情洞察42维向量等指标进行最佳样本筛选,例如使用提供的最佳N选配方,通过标准化回报函数融合多项评分并按分组选取前三佳片段。建议优先使用生成结束标记为True的样本,以确保语音完整性。该数据适用于语音合成模型微调、情感语音分类任务、多情感语音分析等研究领域。
背景与挑战
背景概述
MOSS-Local Voice Acting v4 "emorant" 数据集由 LAION 团队于近期创建,旨在推动文本到语音(TTS)合成中情感表达的极致化研究。该数据集基于 4.55B 参数的 MOSS-TTS 局部变换器模型生成,通过无参考音频的零样本方式,从普通人描述中创造多样化语音。核心研究问题聚焦于如何通过系统化的情感提示策略(如递进式指令、非语言爆发提示)增强合成语音的情感强度与真实性,涵盖 40 种情感、200 组和 64 次重复,总计约 512,000 条 48kHz 单声道 FLAC 音频。该工作对情感语音合成、人机交互及多模态情感计算领域具有重要影响,为模型训练和评估提供了大规模、高情感强度的标注数据资源。
当前挑战
该数据集所解决的核心领域挑战在于合成语音中情感表达的自然性与强度平衡,尤其避免极端情感(如愤怒、悲伤)模糊可懂度,以及模型生成的情感类别与目标一致性问题。构建过程中面临多重挑战:首先,需设计递进式情感提示模板,通过递送类定义(如 RANT、DISTRESS)和生理性情感命名避免抽象化;其次,需在无参考音频条件下保持语音多样性,通过人物描述而非具体声音实现零样本克隆;最后,需集成实时评分管道(ASR 词错误率、VoiceCLAP 情感混合度、Empathic-Insight 多维度评分)以过滤低质量样本,同时处理高情感强度下必然的语音失真(如嘶吼、抽泣),并确保基于模型的评分信号而非人类标注作为筛选依据。
常用场景
经典使用场景
MOSS-Local Voice Acting v4 'emorant'数据集的核心价值在于其作为情感语音合成与分类研究的基准资源。该数据集收录了40种不同情感类别、每个情感由200组不同人物角色演绎、每组64个独立音频片段的海量合成语音,总计目标超过50万条48kHz高保真FLAC格式的语音素材。每一条音频均附有详尽的评分元数据,包括词错误率、情感混合度、真实性得分以及精细的42维情绪向量。这一设计使其成为训练和评估高表现力语音合成模型的首选数据集,尤其在无参考音频条件下生成极度逼真、情感饱满的语音任务中展现出独特优势。
解决学术问题
该数据集精准回应了情感语音合成领域长期面临的核心困境:如何在保持语音可懂度的前提下,系统性提升生成语音的情感强度与真实感。传统语音合成数据集往往情感标签单一、表达平淡,难以支撑对极端情感状态(如暴怒、绝望、狂喜)的建模需求。MOSS-Local v4通过创新的递进式情感提示策略,将每种情感映射至特定的发声行为类别(如RANT、DISTRESS、JOY),并融入生理性副语言线索(喘息、啜泣、狂笑),使模型学会生成情感层次丰富且物理感强烈的语音。这为研究情感强度与言语清晰度之间的权衡机制、多维度情感标注与预测、以及无参考情感语音的质量评估提供了宝贵的数据基础。
衍生相关工作
基于该数据集的技术路线已衍生出一系列具有影响力的相关工作。其前身v2和v3版本分别探索了单提示词与克隆语音参考条件下的情感表达,形成了情感语音合成的系列化研究脉络。同属MOSS工作室推出的DramaBox全演绎数据集(188,125条),则创新性地将真人戏剧表演片段交由模型以64种不同风格重新演绎,开辟了语音风格迁移与表演再合成的新方向。在评估层面,研究人员结合VoiceCLAP商业级语音情感评分器与Empathic-Insight-Voice-Plus精细情绪向量,构建了多维度的合成语音质量评估框架,推动了无标注情感强度量化方法的发展。此外,数据集发布的开源生成管线与最佳采样策略(best-of-N)已成为后续情感语音合成研究的重要参考基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务