遇见数据集

moss-local-voice-acting-v4-emorant-64x200-part4

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

MOSS-Local Voice Acting v4 "emorant"(第四部分/共四部分)是一个专注于高情感强度的语音合成数据集,属于四部分语料库的最终部分,旨在生成超越中性朗读的、充满情感表现力的语音样本。数据使用4.55B参数本地Transformer MOSS-TTS语音表演模型生成,采样率为48kHz,不依赖参考音频,仅基于人物描述创造声音。v4版本通过重写提示指令,将情感映射到特定表达类别(如咆哮、痛苦、喜悦等),并嵌入声音爆发提示,以增强情感强度。数据集包含10种情感:愉悦_狂喜、自豪、解脱、悲伤、性欲_渴望、羞耻、酸楚、戏弄、感谢_感激、胜利。每种情感对应一个.tar文件,内含64个48kHz单声道FLAC格式录音、scores.parquet文件(提供组ID、情感、分数等元数据)和cells.jsonl文件(包含文本、指令和生成元数据)。数据集未经过滤,适用于文本到语音合成、情感语音生成、语音表现力分析和语音情感计算等研究任务。

MOSS-Local Voice Acting v4 "emorant" (Part 4 of 4) is a speech synthesis dataset focused on high emotional intensity, serving as the final part of a four-part corpus. It aims to generate emotionally expressive speech samples beyond neutral reading. The data is generated using a merged 4.55B parameter local Transformer MOSS-TTS voice acting model at a 48kHz sample rate, relying solely on character descriptions of ordinary human speakers without any reference audio. The core goal of v4 is emotional intensity: prompts have been rewritten based on research into emotional archetypes to push vocal expression to extremes. Strategies include mapping each emotion to specific expression categories (e.g., uncontrolled roaring, pain, sadness, joy, tenderness, surprise, and special categories for intoxication/teasing/ecstasy) with category-specific vocal mechanism descriptions (e.g., tearing, cracking, sobbing, cheering, whispering); emotion names are intuitive and intense, with instructions building escalating emotional arcs; scripts embed vocal burst cues in brackets; and safeguards are included to maintain intelligibility. The dataset includes 10 emotions: joy_ecstasy, pride, relief, sadness, lust_longing, shame, bitterness, teasing, gratitude_thanks, triumph. Data organization: each emotion corresponds to a .tar file containing 64 recordings (48kHz mono FLAC), a scores.parquet file, and a cells.jsonl file (with exact text, instructions, and generation metadata for each group). The scores.parquet file provides detailed per-recording data, including group ID, target emotion, Empathic-Insight head used, prompt index, seed, vocal burst cues, word error rate with ASR transcript, VoiceCLAP commercial emotion blend score, authenticity score, audio-text style instruction cosine similarity, 42 Empathic-Insight-Voice-Plus emotional dimension scores (including arousal and valence), loudness, duration, generation completion flag, and EI-Plus score for the groups prompt target emotion. The dataset is unfiltered, containing all generated recordings, allowing users to perform best-N selection based on custom criteria (e.g., combining normalized emotion blend scores, authenticity scores, and inverse word error rate). It is suitable for text-to-speech synthesis, emotional speech generation, speech expressiveness analysis, and speech emotion computing research tasks.

提供机构:
LAION eV
创建时间:
2026-07-16
原始信息汇总

数据集概述:MOSS-Local Voice Acting v4 "emorant" (part 4/4)

名称: MOSS-Local Voice Acting v4 "emorant" — maximally emotional deliveries, 64 takes per group (part 4/4)

许可证: Apache-2.0

任务类别: 文本转语音 (text-to-speech)

语言: 英语

数据集用途与特点

该数据集是四部分语料库的第4部分,包含40种情绪 × 200组 × 64次录制(四部分合计目标为512,000个音频片段)。使用合并后的4.55B参数本地Transformer MOSS-TTS语音表演模型生成,原生48 kHz采样率,温度参数1.0,为原始模型输出,无参考音频(模型根据普通人说话者的人物描述自行发明声音)。

v4版本的目标是强度:从情绪原型提示研究中重新编写指令,推动输出远超中性朗读语音的表现力。

  • 每种情绪映射到一种表演类别(如失控咆哮、痛苦、悲伤、喜悦、温柔、惊奇,以及醉酒/戏弄/狂喜的特殊类别),并附带该类别的特定语音机制语言(如撕裂、破裂、啜泣、呼喊、低语……)
  • 情感名称采用发自内心的方式命名,指令构建一个升级弧线("每句话都更加恶毒")
  • 脚本中嵌入括号标注的发声爆发提示
  • 结尾的防护指令("……但每个词仍然清晰")保持可理解性,可通过 wer 验证每次录制

脚本是全新的单一提示(从未在v2/v3中使用过),格式为小写人物描述 + 指令,均为英语。

本部分包含的情绪

  • Pleasure_Ecstasy
  • Pride
  • Relief
  • Sadness
  • Sexual_Lust
  • Shame
  • Sourness
  • Teasing
  • Thankfulness_Gratitude
  • Triumph

数据内容格式

每个 data/<Emotion>.tar 压缩包包含一种情绪的64次录制组(<Emotion>_<group>_v<take>.flac,48 kHz单声道FLAC格式),以及 scores.parquetcells.jsonl(包含每组的确切文本、指令和生成元数据)。

scores.parquet 文件每行对应一次录制,包含以下列:

列名 描述
gid, emotion, ei_head, prompt_idx, seed 组ID、目标情绪、用作目标的移情洞察头部、提示索引、录制索引
vocal_burst 指令中包含的非语言爆发提示
wer, inv_wer, hyp 与脚本相比的词错误率(Parakeet-TDT-0.6b-v3 ASR)、1/(1+WER)、ASR转录文本
blend, genu, prompt_sim VoiceCLAP-商业情绪融合分数、真实度分数、音频-文本与风格指令的余弦相似度
ei_* (42列) 移情洞察-语音-Plus分数:40个情绪维度 + ei_Arousalei_Valence(以及 ei_Authenticity
rms_db, peak_db, dur, finished 响度、峰值电平、时长(秒)、生成是否以EOS结束(而非达到token上限)
target 该组所提示情绪的EI-Plus分数

数据集未经过滤:所有录制均包含在内,用户可根据需要自行应用最佳N选择(例如每组使用 (norm(blend) + norm(genu)) * inv_wer)。

相关资源

搜集汇总
数据集介绍
moss-local-voice-acting-v4-emorant-64x200-part4 数据集图片
构建方式
该数据集是MOSS-Local Voice Acting v4语料库的第四部分,由融合了4.55B参数的本地变换器MOSS-TTS语音表演模型在48kHz原生采样率下生成。模型无需参考音频,仅凭对普通人类说话者的人物描述即自主创造声音。数据集的构建遵循严格的强度导向原则:每种情感被映射至特定的表演类别,如失控咆哮、悲痛或狂喜,并配以专属的嗓音力学描述(如撕裂、哽咽、呼喊)。脚本中嵌入了非语言爆发提示,并设计了情感升级弧线,同时通过末尾的清晰度保障语句确保可懂度。最终生成40种情感×200组×64次演绎的架构,目标产出512,000个音频片段。
特点
该数据集的核心特色在于其极致的表现力强度与无参考生成机制。每个情感类别均被赋予独特的表演指令,推动发音远超中性朗读的范畴,涵盖从痛苦、愉悦到戏弄、狂喜的广泛情绪光谱。数据集完整保留了所有64次演绎,不进行任何筛选,允许用户根据自定义标准(如情感混合度、真实感与词错误率加权组合)进行最佳选择。附带详尽的评分文件(scores.parquet),包含词错误率、情感混合分数、真实性评分及42维共情洞察情感分数等元数据,便于用户进行多维度的语音质量与情感一致性分析。
使用方法
研究者可通过HuggingFace目录直接下载每个情感对应的压缩包(data/<Emotion>.tar),解压后获得48kHz单声道FLAC音频文件及配套的scores.parquet和cells.jsonl元数据。使用时,建议基于每组内的64次演绎执行最优选取策略,例如通过归一化情感混合度与真实性评分的乘积再乘以逆词错误率来筛选高质量样本。此外,数据集与生成模型(laion/moss-tts-local-transformer-4.55b-voice-acting)及推理代码仓库搭配使用,可进一步定制情感语音合成实验,或与其他版本的语料库(如v2、DramaBox)进行跨模态对比研究。
背景与挑战
背景概述
MOSS-Local Voice Acting v4 'emorant'(第4部分)是由LAION研究机构于近期发布的文本到语音(TTS)合成数据集,由4.55B参数规模的MOSS-TTS本地Transformer模型在无参考音频条件下生成,旨在探索情感语音表达的极限强度。该数据集以40种情感类别、每组200个脚本片段、每片段64次演绎的庞大规模(四部分合计目标51.2万条语音片段),为情感语音合成领域提供了前所未有的细腻标注资源。每个语音片段均附带词错误率、VoiceCLAP情感混合分数、共情洞察语音评分等42维精细度量指标,使得研究者能够基于多维度客观评估进行最优选择。该数据集的影响力在于突破了传统TTS数据集依赖中性朗读或有限情感标签的局限,为构建高度真实、丰富多变的情感语音生成模型奠定了数据基础。
当前挑战
本数据集的核心挑战在于解决语音合成中情感表达的强度与多样性问题。传统TTS系统通常生成中性或轻度情感语音,难以模拟人类在极端情绪下的声带撕裂、啜泣、呐喊等非语言化声音特征,而本数据集通过重构提示指令,引入情感原型递进策略与非语言爆发提示,实现了对歇斯底里、悲痛、狂喜等高强度情感状态的精确捕捉。在构建过程中,挑战体现在模型需在无需参考音频情况下,仅凭人物描述文本自主生成逼真的虚拟嗓音,同时确保语音清晰度可通过词错误率验证。此外,数据集采用原始模型输出不经筛选的策略,保留了各类失败与次优样例,为基于贝叶斯最优化的后处理选择研究提供了完整的噪声基底与性能边界参考。
常用场景
经典使用场景
在语音合成与情感计算交叉领域,该数据集作为大规模、高强度的情感语音生成语料库,为多情感维度的文本到语音(TTS)研究提供了基础资源。其经典用途在于训练和评估能够产出极端情感表达(如狂怒、悲伤、狂喜等)的语音合成模型,而非传统的中性朗读语音。研究者可利用其‘40种情感×200组×64次采样’的结构,探索情感强度与语音声学特征之间的非线性映射关系,推动从脚本到语音的细粒度情感控制技术发展。
衍生相关工作
围绕该数据集已衍生出多项经典工作。核心生成模型为LAION团队发布的moss-tts-local-transformer-4.55b-voice-acting,这是一款4.55B参数的局部变换器架构,能够在无参考音频条件下独立创造语音个性。基于该模型的推理代码库(laion-moss-local-1.5-voice-acting-4.55b)被广泛用于复现与改进极端情感合成。此外,同系列的v2无参考语料库与DramaBox完整重释版本(64次采样)进一步扩展了数据集的覆盖面,成为探索零样本情感语音迁移、情感混合识别与语音动力学分析的重要平台,推动了多模态情感智能的前沿进展。
数据集最近研究
最新研究方向
当前语音合成领域的前沿探索正从单一的文本到语音转换迈向情感表达的极致精细化与真实性。moss-local-voice-acting-v4-emorant-64x200-part4数据集聚焦于最大化情感强度,通过将40种情感映射至崩溃哭诉、狂喜嘶吼等独特演绎类别,并内嵌声乐爆发提示与升级弧线指令,突破了中性朗读的边界。该研究尤其关注非参考音频下的情感可理解性,利用词错误率(WER)与VoiceCLAP情感混合评分等客观指标,为合成语音中微妙情绪层次的量化评估提供了新范式。此数据集与MOSS-TTS生成模型协同,标志着从可控情感合成向情感真实感评鉴体系的重大跃迁,对虚拟角色互动、辅助情感表达等热点应用产生深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务