遇见数据集

moss-local-voice-acting-v4-emorant-64x200-part2

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

MOSS-Local Voice Acting v4 emorant(第二部分/共四部分)是一个专注于生成高情感表现力语音的文本到语音(TTS)合成数据集。该数据集是更大规模语料库的一部分,旨在通过精心设计的提示语,推动语音表达超越中性朗读,达到极强的情感强度。数据内容包括合成语音音频及其丰富的元数据,本部分涵盖10种情感类别:满足、失望、厌恶、痛苦、怀疑、兴高采烈、尴尬、情感麻木、疲劳/筋疲力尽、恐惧。每种情感对应200组,每组包含64个不同的语音生成片段(takes),采用48 kHz单声道FLAC格式。整个四部分语料库的总体目标是生成512,000个音频片段。语音由合并的4.55B参数本地Transformer架构的MOSS-TTS语音表演模型生成,温度为1.0,直接使用原始模型输出,关键特征为“无参考音频”,即模型完全基于文本角色描述创造声音,而非模仿现有音频。数据生成过程经过特殊设计以最大化情感表达:每种情感映射到特定“表达类别”(如失控的咆哮、悲痛、喜悦、温柔等),并使用类别相关的声音机制描述词(如撕裂声、哽咽、抽泣、欢呼、耳语等)。提示语以具象化方式命名感受,构建情感升级叙事弧,在脚本中嵌入括号内非言语声音爆发提示,并通过结尾保护性指令确保语音可懂度。所有脚本均为全新的英文提示。数据集提供完整元数据,每个情感压缩包包含scores.parquet评分文件和cells.jsonl元数据文件。评分文件为每个take提供详细数据,包括组ID、目标情感、共情洞察力头部、提示索引、种子值、声音爆发提示;基于ASR的词错误率(WER)及其倒数、识别文本;VoiceCLAP商业模型的情感混合度、真诚度评分,以及音频与风格指令的文本余弦相似度;共情洞察力语音增强模型的40种情感维度分数、唤醒度、效价和真实性评分;音频响度、持续时间、生成是否正常结束标志;以及本组所提示目标情感的目标分数。数据集未经任何过滤,包含所有生成片段,允许用户根据自身需求(如结合情感评分、真诚度和可懂度)实施自定义的“最佳N选择”策略。适用于高表现力TTS模型的研究、训练与评估,情感语音生成分析,以及语音合成输出质量的选择与优化等任务。数据集采用Apache-2.0许可证,所有音频均为完全合成生成。

MOSS-Local Voice Acting v4 emorant (Part 2 of 4) is a text-to-speech (TTS) synthesis dataset focused on generating highly emotionally expressive speech. It is part of a larger corpus designed to push speech expression beyond neutral reading to achieve intense emotional intensity through carefully crafted prompts. The data consists of synthetic speech audio and rich metadata. This part includes 10 specific emotional categories: satisfaction, disappointment, disgust, pain, doubt, elation, embarrassment, emotional numbness, fatigue/exhaustion, fear. Each emotion corresponds to 200 groups, with each group containing 64 different speech generation takes, in 48 kHz mono FLAC format. The overall goal of the entire four-part corpus is to generate 512,000 audio segments. The speech is generated by a merged 4.55B parameter local Transformer architecture MOSS-TTS voice acting model at a temperature of 1.0, using raw model outputs directly. A key feature is no reference audio, meaning the model creates voices entirely based on textual character descriptions of a generic human speaker, rather than imitating existing audio. The data generation process is specially designed to maximize emotional expression: each emotion is mapped to a specific expression category (e.g., uncontrolled roar, grief, joy, tenderness) and uses category-related vocal mechanism descriptors (e.g., tearing, choking, sobbing, cheering, whispering). Prompts name feelings in a concrete manner, build emotional escalation narrative arcs, embed non-verbal vocal burst cues in parentheses within scripts, and ensure speech intelligibility through end-protective instructions. All scripts are new English prompts. The dataset provides complete metadata. Each emotion archive includes a scores.parquet scoring file and a cells.jsonl metadata file in addition to audio files. The scoring file provides a detailed row for each take, including: group ID, target emotion, used empathy insight head, prompt index, seed value, vocal burst cue; ASR-based word error rate (WER) and its reciprocal, recognized text; VoiceCLAP commercial models emotional blend, sincerity scores, and text cosine similarity between audio and style instructions; empathy insight voice enhancement models 40 emotional dimension scores, arousal, valence, and authenticity scores; audio loudness, duration, flag for normal generation completion; and target score for the prompted target emotion of the group. The dataset is unfiltered and includes all generated takes, allowing users to implement custom best N selection strategies based on their needs (e.g., combining emotion scores, sincerity, and intelligibility). It is suitable for research, training, and evaluation of highly expressive TTS models, emotional speech generation analysis, and selection and optimization of speech synthesis output quality. The dataset is licensed under Apache-2.0, and all audio is fully synthetic.

提供机构:
LAION eV
创建时间:
2026-07-16
原始信息汇总

数据集概述:MOSS-Local Voice Acting v4 "emorant" (part 2/4)

基本信息

  • 数据集名称:MOSS-Local Voice Acting v4 "emorant" (part 2/4)
  • 许可证:Apache-2.0
  • 任务类别:文本转语音(Text-to-Speech)
  • 语言:英语
  • 数据集大小:包含40种情绪 × 200组 × 64条录音(4部分总计目标512,000个音频片段)
  • 生成模型:基于合并的4.55B参数本地变换器MOSS-TTS语音表演模型,原生48kHz采样率,温度1.0,未经滤波的原始模型输出,无参考音频(模型根据普通人类说话者的人物描述自主创造声音)

数据集目的与设计

v4版本的核心目的是情感强度:指令来自于一项关于情感原型的提示研究,旨在将语音输出推向远超出中性朗读式语音的极端表达:

  • 每种情绪映射到一个表演类别(失控咆哮、痛苦、悲伤、喜悦、温柔、惊奇,或特殊类别如醉酒/戏弄/狂喜),并使用类别特定的语音机制语言(撕裂、破音、啜泣、高呼、低语等)
  • 情感以身体感受的方式命名,指令构建逐步升级的叙事弧(“每一行都更加恶毒”)
  • 脚本中嵌入语音爆发提示
  • 末尾使用保证语(“……但每个词依然清晰可辨”)维持可懂度

本部分包含的情绪(10种)

  • Contentment(满足)
  • Disappointment(失望)
  • Disgust(厌恶)
  • Distress(痛苦)
  • Doubt(怀疑)
  • Elation(兴高采烈)
  • Embarrassment(尴尬)
  • Emotional_Numbness(情感麻木)
  • Fatigue_Exhaustion(疲劳/筋疲力尽)
  • Fear(恐惧)

数据内容与格式

每个 data/<Emotion>.tar 压缩包包含:

  • 64条录音组:<Emotion>_<group>_v<take>.flac(48kHz单声道FLAC格式)
  • scores.parquet:评分文件,每行为一条录音
  • cells.jsonl:包含每组的确切文本、指令和生成元数据

scores.parquet 字段说明

字段 描述
gid, emotion, ei_head, prompt_idx, seed 组ID、目标情绪、使用的共情洞察头部、提示索引、录音索引
vocal_burst 指令中包含的非语言爆发提示
wer, inv_wer, hyp 与脚本的字错误率(使用Parakeet-TDT-0.6b-v3 ASR)、1/(1+WER)和ASR转录文本
blend, genu, prompt_sim VoiceCLAP-commercial情感混合评分、真实性评分、音频-文本与风格指令的余弦相似度
ei_*(42列) 共情洞察-语音-Plus评分:40个情感维度 + ei_Arousalei_Valence(以及 ei_Authenticity
rms_db, peak_db, dur, finished 响度、峰值、时长(秒),以及生成是否以EOS(而非令牌上限)结束
target 该组被提示的情感EI-Plus评分

无任何过滤:所有录音均包含在内,用户可自行应用自己的最优选择策略。

相关资源

许可证

Apache-2.0。所有音频均为完全合成生成(无参考集不包含任何真实说话者的声音)。

搜集汇总
数据集介绍
moss-local-voice-acting-v4-emorant-64x200-part2 数据集图片
构建方式
该数据集为MOSS-Local Voice Acting v4情感语音语料库的第二部分,基于4.55B参数的MOSS-TTS局部Transformer声学模型在48kHz采样率下生成,推理温度设为1.0,未使用任何参考音频。模型通过描述普通人类说话者的人物画像自主创造声音。语料构建围绕情感强度展开,每条指令均源自对情感原型提示研究的重写,将40种情感映射至不同的演绎类别,如失控咆哮、悲痛、狂喜等,并嵌入针对性的发声力学描述、情感升级弧线以及非语言爆发提示。脚本均为全新提示,采用小写人物描述与英文指令组合,确保与先前版本无重复。
特点
该语料库以极致情感表现为核心特征,通过两大维度确保数据质量:其一,每条指令内置具身化情感命名与递进式情感弧线,推动演绎远超中性朗读的边界;其二,所有音轨均保留原始模型输出,未经过滤,附带详尽评分表格,包含词错误率、情感混合分数、真实性评分、语音-文本余弦相似度以及40维情感洞察评分体系。特别地,数据集在追求情感饱和度的同时通过末尾质量护栏保证可懂度,研究者可在每组内实现自定义最佳选择策略。
使用方法
数据集以每个情感为一个独立的.tar压缩包形式组织,内包含64组音频片段(48kHz单声道FLAC格式),每组音频均附带scores.parquet评分表与cells.jsonl元数据文件。评分表为每条音轨提供完整生成元数据与客观评估指标,研究者可直接基于情感混合分数、真实性评分与逆词错误率构建归一化组合指标,实施每组内的最优N选择策略。此外,建议配合官方生成模型与推理代码库使用,并参考同系列v2无参考语料库及DramaBox全重释数据集作为对比资源。
背景与挑战
背景概述
MOSS-Local Voice Acting v4 "emorant" 数据集由LAION机构于近年发布,旨在推动文本到语音(TTS)生成领域中对情感表达的极致探索。该数据集基于一个合并的4.55B参数本地变换器MOSS-TTS语音表演模型,在无参考音频条件下,仅通过人物描述生成自然语音,重点研究如何通过指令工程使合成语音超越中性朗读,达到最大化情感强度。数据集包含40种情感、200组、每组64次录制,目标产出512,000条48kHz的语音片段,为情感语音合成领域提供了大规模、高质量的训练与评估资源,显著推动了非参考情感TTS的边界。
当前挑战
该数据集的核心挑战在于解决情感语音合成中“强度”与“可懂度”的平衡难题。具体而言,1)领域问题挑战:传统的TTS系统难以生成情感丰富的语音,而该数据集通过引入撕裂、哽咽、欢呼等特定发声分类和情感升级弧线指令,迫使模型产出极端的情绪表现,但需确保每个词仍能被准确识别(通过词错误率WER验证);2)构建过程挑战:数据生成完全依赖模型自创声音(无参考音频),需设计单次有效提示(避免复用旧版本脚本),并为每类情感定义内脏级别的体验名称和发声爆发提示,同时保持语调的多样性;此外,所有64次录制均被保留(无过滤),以支持后续的最优N选筛选策略,对评估指标(如情感混合评分、真实度、语义相似度)的全面性提出高要求。
常用场景
经典使用场景
在情感语音合成领域,MOSS-Local Voice Acting v4 'emorant' 数据集以其极致情感强度的设计脱颖而出。它专为训练和评估能够生成超越中性朗读式语音、蕴含强烈情感色彩的文本到语音(TTS)模型而构建。研究者通过利用该数据集中40种情感、每情感200组64次重复采样的丰富结构,可深入探索情感维度与声学特征之间的映射关系。该数据集的无参考音频特性,使其成为验证模型能否仅凭人格描述生成具有特定情感风格语音的理想平台,广泛应用于情感语音生成、多情感识别及语音风格迁移等经典研究任务。
衍生相关工作
该数据集衍生了一系列开创性工作,尤其推动了情感语音合成评估体系的革新。基于其提供的多维评分(如情感混合度、真实性、词错误率),研究者开发了结合客观音质与主观情感效果的混合选择策略,用于自动筛选最优语音生成样本。同时,该数据集的启发式指令结构激发了后续关于情感提示工程(Emotion Prompt Engineering)的研究,探索如何通过文本指令精确控制TTS模型的输出情感强度。此外,其与兄弟数据集MOSS-Local DramaBox Full Reinterpretations相结合,催生了面向戏剧化语音生成的多模态分析框架,为跨场景、跨文化的情感语音合成奠定了数据与方法基础。
数据集最近研究
最新研究方向
当前,情感语音合成的前沿研究正从单纯追求自然度转向对极端情感表达强度和表达多样性的深度探索。该数据集聚焦于“高烈度”情感表现,通过将情绪映射至歇斯底里、哭泣、大笑等特定发声类别,并嵌入声带撕裂、爆破音等非语言爆发标记,模拟真实交流中的情感递进弧线,从而突破传统中性朗读式合成的局限。研究热点集中于如何利用零参考音频模型自主生成具有个性化声纹的语音,同时借助ASR词错误率和VoiceCLAP情感评分等多维评估指标平衡可懂度与表现力。这一工作不仅推动了文本到语音系统在游戏、虚拟角色和辅助沟通等场景中的应用边界,也为探索情感计算中“真实感”与“夸张度”的量化权衡提供了关键数据支撑,在语音合成领域产生了深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务