moss-local-voice-acting-v4-emorant-64x200-part3
收藏资源简介:
MOSS-Local Voice Acting v4 emorant(第3部分/共4部分)是一个专注于极致情感表达的文本到语音(TTS)合成数据集。该数据集是更大规模语音表演语料库的组成部分,总目标是在4个部分中生成512,000个语音片段。本部分专门设计用于推动语音表达超越中性朗读,通过精心设计的提示指令生成高强度情感语音。数据内容包含10种具体的情感类别:无助、希望与乐观、不耐烦与烦躁、迷恋、兴趣、醉酒/ altered states、嫉妒与羡慕、渴望、恶意与怨恨、痛苦。每种情感对应一个数据文件包(.tar),其中包含多组语音样本,每组包含64个不同的尝试(即64种变体)。每个语音样本为48kHz采样率的单声道FLAC音频文件,文件名格式为<情感>_<组号>_v<尝试号>.flac。每个数据包还提供两个关键元数据文件:scores.parquet包含每个样本的详细评估指标,包括词错误率(用于可懂度验证)、多种情感评分(如VoiceCLAP商业情感混合分数、真实度分数)、Empathic-Insight-Voice-Plus的40个情感维度分数以及音频特征(响度、持续时间等);cells.jsonl则记录每个组的精确文本内容、生成指令和完整的生成元数据。数据集由合并的4.55B参数本地Transformer MOSS-TTS语音表演模型生成,采用温度1.0的原始输出,且无任何参考音频——模型仅基于对普通人类说话者的角色描述来创造声音。提示指令经过专门设计,将每种情感映射到特定的表达类别(如失控咆哮、痛苦、悲伤、喜悦、温柔等),并使用类别特定的声音机制描述词(如撕裂、破裂、抽泣等),同时嵌入括号内的非语言声音爆发提示,并通过结尾保护机制确保语音可懂度。所有生成样本均未经过滤,完整保留供用户根据自身需求进行选择。该数据集适用于情感语音合成、语音表现力建模、语音质量评估、多情感TTS系统训练等研究任务,特别适合需要高强度、多样化情感语音的研究场景。数据集采用Apache-2.0许可证,确认为完全合成内容,不包含任何真实说话者的声音复制。
数据集概述:MOSS-Local Voice Acting v4 "emorant" (part 3/4)
基本信息
- 数据集名称:MOSS-Local Voice Acting v4 "emorant" — maximally emotional deliveries, 64 takes per group (part 3/4)
- 许可协议:Apache-2.0
- 任务类别:文本转语音(text-to-speech)
- 语言:英语
- 数据集URL:https://huggingface.co/datasets/laion/moss-local-voice-acting-v4-emorant-64x200-part3
数据集规模与结构
- 本部分为4部分语料库中的第3部分,整体目标生成512,000个音频片段。
- 本部分包含:40种情绪 × 200组 × 64次录音。
- 生成模型:
laion/moss-tts-local-transformer-4.55b-voice-acting(合并的4.55B参数本地变换器MOSS-TTS模型,原生48 kHz,温度1.0,无参考音频,模型根据普通人描述自主创造声音)。 - 模型输出为原始输出,未经过滤。
目标与特点
- v4版本专注于情感强度:指令基于情绪原型提示研究重写,推动语音远超中性朗读。
- 每种情绪映射到一种表达类别(如失控咆哮、痛苦、悲伤、喜悦、温柔、惊奇,以及醉酒/戏弄/狂喜等特殊类别),并附带类别特定的声音机制语言(如撕裂、破裂、抽泣、欢呼、低语等)。
- 情感命名直观,指令构建升级弧线(例如“每句更恶毒”)。
- 脚本中嵌入非语言爆发提示。
- 结尾守卫“...但每个词仍清晰可懂”确保可懂度,每个录音可通过
wer指标验证。
本部分包含的情绪
- Helplessness(无助)
- Hope_Optimism(希望与乐观)
- Impatience_and_Irritability(不耐烦与易怒)
- Infatuation(迷恋)
- Interest(兴趣)
- Intoxication_Altered_States(醉酒与意识改变状态)
- Jealousy_Envy(嫉妒与羡慕)
- Longing(渴望)
- Malevolence_Malice(恶意与怨恨)
- Pain(痛苦)
文件内容
- 每个情绪对应一个
data/<Emotion>.tar归档文件,包含64次录音组(文件名格式:<Emotion>_<group>_v<take>.flac,48 kHz单声道FLAC格式)。 - 每个归档内还包含:
- scores.parquet:存储每个录音的评估指标,主要列包括:
gid、emotion、ei_head、prompt_idx、seed:组ID、目标情绪、Empathic-Insight头部、提示索引、录音索引。vocal_burst:指令中包含的非语言爆发提示。wer、inv_wer、hyp:词错误率(基于Parakeet-TDT-0.6b-v3 ASR)、1/(1+WER)和ASR转录文本。blend、genu、prompt_sim:VoiceCLAP商业情感混合分数、真实度分数、音频-文本余弦相似度(与风格指令)。ei_*(42列):Empathic-Insight-Voice-Plus评分,包括40个情感维度及ei_Arousal、ei_Valence、ei_Authenticity。rms_db、peak_db、dur、finished:响度、峰值分贝、持续时间(秒)、生成是否以EOS结尾(非标记上限)。target:该组被提示的情感EI-Plus分数。
- cells.jsonl:每个组的精确文本、指令和生成元数据。
- scores.parquet:存储每个录音的评估指标,主要列包括:
使用建议
- 所有录音均包含在内,未经筛选,用户可自行应用最佳N选择策略(例如每组使用
(norm(blend) + norm(genu)) * inv_wer)。
相关资源
- 生成模型:https://huggingface.co/laion/moss-tts-local-transformer-4.55b-voice-acting
- 推理代码与指南:https://github.com/LAION-AI/laion-moss-local-1.5-voice-acting-4.55b
- 相关数据集:v2无参考语料库
laion/moss-local-voice-acting-64x100-part1..4,以及完整DramaBox重新诠释数据集:https://huggingface.co/datasets/laion/moss-local-dramabox-full-reinterpretations-64




