遇见数据集

moss-local-voice-acting-v4-emorant-64x200-part3

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

MOSS-Local Voice Acting v4 emorant(第3部分/共4部分)是一个专注于极致情感表达的文本到语音(TTS)合成数据集。该数据集是更大规模语音表演语料库的组成部分,总目标是在4个部分中生成512,000个语音片段。本部分专门设计用于推动语音表达超越中性朗读,通过精心设计的提示指令生成高强度情感语音。数据内容包含10种具体的情感类别:无助、希望与乐观、不耐烦与烦躁、迷恋、兴趣、醉酒/ altered states、嫉妒与羡慕、渴望、恶意与怨恨、痛苦。每种情感对应一个数据文件包(.tar),其中包含多组语音样本,每组包含64个不同的尝试(即64种变体)。每个语音样本为48kHz采样率的单声道FLAC音频文件,文件名格式为<情感>_<组号>_v<尝试号>.flac。每个数据包还提供两个关键元数据文件:scores.parquet包含每个样本的详细评估指标,包括词错误率(用于可懂度验证)、多种情感评分(如VoiceCLAP商业情感混合分数、真实度分数)、Empathic-Insight-Voice-Plus的40个情感维度分数以及音频特征(响度、持续时间等);cells.jsonl则记录每个组的精确文本内容、生成指令和完整的生成元数据。数据集由合并的4.55B参数本地Transformer MOSS-TTS语音表演模型生成,采用温度1.0的原始输出,且无任何参考音频——模型仅基于对普通人类说话者的角色描述来创造声音。提示指令经过专门设计,将每种情感映射到特定的表达类别(如失控咆哮、痛苦、悲伤、喜悦、温柔等),并使用类别特定的声音机制描述词(如撕裂、破裂、抽泣等),同时嵌入括号内的非语言声音爆发提示,并通过结尾保护机制确保语音可懂度。所有生成样本均未经过滤,完整保留供用户根据自身需求进行选择。该数据集适用于情感语音合成、语音表现力建模、语音质量评估、多情感TTS系统训练等研究任务,特别适合需要高强度、多样化情感语音的研究场景。数据集采用Apache-2.0许可证,确认为完全合成内容,不包含任何真实说话者的声音复制。

提供机构:
LAION eV
创建时间:
2026-07-16
原始信息汇总

数据集概述:MOSS-Local Voice Acting v4 "emorant" (part 3/4)

基本信息

  • 数据集名称:MOSS-Local Voice Acting v4 "emorant" — maximally emotional deliveries, 64 takes per group (part 3/4)
  • 许可协议:Apache-2.0
  • 任务类别:文本转语音(text-to-speech)
  • 语言:英语
  • 数据集URL:https://huggingface.co/datasets/laion/moss-local-voice-acting-v4-emorant-64x200-part3

数据集规模与结构

  • 本部分为4部分语料库中的第3部分,整体目标生成512,000个音频片段。
  • 本部分包含:40种情绪 × 200组 × 64次录音
  • 生成模型:laion/moss-tts-local-transformer-4.55b-voice-acting(合并的4.55B参数本地变换器MOSS-TTS模型,原生48 kHz,温度1.0,无参考音频,模型根据普通人描述自主创造声音)。
  • 模型输出为原始输出,未经过滤。

目标与特点

  • v4版本专注于情感强度:指令基于情绪原型提示研究重写,推动语音远超中性朗读。
  • 每种情绪映射到一种表达类别(如失控咆哮、痛苦、悲伤、喜悦、温柔、惊奇,以及醉酒/戏弄/狂喜等特殊类别),并附带类别特定的声音机制语言(如撕裂、破裂、抽泣、欢呼、低语等)。
  • 情感命名直观,指令构建升级弧线(例如“每句更恶毒”)。
  • 脚本中嵌入非语言爆发提示
  • 结尾守卫“...但每个词仍清晰可懂”确保可懂度,每个录音可通过wer指标验证。

本部分包含的情绪

  • Helplessness(无助)
  • Hope_Optimism(希望与乐观)
  • Impatience_and_Irritability(不耐烦与易怒)
  • Infatuation(迷恋)
  • Interest(兴趣)
  • Intoxication_Altered_States(醉酒与意识改变状态)
  • Jealousy_Envy(嫉妒与羡慕)
  • Longing(渴望)
  • Malevolence_Malice(恶意与怨恨)
  • Pain(痛苦)

文件内容

  • 每个情绪对应一个data/<Emotion>.tar归档文件,包含64次录音组(文件名格式:<Emotion>_<group>_v<take>.flac,48 kHz单声道FLAC格式)。
  • 每个归档内还包含:
    • scores.parquet:存储每个录音的评估指标,主要列包括:
      • gidemotionei_headprompt_idxseed:组ID、目标情绪、Empathic-Insight头部、提示索引、录音索引。
      • vocal_burst:指令中包含的非语言爆发提示。
      • werinv_werhyp:词错误率(基于Parakeet-TDT-0.6b-v3 ASR)、1/(1+WER)和ASR转录文本。
      • blendgenuprompt_sim:VoiceCLAP商业情感混合分数、真实度分数、音频-文本余弦相似度(与风格指令)。
      • ei_*(42列):Empathic-Insight-Voice-Plus评分,包括40个情感维度及ei_Arousalei_Valenceei_Authenticity
      • rms_dbpeak_dbdurfinished:响度、峰值分贝、持续时间(秒)、生成是否以EOS结尾(非标记上限)。
      • target:该组被提示的情感EI-Plus分数。
    • cells.jsonl:每个组的精确文本、指令和生成元数据。

使用建议

  • 所有录音均包含在内,未经筛选,用户可自行应用最佳N选择策略(例如每组使用(norm(blend) + norm(genu)) * inv_wer)。

相关资源

  • 生成模型:https://huggingface.co/laion/moss-tts-local-transformer-4.55b-voice-acting
  • 推理代码与指南:https://github.com/LAION-AI/laion-moss-local-1.5-voice-acting-4.55b
  • 相关数据集:v2无参考语料库laion/moss-local-voice-acting-64x100-part1..4,以及完整DramaBox重新诠释数据集:https://huggingface.co/datasets/laion/moss-local-dramabox-full-reinterpretations-64
搜集汇总
数据集介绍
moss-local-voice-acting-v4-emorant-64x200-part3 数据集图片
构建方式
该数据集为MOSS-Local Voice Acting v4 'emorant'四部分语料库中的第三部分,旨在通过最大化情感强度生成高质量语音数据。构建过程中,采用融合了4.55B参数的本地Transformer MOSS-TTS语音表演模型,在原生48kHz采样率、温度参数为1.0的条件下生成,且不使用参考音频,模型仅根据普通人类说话者的人物描述自主创造声音。每个情感类别被映射至特定的表演风格类(如失控咆哮、痛苦、悲伤、喜悦等),并配以独特的语音机制描述(如撕裂、哽咽、欢呼、低语等),指令中嵌入非语言爆发提示,同时通过闭合保护语句确保可懂度。脚本均为全新提示,未在先前版本中使用,采用小写人物描述加指令的格式,生成来自40种情感×200组×64次表演的目标512,000个音频片段。
特点
该数据集的核心特点在于其对情感强度的极致追求,通过从情感原型提示研究中重写的指令,将语音表演推向远超中性朗读的界限。每个情感类别不仅被赋予一种表演风格类,还以直觉化的方式命名感受,并构建了逐渐升级的情绪弧线(如‘每一行都更加恶毒’)。非语言爆发提示嵌入脚本中,增强了表演的自然性与表现力。数据集中包含未经过滤的所有表演片段,每个片段均附带详细的元数据,包括词错误率(WER)、VoiceCLAP情感混合分数、真实感评分、以及40维情感维度的Empathic-Insight评分等,为研究者提供了丰富的选择与评估依据。此外,情感范围涵盖无助、希望、焦躁、迷恋、嫉妒、恶意等多种复杂情绪,全面覆盖人类情感频谱。
使用方法
数据集以压缩包形式组织,每个情感类别对应一个.tar文件,内含64次表演的FLAC音频文件及scores.parquet和cells.jsonl元数据文件。使用时可加载scores.parquet表格,其中每行代表一次表演,包含组ID、情感目标、提示索引、种子值、WER、混合分数、真实感分数、40维EI评分及响度、时长等信息。研究者可基于这些评分实施自定义的最佳N次选择策略,例如结合情感混合分数、真实感分数与逆WER对每组表演进行排序筛选。此外,数据集采用Apache-2.0许可,所有音频均为完全合成,不涉及真实说话者声音,适合用于情感语音合成模型训练、评估及语音表演风格研究等多种应用场景。
背景与挑战
背景概述
MOSS-Local Voice Acting v4 "emorant" (part 3/4) 是LAION团队于2024年发布的大规模、高情感强度的文本转语音(TTS)数据集,由4.55B参数的MOSS-TTS本地变换器模型在无参考音频条件下以48 kHz采样率生成,旨在突破传统中性阅读式语音合成的边界。该数据集隶属于MOSS系列,核心研究问题在于通过精细化的情感指令设计(如撕裂、哽咽、嘶吼等声音力学语言)和递进式情绪弧线构建,推动语音生成模型产生极致且高度可理解的情感表达。作为四部分语料库的第三部分,它包含40种情感、200个组别、每组64次采集,总计约512,000个语音片段,为情感语音合成领域提供了前所未有的规模与强度资源。该数据集的影响力体现在其作为无参考情感语音生成基准的潜力,以及通过附带44维声学-情感元数据(包括VoiceCLAP情感混合分数、Empathic-Insight-Voice-Plus维度评分和词错误率)支持下游最佳N选筛选与精细分析的能力。
当前挑战
该数据集面临的核心领域挑战在于解决无参考条件下情感语音合成的真实性与强度平衡问题:传统TTS系统依赖参考音频复制说话者特征,而v4要求模型仅从人物描述和情感指令中自发创造声音,这使得生成结果可能偏离预期情感基调或引入非真实听觉伪影。具体构建挑战包括:1)情感映射的复杂性——将40种情感映射至7种递送类别(如失控咆哮、痛楚、狂喜)需精确设计指令语言以避免语义模糊,且每个情感组内需维持一致的情感递进逻辑;2)数据质量监控的困难——尽管通过嵌入发声爆发提示和可理解性守卫机制(“每个词依然清晰落地”)保证语音清晰度,但64次采集全部保留无过滤,导致部分生成样本可能因温度参数过高(1.0)而产生嘶哑、爆破等异常音频,需依赖用户自定义筛选逻辑(如结合情感混合分数与逆词错误率)进行后处理;3)元数据维度的整合挑战——44维情感评分与声学特征需在无真实标签条件下通过模型推断获取,其准确性受限于情感识别模型的泛化能力,可能引入系统性偏差影响下游分析结论的可靠性。
常用场景
经典使用场景
该数据集专为文本到语音(TTS)领域中的情感语音合成研究而设计,其核心应用场景在于探索如何从文本指令中生成高度细腻、富有强度且自然真实的情感化语音。通过提供40种情感类别、每类200组、每组64条共约51.2万条48kHz高质量语音片段,研究者得以在无参考音频的条件下,仅凭人物描述和情感指令驱动模型生成多样化情感表达。这种大规模、细粒度的情感采样策略,使得该数据集成为训练和评估情感TTS模型、分析语音中情感维度的理想资源。
解决学术问题
该数据集主要解决了情感语音合成领域中长期存在的两大瓶颈:其一,传统朗读式语音数据缺乏真实情感强度,难以模拟人类在极端情绪下的发声特征;其二,情感表达往往局限于少数基本类别,缺乏对复杂、混合或渐进化情感的建模能力。通过引入基于情感原型研究的递进式指令设计(如撕裂、哽咽、欢呼等发声机制),并辅以视觉化的情感弧线构建,该数据集突破了单一情感标签的限制,推动了情感语音在细腻度、真实性与可控性方面的学术探索,显著提升了合成语音的情感可信度与表现力。
衍生相关工作
该数据集的发布催生了一系列衍生研究工作,其中最具代表性的是其配套生成模型——基于4.55B参数融合的MOSS-TTS局部Transformer架构,以及开源推理代码库。数据集的非过滤采样特性促使研究者开发了多种多目标优化选优策略(如结合情感混合度、真实度与逆词错误率的加权排序),推动了无参考语音合成中的最佳样本自动筛选方法。此外,与之同源的DramaBox完整重诠释数据集和先前的情感语音属性参考片段集,共同构成了一个层次化的情感TTS研究生态,为后续探索语音情感属性解耦、情感迁移学习及跨文化情感表达等方向奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务