遇见数据集

moss-local-voice-acting-v4-emorant-64x200-part1

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

MOSS-Local Voice Acting v4 "emorant"(第1部分/共4部分)是一个专注于最大化情感表达的语音合成数据集。该数据集使用合并后的4.55B本地变换器MOSS-TTS语音表演模型生成,采样率为48kHz,温度参数为1.0,采用原始模型输出,且无参考音频(模型根据普通人类说话者的人物描述创造声音)。数据集通过改写提示指令,基于情感原型研究,将语音表达推向远超中性朗读的水平。每个情感被映射到特定的表达类别(如无约束的咆哮、痛苦、悲伤、喜悦、温柔、惊奇等),并包含类别特定的声音机制描述(如撕裂声、破音、啜泣、欢呼、低语等)。提示采用感性描述语言,构建情感升级弧线,并在脚本中嵌入括号内的声音爆发提示,同时通过结尾保护机制保持可理解性。本部分数据集包含10种情感类型:喜爱、娱乐、愤怒、惊讶/惊奇、敬畏、苦涩、专注、困惑、沉思、轻蔑。每个情感对应一个.tar压缩文件,包含64个版本的音频组(FLAC格式)以及scores.parquet和cells.jsonl元数据文件。scores.parquet为每个音频版本提供详细评分数据,包括词错误率、情感混合分数、真实性分数、42维共情洞察语音评分以及音频特征(响度、时长、生成完成状态)等。数据集包含所有生成版本,未经过滤,用户可应用自定义的最佳选择策略。该数据集适用于文本到语音合成、情感语音生成、语音情感分析等任务,特别适合需要高情感表现力的语音合成研究。

MOSS-Local Voice Acting v4 "emorant" (Part 1 of 4) is a speech synthesis dataset focused on maximizing emotional expression. It is generated using a merged 4.55B local transformer MOSS-TTS voice acting model, with a sampling rate of 48kHz, a temperature parameter of 1.0, using raw model output, and no reference audio (the model creates voices based on character descriptions of ordinary human speakers). The dataset aims to achieve maximum intensity in emotional expression: by rewriting prompt instructions, based on emotional prototype research, it pushes speech expression far beyond neutral reading levels. Each emotion is mapped to specific expression categories (such as unrestrained roar, pain, sadness, joy, tenderness, surprise, etc.) and includes category-specific vocal mechanism descriptions (e.g., tearing sounds, vocal breaks, sobbing, cheering, whispering, etc.). The prompts use emotional descriptive language, construct emotional escalation arcs, and embed voice burst cues in parentheses within the script, while maintaining intelligibility through end protection mechanisms. This part of the dataset includes 10 emotion types: affection, amusement, anger, surprise/astonishment, awe, bitterness, concentration, confusion, contemplation, contempt. Each emotion corresponds to a .tar compressed file containing 64 versions of audio groups (in FLAC format) and metadata files scores.parquet and cells.jsonl. scores.parquet provides detailed scoring data for each audio version, including word error rate, emotional blend score, authenticity score, 42-dimensional empathetic voice insights score, and audio features (loudness, duration, generation completion status), etc. The dataset includes all generated versions, unfiltered, allowing users to apply custom best-selection strategies. It is suitable for text-to-speech synthesis, emotional speech generation, speech emotion analysis, and other tasks, particularly for speech synthesis research requiring high emotional expressiveness.

提供机构:
LAION eV
创建时间:
2026-07-16
原始信息汇总

数据集概述:MOSS-Local Voice Acting v4 "emorant" (part 1/4)

  • 数据集名称: MOSS-Local Voice Acting v4 "emorant" (part 1/4)
  • 许可证: Apache-2.0
  • 任务类别: 文本转语音(Text-to-Speech)
  • 语言: 英语
  • 数据集规模: 这是4部分语料库的第1部分,包含 40种情绪 × 200个组 × 64个录音,目标是在4个部分中生成512,000个音频片段。
  • 生成模型: 使用合并的4.55B参数本地Transformer MOSS-TTS语音表演模型,以原生48 kHz采样率、温度1.0生成,无参考音频(模型根据普通人说话者的人物描述创造声音)。
  • 核心特点: 强调情感强度。指令基于情感原型提示研究重新编写,推动表达远超中性朗读语音:
    • 每种情绪映射到一个表达类别(如失控咆哮、痛苦、悲伤、喜悦、温柔、惊奇,以及醉酒/挑逗/狂喜等特殊类别),并附带类别特定的语音机制语言(如撕裂、破音、啜泣、欢呼、低语...)。
    • 情感被具象化命名,指令构建升级弧线(例如"每句台词更加恶毒")。
    • 脚本中嵌入了括号内的声音爆发提示
    • 结尾有保护性指令("...但每个词仍然清晰可辨"),可通过wer(词错误率)验证可懂度。
  • 脚本: 均为全新的单一提示(从未在v2/v3中使用过),格式为小写人物描述 + 指令,使用英语。

本部分包含的情绪

  • Affection(喜爱)
  • Amusement(娱乐)
  • Anger(愤怒)
  • Astonishment_Surprise(惊讶)
  • Awe(敬畏)
  • Bitterness(苦涩)
  • Concentration(专注)
  • Confusion(困惑)
  • Contemplation(沉思)
  • Contempt(轻蔑)

数据集内容

每个 data/<Emotion>.tar 文件包含一个情绪的64个录音组(文件格式为 <Emotion>_<group>_v<take>.flac,48 kHz单声道FLAC),以及 scores.parquetcells.jsonl(包含每组的精确文本、指令和生成元数据)。

scores.parquet 包含每一项录音的详细指标,主要列如下:

列名 描述
gid, emotion, ei_head, prompt_idx, seed 组ID、目标情绪、用作目标的Empathic-Insight头部、提示索引、录音索引
vocal_burst 指令中包含的非语言爆发提示
wer, inv_wer, hyp 与脚本的词错误率(Parakeet-TDT-0.6b-v3 ASR识别)、1/(1+WER) 和ASR转录文本
blend, genu, prompt_sim VoiceCLAP-commercial情绪混合分数、真实度分数、音频-文本与风格指令的余弦相似度
ei_*(42列) Empathic-Insight-Voice-Plus分数:40个情绪维度 + ei_Arousal(唤醒度)、ei_Valence(效价)和 ei_Authenticity(真实度)
rms_db, peak_db, dur, finished 响度(dB)、峰值(dB)、持续时间(秒)、以及生成是否以EOS(而非token上限)结束
target 为该组提示的情绪的EI-Plus分数

所有录音都包含在内,未经过滤,用户可以根据自己的最佳N选策略(例如,按组计算 (norm(blend) + norm(genu)) * inv_wer)进行筛选。

相关资源

许可证和来源说明

  • 许可证: Apache-2.0
  • 音频均为全合成生成(无参考集不包含真实说话人的声音;v3的参考片段来自公开的 TTS-AGI/Emotion-Voice-Attribute-Reference-Snippets-DACVAE-Wave 数据集)
搜集汇总
数据集介绍
moss-local-voice-acting-v4-emorant-64x200-part1 数据集图片
构建方式
该数据集为MOSS-Local Voice Acting v4 'emorant'系列的首个组成部分,旨在通过最大化情感强度推动文本到语音生成的前沿。基于一个合并的4.55B参数本地变换器MOSS-TTS语音表演模型,在原生48kHz采样率、温度1.0且无需参考音频的条件下,模型仅依据普通人类说话者的人物描述自主创造语音。构建过程从情感原型提示研究中重构指令,将每种情感映射至特定的表演类别(如失控咆哮、痛苦、喜悦等),并嵌入类别的语音力学描述(如撕裂、哽咽、欢呼声)及非语言爆发提示,同时设计逐行升级的情感弧线,最终通过闭合守卫确保可理解性。每个情感组包含64个独立演绎片段,未作任何过滤。
特点
数据集以情感强度的极致表现为核心特色,覆盖40种情感类别,每类包含200个分组,每组生成64个独立录制片段(本部分涵盖前10种情感,如喜爱、愤怒、敬畏等)。所有音频均为合成语音,不涉及真实说话人声音,确保隐私与可扩展性。数据集中每一条目标注了详尽的元数据,包括词错误率(WER)、情感混合分数、真实度分数、音频-文本余弦相似度,以及通过Empathic-Insight-Voice-Plus模型计算的42维情感维度评分(如唤醒度、效价),同时包含响度、时长等声学特征,为研究者提供多层次筛选依据。
使用方法
用户可通过下载相应情感类别的tar压缩包获取64个FLAC音频文件及配套的scores.parquet和cells.jsonl元数据文件。scores.parquet中每一行对应一个片段,包含组ID、情感标签、种子、WER、ASR转录、VoiceCLAP情感混合分数、真实度分数、情感维度评分等字段。由于所有片段均被保留且未过滤,研究者可自行实施最佳N选策略(如基于归一化情感混合与真实度乘积再乘以逆WER的评分进行组内筛选),以适配下游任务。本数据集兼容Apache-2.0许可证,可自由用于非商业及商业场景。
背景与挑战
背景概述
该数据集名为MOSS-Local Voice Acting v4 "emorant",由LAION机构于近期创建,基于其自主研发的MOSS-TTS语音合成模型(4.55B参数本地Transformer架构)生成,旨在推动文本到语音(TTS)领域向情感表达深度与真实感迈进。核心研究问题聚焦于如何突破传统TTS中情感表达的平淡与模板化,通过大规模、高强度的情感语音样本库,探索模型在无参考音频条件下,仅凭人物描述和精心设计的指令生成高度情绪化语音的能力。该数据集作为四部分语料库的首部分,包含40种情绪、200组、每组64次演绎,总计约12.8万条48 kHz高保真音频,为情感TTS研究提供了前所未有的资源密度,有望显著影响语音交互、情感计算及虚拟角色配音等领域。
当前挑战
数据集面临的挑战首先在于领域核心问题:传统TTS难以捕捉人类情感表达的细腻变化与爆发性强度,如愤怒时的嘶吼、悲伤时的哽咽等非言语特征。MOSS-v4通过将情绪映射至特定演绎类别(如失控咆哮、痛苦、狂喜)并嵌入声学机制描述(如撕裂、嘶哑、抽泣)及非语音爆发提示,试图解决这一难题,但如何平衡情感强度与语音可懂度仍是关键。构建过程中,挑战集中于生成一致性:需确保同一情绪组内64次演绎在保持情感基调的同时具备多样性,同时避免模型因过度情感化而失真。此外,数据集包含所有未过滤的原始生成结果,要求用户自行通过词错误率(WER)、情感混合度等指标进行最优选择,这对下游研究的后处理能力提出了更高要求。
常用场景
经典使用场景
该数据集专为极端情感语音合成研究而设计,其核心使用场景在于驱动文本到语音(TTS)模型生成超越常规中性朗读的高强度情感表达。通过将40种情感映射至特定递送类别(如失控咆哮、悲痛、狂喜等),并嵌入声乐爆发提示与升级弧线指令,数据集使研究者能够探索模型在无参考音频条件下如何通过人物描述自主创造语音,从而推动情感语音合成从静态标签向动态、层级的情绪传达演进。
解决学术问题
数据集解决了情感语音合成领域长期存在的两大痛点:一是传统TTS数据集中情感表达缺乏强度与真实性,多流于平淡模拟;二是情感标签颗粒度粗糙,难以捕捉细微情绪变化。通过提供64次重复录制的高强度情感演绎,并附有WER、VoiceCLAP情感得分、移情洞察评分等多维评价指标,该数据助力学者系统研究情感强度、声学特征与语义清晰度之间的权衡,为构建更具表现力的合成系统奠定基础。
衍生相关工作
基于该数据集衍生出的经典工作包括:利用最佳N选策略(如结合情绪混合度、逼真度和逆WER)优化语音生成质量的研究;以及探索情绪维度与声学特征(如响度、时长)关系的分析;此外,该数据与LAION团队发布的MOSS-TTS模型和DramaBox重解释数据集共同构成了一个完整的情感语音生态系统,催生了关于无参考情感生成、指令引导风格迁移等前沿课题的系列成果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务