遇见数据集

moss-local-voice-acting-64x100

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

MOSS-Local Voice Acting v2是一个大规模合成语音表演数据集,专门用于情感语音生成任务。它包含255,746个48 kHz单声道FLAC格式的语音片段,由4.55B参数的MOSS-TTS本地变换器语音表演模型生成,采用温度1.0采样,无参考音频,模型完全基于角色描述生成每个组的声音。数据组织为40种情绪 × 100组 × 64个采样,每个“组”代表一个完整的表演设置,包括一个针对目标情绪编写的戏剧性提示脚本(嵌入非语言爆发提示,如笑声、喘息等)和一个自然语言风格指令(描述角色特征、目标感受及声音表达方式)。所有64个采样均被保留,未经过滤,用户可自行进行最佳N选择。数据集文件包括按情绪分组的压缩包、完整的评分表(Parquet格式)和生成单元信息(JSONL)。评分表为每个采样提供了丰富的评估指标:词错率(WER)及其倒数、语音-文本相似度、情感混合度与真实性分数、42维情感洞察分数(包括40种情绪维度及唤醒度、效价等)、目标情绪分数、响度(RMS dB、峰值dB)、时长以及生成完成标志。该数据集适用于文本到语音(TTS)合成、情感语音生成、语音质量评估、语音情感识别等任务。README中提供了基于奖励函数的最佳N选择方案,并说明了生成过程的技术细节(模型架构、采样参数、计算配置)。已知限制包括:脚本风格偏向戏剧化而非对话式;所有评分均基于模型,需视为可排序信号而非人工标注真值。数据集采用Apache-2.0许可证,所有音频均为完全合成。

MOSS-Local Voice Acting v2 is a large-scale synthetic voice acting dataset specifically designed for emotional speech generation tasks. It contains 255,746 speech clips in 48 kHz mono FLAC format, generated by the 4.55B-parameter MOSS-TTS local transformer voice acting model using temperature 1.0 sampling without reference audio; the model generates each groups voice entirely based on character descriptions. The data is organized as 40 emotions × 100 groups × 64 samples, where each group represents a complete performance setup, including a dramatic prompt script tailored to the target emotion (with embedded non-verbal outburst cues such as laughter, gasps, etc.) and a natural language style instruction (describing character traits, target feelings, and vocal expression). All 64 samples are retained without filtering, allowing users to perform their own best-N selection. The dataset files include compressed packages grouped by emotion, a complete scoring sheet (in Parquet format), and generation unit information (in JSONL). The scoring sheet provides rich evaluation metrics for each sample: word error rate (WER) and its reciprocal, speech-text similarity, emotional blend and authenticity scores, 42-dimensional emotional insight scores (including 40 emotion dimensions, arousal, valence, etc.), target emotion score, loudness (RMS dB, peak dB), duration, and generation completion flag. This dataset is suitable for text-to-speech (TTS) synthesis, emotional speech generation, speech quality assessment, and speech emotion recognition tasks. The README offers a best-N selection scheme based on a reward function and explains technical details of the generation process (model architecture, sampling parameters, computational configuration). Known limitations include: the script style leans towards dramatic rather than conversational; all scores are model-based and should be treated as sortable signals rather than human-annotated ground truth. The dataset is licensed under Apache-2.0, and all audio is fully synthetic.

提供机构:
LAION eV
创建时间:
2026-07-17
原始信息汇总

数据集概述

MOSS-Local Voice Acting v2 是一个情感语音合成数据集,包含 255,746 个合成配音片段(48 kHz 单声道 FLAC),覆盖 40 种情感 × 100 组 × 64 次生成。数据由 MOSS-TTS 语音表演模型(4.55B 参数)直接生成,未经过增强或超分辨率处理,且不使用参考音频——模型根据角色描述为每组独立创造声音。


数据组成与结构

"Group" 的定义

每个 "group" 是一种表演配置的 64 次不同种子采样,包含:

  • 脚本(text):针对目标情感编写的戏剧化提示,内含非语言爆发提示(如笑、喘息、叹息、啜泣等)。
  • 风格指令:小写自然语言指导,描述角色(如 "34岁女性,嗓音明亮清晰")、目标情感及表达方式。

所有 64 次生成均被保留(未过滤),finished 标记表示以结束符(EOS)而非截断终止的片段。

仓库布局

data/<Emotion>.tar 每个情感一个 tar 文件(约 6-8 GB): <Emotion>/<Emotion>_<group>_v<take>.flac 64 takes × 100 组,48 kHz 单声道 FLAC <Emotion>/scores.parquet 该情感的评分子表 <Emotion>/cells.jsonl 该情感的生成单元信息 scores.parquet 全部 255,746 条记录(推荐入口点) cells.jsonl 全部 4,000 个单元:包含 gid、文本、指令、非语言爆发


评分表(scores.parquet)

每个生成片段对应一行,包含以下关键指标:

列名 说明
gid, emotion, prompt_idx, seed 组ID、目标情感、提示索引、生成索引(与文件名 _v<take> 对应)
vocal_burst 脚本中指定的非语言爆发提示
wer, inv_wer, hyp 词错误率(与脚本对比,使用 NVIDIA Parakeet-TDT-0.6b-v3 ASR)、1/(1+WER)、ASR转录结果
blend, genu VoiceCLAP-commercial 情感混合度和真实度 MLP 评分
prompt_sim 音频与风格指令之间的 VoiceCLAP 音频-文本余弦相似度
ei_*(42 列) Empathic-Insight-Voice-Plus 评分:40 个情感维度 + 唤醒度 ei_Arousal、效价 ei_Valence、真实性 ei_Authenticity
target 该组目标情感对应的 EI-Plus 评分
rms_db, peak_db, dur 响度(dBFS)、峰值响度、时长(秒)
finished 片段是否以 EOS 结束(推荐过滤条件)

最佳选择策略(Best-of-N)

推荐的选择方法:

  1. 加载 scores.parquet
  2. blendgenu 做 Min-Max 归一化。
  3. 计算奖励分数:reward = (归一化 blend + 归一化 genu) × inv_wer
  4. 筛选 finished == True 的片段,按 reward 降序排列,每组取前 3 个。

此策略在 100% 的组中产生一致的提升,平均归一化奖励增加 +0.81。质量/计算曲线的拐点出现在 k≈8,k≈300 后收益递减。


生成方法

  • 模型:4.55B moss_tts_local 架构(基础模型 + rank-256 LoRA),12 码本 RVQ,使用 MOSS-Audio-Tokenizer-v2 编解码器,原生 48 kHz。
  • 采样:温度 1.0,每组批量 generate()(batch=64),bf16 + SDPA attention。
  • 节奏:token 预算 = words × 6.0 个码本帧(12.5 Hz),max_new_tokens = 2.2 × budget + 300
  • 评分:与生成在同一 GPU 上融合完成,包括 Parakeet ASR(bf16,batch=32)、VoiceCLAP 编码、Empathic-Insight-Voice-Plus 评分、响度计算。
  • 计算资源:8 × A100-80GB,每个片段端到端约 1.1 秒(生成 + 完整评分)。

推理代码与快速指南:LAION-AI/laion-moss-local-1.5-voice-acting-4.55b


同类数据集对比

版本 主要区别 链接
v2(本仓库) 无参考音频,单提示脚本,模型创造声音 当前
v3(255,272 片段) 每组唯一语音克隆参考(4,000 说话人,仓库内提供),双长度成对脚本 laion/moss-local-voice-acting-v3-refs-64x100
v4 "emorant"(512k 片段) 最大强度表演级提示,全新提示,每组 200 个生成 laion/moss-local-voice-acting-v4-emorant-64x200
DramaBox 重演绎(188,125 片段) 2,953 个完整人类表演 ×64 次重新生成,克隆自原始表演,含 ECAPA 嵌入 laion/moss-local-dramabox-full-reinterpretations-64

已知限制

  • 实际片段数为 255,746(目标 256,000):部分组由于 GPU 内存压力未生成满 64 段。
  • 脚本风格戏剧化/华丽,属于配音语料库,非日常对话语音。
  • 所有评分基于模型,可作为排序信号,但非人工真实标注

许可证

Apache-2.0。所有音频均为合成内容,不包含任何真实说话人的声音。

搜集汇总
数据集介绍
moss-local-voice-acting-64x100 数据集图片
构建方式
MOSS-Local Voice Acting v2 数据集由 255,746 条合成语音片段构成,这些语音片段来源于 40 种情感、100 个分组以及每个分组 64 次独立采样的组合。构建过程中,使用了融合了 LoRA 权重(秩 256)的 45.5 亿参数 MOSS-TTS 语音表演模型,在无参考音频的条件下,仅凭角色描述(persona description)为每个分组生成声音。生成时采样温度设为 1.0,采用 12 码本 RVQ 编码器在 48 kHz 采样率下输出原生 FLAC 格式音频。每条片段的 token 预算依据文本词数乘以 6.0 帧系数设定,通过批处理生成方式一次性为每个分组生成 64 个样本,且未对输出进行任何增强或超分辨率处理。
特点
该数据集的核心特点在于其系统化的多样性与原始输出的保留。所有 64 次采样结果均被完整保存,未经过滤,使得用户可以自行应用最佳 N 选策略挑选高质量片段。每个分组包含一个为特定情感设计的戏剧化文本脚本(含非语言爆发提示如笑声、叹息等)以及一段描述角色身份与情感传达方式的自然语言风格指导。评分表(scores.parquet)提供了每一条片段的字错误率(WER)、VoiceCLAP 情感融合度与真实性分数、同理心洞察语音评估的 42 维度情感指标、响度与时长等工程化特征,这些模型驱动的评分可作为排序信号辅助用户进行质量筛选。
使用方法
使用者可通过读取全面的评分表(scores.parquet)作为入口,该文件包含所有 255,746 行数据。推荐的最佳 N 选方法首先过滤出 generation 结束于 EOS 标记的片段(finished 列为 True),然后对每条片段的 blend 与 genu 分数进行最小-最大归一化后乘以 inv_wer 得到奖励分数(reward),最后按分组标识(gid)选择奖励分数最高的三条片段。数据存储采用按情感类别分包的 tar 文件格式,每个情感文件夹内包含 FLAC 音频文件、对应情感子集的评分表与生成元数据 JSONL 文件。对于需要更高质量或特定应用场景的用户,还可以参考使用同系列的其他版本,如带有参考音频的 v3 版本或最大强度表演提示的 v4 版本。
背景与挑战
背景概述
在语音合成与情感表达的研究领域,获取大规模、多样化且带有精细情感标注的语音数据始终是构建高质量文本到语音系统的关键瓶颈。MOSS-Local Voice Acting v2数据集由LAION团队于2023年发布,基于其自主研发的4.55B参数MOSS-TTS局部Transformer模型,通过纯合成方式生成了涵盖40种情绪、100组文本脚本、每组64次采样的255,746条情感语音片段。该数据集的核心创新在于无需参考音频,仅依靠人格描述与风格指令驱动模型生成差异化语音,从而突破传统语音数据集对真人录音的依赖,为情感语音合成、多情绪分类及表现力建模提供了大规模、可复现的研究基准。其对后续语音合成领域的影响力体现在推动了无参考音频的零样本语音克隆与情感控制技术的探索。
当前挑战
该数据集面临的核心挑战首先在于所解决的领域问题:传统语音数据集通常局限于少数基本情绪且缺乏精细的情感维度划分,而MOSS-Local Voice Acting v2虽覆盖40种情绪,但所有语音均由单一合成模型生成,其情感表达的多样性与自然度受限于模型架构与训练数据的先验分布,难以完全模拟人类语音中微妙的声学变化与社交语境隐含情感。其次,在构建过程中,数据集面临生成质量控制难题——所有255,746条语音均未经筛选保留原始输出,部分样本因GPU内存压力存在缺失,且依赖的ASR、VoiceCLAP及Empathic-Insight-Voice-Plus等评分模型均为自动计算,缺乏人类主观评测作为黄金标准,导致情感标签与真实感知之间存在潜在偏差。此外,脚本设计刻意追求戏剧化风格,限制了其在自然对话场景中的直接迁移应用。
常用场景
经典使用场景
在语音合成与情感计算交叉领域,该数据集为细粒度情感语音生成提供了独特的实验平台。其设计围绕40种情感类别、100组表演设定及每组64次独立采样展开,使得研究者能够系统性地探索文本到语音模型中情感表达的可控性与多样性。尤为关键的是,所有音频均由无参考语音的文本驱动生成,摒弃了对特定说话人音色的依赖,这为研究语音合成中情感与音色解耦、风格迁移以及零样本情感语音克隆提供了理想的数据基础。经典使用场景包括:基于奖励模型进行最佳样本选择、情感语音识别的训练与评估、以及多维度语音质量指标的联合优化研究。
解决学术问题
该数据集直面情感语音合成中两个长期存在的学术难题:一是高质量情感语音数据稀缺,尤其是覆盖广泛且情感粒度精细的平行语料;二是情感表达的可量化评估指标缺失,传统方法多依赖主观听感判断。MOSS-Local Voice Acting v2通过大规模合成生成了超过25万条带有精细情感标注和自动化评估分数的语音片段,每个样本都附有词错误率、情感混合度、真实性及40维情感深度评分,从而使得研究者能够以数据驱动的方式量化情感语音质量、建立自动评估框架,并推动情感语音合成从定性描述走向可计算、可优化的科研范式。
衍生相关工作
该数据集衍生出一系列推动情感语音技术边界的经典工作。其同一项目系列中的数据配套版本,如v3中引入的语音克隆参考音频及v4中采用高强度表演风格提示的大规模语料,均建立在本数据集的设计范式之上。此外,从该数据集延伸出的最佳样本选择策略研究催生了关于计算资源与合成质量之间权衡曲线的定量分析,为后续语音合成系统中的高效采样算法提供了理论依据。更广泛地,该数据集所倡导的多维度自动化评分体系——整合语音识别、情感嵌入及心理声学测量——已成为后续情感语音语料库构建中评价指标设计的参考标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务