遇见数据集

moss-local-voice-acting-v3-refs-64x100

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

MOSS-Local Voice Acting v3 是一个大规模合成语音情感表达数据集,专门设计用于语音克隆和情感语音合成任务。该数据集包含255,272个48kHz单声道FLAC格式的语音片段,覆盖40种不同情感,由100个情感组构成,每组包含64个采样版本。每个情感组都基于一个独特的参考说话人进行语音克隆,确保4,000个参考说话人在整个数据集中仅出现一次,实现了说话人多样性。数据生成使用了合并后的4.55B参数MOSS-TTS本地变换器语音表演模型,采用温度1.0的原始模型输出,未进行增强或超分辨率处理。每个语音片段对应双重情感提示串联而成的脚本、自然语言风格指令以及3-15秒的参考音频。数据集附带详细的元数据表格,包含词错误率、情感混合度、真实性、提示相似度、40维情感分数等多维评分指标,以及响度和持续时间等声学特征。该数据集适用于文本到语音合成、情感语音生成、语音克隆、语音质量评估和语音情感分析等研究与应用场景。

MOSS-Local Voice Acting v3 is a large-scale synthetic speech emotion expression dataset specifically designed for voice cloning and emotional speech synthesis tasks. The dataset contains 255,272 48kHz mono FLAC format speech clips, covering 40 different emotions, consisting of 100 emotion groups, each with 64 sampled versions. Each emotion group is based on a unique reference speaker for voice cloning, ensuring that 4,000 reference speakers appear only once throughout the dataset, achieving speaker diversity. Data generation used a merged 4.55B parameter MOSS-TTS local transformer voice acting model, with raw model output at temperature 1.0, without enhancement or super-resolution processing. Each speech clip corresponds to a script concatenated from dual emotion prompts, natural language style instructions, and 3-15 seconds of reference audio. The dataset includes detailed metadata tables containing multi-dimensional scoring metrics such as word error rate, emotion mixture, authenticity, prompt similarity, 40-dimensional emotion scores, as well as acoustic features like loudness and duration. This dataset is suitable for research and application scenarios such as text-to-speech synthesis, emotional speech generation, voice cloning, speech quality assessment, and speech emotion analysis.

提供机构:
LAION eV
创建时间:
2026-07-17
原始信息汇总

数据集概述:MOSS-Local Voice Acting v3

基本信息

  • 数据集名称:MOSS-Local Voice Acting v3 — voice-cloned emotional speech, 64 takes per group
  • 许可协议:Apache-2.0
  • 任务类别:文本转语音(text-to-speech)、音频分类(audio-classification)
  • 语言:英语(en)
  • 数据集规模:100K < n < 1M(实际包含255,272个音频片段)

数据集组成

  • 结构:40种情绪 × 100个组 × 64次生成 = 255,272个合成语音片段
  • 音频格式:48 kHz 单声道 FLAC
  • 生成模型laion/moss-tts-local-transformer-4.55b-voice-acting(合并的4.55B参数MOSS-TTS语音表演模型)
  • 生成条件:原始模型输出,无增强或超分辨率,温度参数为1.0

"组"的定义

每个组代表一个表演设置,以不同的采样种子重复执行64次,包含:

  • 脚本(text):两个相同情绪的提示词,用空格连接,生成约20-40秒的语音
  • 风格指令(style instruction):小写自然语言导演说明,包括角色描述、目标情感表达、升级弧线及脚本中的声爆提示
  • 参考音频(reference audio):3-15秒的说话者片段,用于语音克隆

所有64次生成均保留,未经过滤,用户可自行进行最佳-N选择。

参考说话者

  • 数量:4,000个独特参考说话者,每个在整个语料库中仅使用一次
  • 来源TTS-AGI/Emotion-Voice-Attribute-Reference-Snippets-DACVAE-Wave
  • 筛选流程
    1. 质量过滤:时长3-15秒,录音质量评分≥0,背景噪声评分≤3
    2. 说话者去重:ECAPA-TDNN嵌入余弦相似度阈值0.80
    3. 分层轮选:基于性别×年龄三分位,性别均衡(1,976女性/2,024男性)
  • 年龄分布限制:84%的源片段为中年成人,极端年龄样本有限(121个年长、72个年轻)

仓库布局

data/<Emotion>.tar 40个tar文件(每情绪约7GB): <Emotion>/<Emotion>_<group>_v<take>.flac 64次生成×100组 <Emotion>/scores.parquet 每情绪评分表切片 <Emotion>/cells.jsonl 每情绪生成单元格 scores.parquet 全部255,272行(推荐入口点) cells.jsonl 全部4,000个单元格:gid、文本、指令、声爆、参考分配 references.tar 4,000个参考/克隆源FLAC文件 references.parquet 参考元数据:ref_id、源id、年龄、性别、时长、分层

评分表(scores.parquet)字段说明

字段 说明
gid, emotion, ei_head, prompt_idx, seed 组ID、目标情绪、Empathic-Insight头、提示索引、生成索引
ref_id, ref_stratum 参考说话者ID及其性别×年龄分层
vocal_burst 指令中指定的非语言爆发提示
wer, inv_wer, hyp 词错误率、1/(1+WER)、ASR转录文本
blend, genu VoiceCLAP情绪混合和真实度MLP分数
prompt_sim VoiceCLAP音频-文本余弦相似度
ei_*(42列) Empathic-Insight-Voice-Plus分数(40个情绪维度+唤醒度、效价、真实性)
target 目标情绪的EI-Plus分数
rms_db, peak_db, dur 响度(dBFS)和时长(秒)
finished 是否以EOS结束生成(推荐过滤条件)

生成细节

  • 模型架构:合并的4.55B参数moss_tts_local,12码本RVQ,MOSS-Audio-Tokenizer-v2编解码器,原生48 kHz
  • 采样参数:温度1.0,每批次64次生成,bf16 + SDPA注意力
  • 令牌预算词语数×6.0个码本帧(12.5 Hz),max_new_tokens = 2.2×预算+300
  • 克隆方式:参考FLAC被模型编解码器编码(12个码本),作为用户消息的reference条件传入
  • 计算资源:8×A100-80GB,约23小时墙钟时间,约2.6秒/片段(生成+评分)
  • 推理代码LAION-AI/laion-moss-local-1.5-voice-acting-4.55b

已知限制

  • 约0.3%的生成片段缺失(256,000个目标中实际有255,272个)
  • 参考说话者年龄分布偏重中年人
  • 脚本为戏剧性/华丽风格,非对话式语音
  • 所有评分为模型计算,非人工标注

相关数据集

数据集 差异 链接
v2(255,746片段) 无参考音频,单提示脚本,角色创造的声音 laion/moss-local-voice-acting-64x100
v4 "emorant"(512k片段) 最大强度传递级提示,无参考 laion/moss-local-voice-acting-v4-emorant-64x200
DramaBox reinterpretations(188,125片段) 2,953个人类表演重新演绎,从原始克隆 laion/moss-local-dramabox-full-reinterpretations-64

预览与示例

搜集汇总
数据集介绍
moss-local-voice-acting-v3-refs-64x100 数据集图片
构建方式
该数据集基于MOSS-TTS本地变换器模型(参数量4.55B)进行语音克隆与情感语音生成。其构建核心在于将40种情感、100个脚本组和64次重复采样进行三维交叉组合,共计产生255,272条合成语音片段。每组包含一条由两个同情感提示拼接而成的脚本、一份自然语言风格指令(涵盖人物角色、情感描述及发声爆发指示),以及一段3至15秒的参考音频——该音频从大规模参考片段库中经质量筛选与ECAPA-TDNN说话人去重后唯一分配,确保全局4000个参考说话人均不重复使用。生成时采用温度1.0的原始模型输出,未施加任何增强或超分辨率处理,并保留全部64次采样结果以供下游最佳选取。
特点
本数据集最突出的特点在于其细粒度的情感控制与说话人独特性。40种情感维度通过Empathic-Insight-Voice-Plus评分系统量化,每个生成片段均包含42列情感向量及唤醒度、效价等元数据。参考说话人池在性别上均衡(1976女性/2024男性),且通过分层轮盘策略确保年龄分布的多样性,尽管受源数据限制以中成年为主。此外,数据集完整保留了包括字错误率、语音清晰度倒数(invWER)、VoiceCLAP混合度与真实性分数在内的多维度评估指标,并设定了`finished`标志以区分正常结束与被截断的生成片段,为研究者提供了丰富的筛选依据。
使用方法
研究者可通过`scores.parquet`作为主入口访问全部255,272条记录的评分表格,通过`gid`字段与`cells.jsonl`中的脚本、指令及参考音频分配信息关联。推荐的最佳选取策略采用归一化的混合度与真实性分数乘以语音清晰度倒数构建奖励函数,按组选取前三佳片段。亦可依据目标情感权重或提示相似度调整筛选逻辑。所有参考音频与生成结果打包于`references.tar`和按情感分类的压缩包中,支持音频分类与文本转语音任务的直接训练与评估。开源许可证为Apache-2.0,所有音频均为合成生成,确保法律合规性。
背景与挑战
背景概述
MOSS-Local Voice Acting v3是LAION团队于2024年发布的大规模情感语音克隆数据集,基于自研的4.55B参数MOSS-TTS局部变换器模型生成。该数据集包含255,272个48kHz高保真语音片段,覆盖40种情感类别、100个独立声音组,每组由64次独立采样构成,且每个声音组均通过独特的参考说话人进行声音克隆。其核心研究问题在于探索大语言模型在情感语音合成中的细粒度可控性与多样性表现,通过引入自然语言风格指令、双句脚本拼接及无过滤的全保留策略,为文本转语音、语音情感识别及语音克隆研究提供了高质量基准。该数据集依托ECAPA-TDNN嵌入进行说话人去重,并采用性别平衡的4,000个参考说话人池,对推动多模态生成模型在情感语音领域的标准化评估具有重要影响。
当前挑战
领域层面,该数据集旨在解决情感语音合成中两大核心挑战:一是实现超过40种细粒度情感类别的高保真声音克隆,需在保持说话人一致性的前提下精确传递复杂情感状态;二是构建无偏见的多样化参考声音库,其年龄分布因源数据限制呈现中年主导偏差(84%为中年音色),极端年龄样本稀缺(仅121个老年、72个年轻参考)。构建过程中面临多重技术挑战:约0.3%的缺失片段源于GPU显存压力导致的批处理回退;模型生成的语音质量完全依赖ASR(Parakeet-TDT)、VoiceCLAP及Empathic-Insight模型的自监督评分,缺乏人类主观评估作为黄金标准;同时,双句脚本强调戏剧化表演风格,与自然对话语体存在显著差异,限制了其在日常对话场景的迁移性。
常用场景
经典使用场景
在文本到语音合成与语音情感识别交叉领域,MOSS-Local Voice Acting v3数据集为研究者提供了规模空前的精细化情感语音合成资源。该数据集包含255,272条高质量语音片段,精心设计了40种情感类别、100组独立音色克隆参考组,每组通过64次随机采样生成,形成了丰富的情感-音色-文本三元空间映射。研究者常将其应用于情感可控语音合成系统的训练与评估,通过独特的voice-cloning机制与多维度质量评分(包括情感混合度、真实感、提示相似性等),实现对合成语音中情感表达强度的精细调控,成为推动个性化和情感化语音合成技术发展的标杆性数据资产。
实际应用
在产业应用层面,该数据集为虚拟角色配音、有声内容生产、情感交互式智能助手等领域开辟了新路径。游戏公司和动画制片方可利用其多样化情感-音色组合快速生成符合角色性格的对话样本;面向情感障碍人群的辅助沟通设备开发团队,可借助数据集训练更细腻理解与表达情感语音的模型;智能客服系统能从中借鉴如何通过调节语音情感基调提升用户服务体验。此外,数据集精心设计的参考说话人年龄与性别分层,尽管存在中青年偏重局限,仍为老龄化语音交互产品开发提供了基础资源,推动商业语音服务向更富人情味的方向演进。
衍生相关工作
该数据集推动了系列相关开创性工作的涌现。其基础上衍生的MOSS-TTS系列模型探索了基于局部注意力与大规模情感标注的说话人无关情感语音合成新范式,V4 'emorant'版本将情感表达强度推向极致,而DramaBox重诠释工作则开创性地将真实人类表演片段通过声音克隆与多重采样进行艺术化重构,形成了表演-合成间的翻译桥梁。配套发布的基于VoiceCLAP与Empathic-Insight的多维评分体系,启发了后续研究中以提示相似度、情感辨识度、音色保真度为核心指标的语音质量评估框架,深刻影响了学术界对合成语音中情感维度可量化建模的理论认知。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务