moss-local-voice-acting-v3-refs-64x100
收藏资源简介:
MOSS-Local Voice Acting v3 是一个大规模合成语音情感表达数据集,专门设计用于语音克隆和情感语音合成任务。该数据集包含255,272个48kHz单声道FLAC格式的语音片段,覆盖40种不同情感,由100个情感组构成,每组包含64个采样版本。每个情感组都基于一个独特的参考说话人进行语音克隆,确保4,000个参考说话人在整个数据集中仅出现一次,实现了说话人多样性。数据生成使用了合并后的4.55B参数MOSS-TTS本地变换器语音表演模型,采用温度1.0的原始模型输出,未进行增强或超分辨率处理。每个语音片段对应双重情感提示串联而成的脚本、自然语言风格指令以及3-15秒的参考音频。数据集附带详细的元数据表格,包含词错误率、情感混合度、真实性、提示相似度、40维情感分数等多维评分指标,以及响度和持续时间等声学特征。该数据集适用于文本到语音合成、情感语音生成、语音克隆、语音质量评估和语音情感分析等研究与应用场景。
MOSS-Local Voice Acting v3 is a large-scale synthetic speech emotion expression dataset specifically designed for voice cloning and emotional speech synthesis tasks. The dataset contains 255,272 48kHz mono FLAC format speech clips, covering 40 different emotions, consisting of 100 emotion groups, each with 64 sampled versions. Each emotion group is based on a unique reference speaker for voice cloning, ensuring that 4,000 reference speakers appear only once throughout the dataset, achieving speaker diversity. Data generation used a merged 4.55B parameter MOSS-TTS local transformer voice acting model, with raw model output at temperature 1.0, without enhancement or super-resolution processing. Each speech clip corresponds to a script concatenated from dual emotion prompts, natural language style instructions, and 3-15 seconds of reference audio. The dataset includes detailed metadata tables containing multi-dimensional scoring metrics such as word error rate, emotion mixture, authenticity, prompt similarity, 40-dimensional emotion scores, as well as acoustic features like loudness and duration. This dataset is suitable for research and application scenarios such as text-to-speech synthesis, emotional speech generation, voice cloning, speech quality assessment, and speech emotion analysis.
数据集概述:MOSS-Local Voice Acting v3
基本信息
- 数据集名称:MOSS-Local Voice Acting v3 — voice-cloned emotional speech, 64 takes per group
- 许可协议:Apache-2.0
- 任务类别:文本转语音(text-to-speech)、音频分类(audio-classification)
- 语言:英语(en)
- 数据集规模:100K < n < 1M(实际包含255,272个音频片段)
数据集组成
- 结构:40种情绪 × 100个组 × 64次生成 = 255,272个合成语音片段
- 音频格式:48 kHz 单声道 FLAC
- 生成模型:
laion/moss-tts-local-transformer-4.55b-voice-acting(合并的4.55B参数MOSS-TTS语音表演模型) - 生成条件:原始模型输出,无增强或超分辨率,温度参数为1.0
"组"的定义
每个组代表一个表演设置,以不同的采样种子重复执行64次,包含:
- 脚本(text):两个相同情绪的提示词,用空格连接,生成约20-40秒的语音
- 风格指令(style instruction):小写自然语言导演说明,包括角色描述、目标情感表达、升级弧线及脚本中的声爆提示
- 参考音频(reference audio):3-15秒的说话者片段,用于语音克隆
所有64次生成均保留,未经过滤,用户可自行进行最佳-N选择。
参考说话者
- 数量:4,000个独特参考说话者,每个在整个语料库中仅使用一次
- 来源:
TTS-AGI/Emotion-Voice-Attribute-Reference-Snippets-DACVAE-Wave - 筛选流程:
- 质量过滤:时长3-15秒,录音质量评分≥0,背景噪声评分≤3
- 说话者去重:ECAPA-TDNN嵌入余弦相似度阈值0.80
- 分层轮选:基于性别×年龄三分位,性别均衡(1,976女性/2,024男性)
- 年龄分布限制:84%的源片段为中年成人,极端年龄样本有限(121个年长、72个年轻)
仓库布局
data/<Emotion>.tar 40个tar文件(每情绪约7GB): <Emotion>/<Emotion>_<group>_v<take>.flac 64次生成×100组 <Emotion>/scores.parquet 每情绪评分表切片 <Emotion>/cells.jsonl 每情绪生成单元格 scores.parquet 全部255,272行(推荐入口点) cells.jsonl 全部4,000个单元格:gid、文本、指令、声爆、参考分配 references.tar 4,000个参考/克隆源FLAC文件 references.parquet 参考元数据:ref_id、源id、年龄、性别、时长、分层
评分表(scores.parquet)字段说明
| 字段 | 说明 |
|---|---|
gid, emotion, ei_head, prompt_idx, seed |
组ID、目标情绪、Empathic-Insight头、提示索引、生成索引 |
ref_id, ref_stratum |
参考说话者ID及其性别×年龄分层 |
vocal_burst |
指令中指定的非语言爆发提示 |
wer, inv_wer, hyp |
词错误率、1/(1+WER)、ASR转录文本 |
blend, genu |
VoiceCLAP情绪混合和真实度MLP分数 |
prompt_sim |
VoiceCLAP音频-文本余弦相似度 |
ei_*(42列) |
Empathic-Insight-Voice-Plus分数(40个情绪维度+唤醒度、效价、真实性) |
target |
目标情绪的EI-Plus分数 |
rms_db, peak_db, dur |
响度(dBFS)和时长(秒) |
finished |
是否以EOS结束生成(推荐过滤条件) |
生成细节
- 模型架构:合并的4.55B参数moss_tts_local,12码本RVQ,MOSS-Audio-Tokenizer-v2编解码器,原生48 kHz
- 采样参数:温度1.0,每批次64次生成,bf16 + SDPA注意力
- 令牌预算:
词语数×6.0个码本帧(12.5 Hz),max_new_tokens = 2.2×预算+300 - 克隆方式:参考FLAC被模型编解码器编码(12个码本),作为用户消息的
reference条件传入 - 计算资源:8×A100-80GB,约23小时墙钟时间,约2.6秒/片段(生成+评分)
- 推理代码:LAION-AI/laion-moss-local-1.5-voice-acting-4.55b
已知限制
- 约0.3%的生成片段缺失(256,000个目标中实际有255,272个)
- 参考说话者年龄分布偏重中年人
- 脚本为戏剧性/华丽风格,非对话式语音
- 所有评分为模型计算,非人工标注
相关数据集
| 数据集 | 差异 | 链接 |
|---|---|---|
| v2(255,746片段) | 无参考音频,单提示脚本,角色创造的声音 | laion/moss-local-voice-acting-64x100 |
| v4 "emorant"(512k片段) | 最大强度传递级提示,无参考 | laion/moss-local-voice-acting-v4-emorant-64x200 |
| DramaBox reinterpretations(188,125片段) | 2,953个人类表演重新演绎,从原始克隆 | laion/moss-local-dramabox-full-reinterpretations-64 |
预览与示例
- 音频预览:top-3-by-reward preview grid(每情绪一个组,展示按奖励分数排名前三的生成片段)




