遇见数据集

moss-local-dramabox-full-reinterpretations-64

收藏
Hugging Face2026-07-15 更新2026-07-16 收录
官方服务:

资源简介:

MOSS-Local DramaBox Full-Performance Reinterpretations (best-of-64) 是一个大规模多语言语音合成数据集,专注于语音表演的重新诠释与评估。数据集基于 2,953 个原始的 DramaBox 双场景语音表演(涵盖英语、德语、西班牙语、法语,包含全部 9 条 DramaBox 路径),每个表演使用 MOSS TTS 模型(laion/moss-tts-local-transformer-4.55b-voice-acting)进行了 64 次重新生成,总计约 189,000 个样本。每个样本包含完整的生成指令(包含语音描述、舞台指导和带语音爆发注释的对话文本)、预期文本、原始参考音频(用于语音克隆)以及生成的原始 48 kHz FLAC 音频。数据集的特色在于为每个生成样本提供了全面的评分指标,包括语音识别错误率(WER)、声音真实性与融合度、与提示的语义相似度、基于 EmoNet 的 42 维情感分析分数(含 40 种情绪及效价、唤醒度)、192 维说话人嵌入(ECAPA-TDNN)以及时长匹配度等。这些评分用于计算两种不同的奖励函数:Reward_A 侧重于语音身份与可懂度,Reward_B 侧重于情感表现相似度,旨在支持对生成样本进行多维度评估与最佳样本选择。数据以分桶的 tar 文件形式组织,包含音频文件及对应的评分 Parquet 表,同时提供全局的评分和参考向量汇总文件。该数据集适用于语音合成、语音克隆、情感语音生成、说话人识别以及最佳样本选择策略(best-of-n)等研究任务,采用 Apache-2.0 许可证。

MOSS-Local DramaBox Full-Performance Reinterpretations (best-of-64) is a large-scale multilingual text-to-speech (TTS) dataset focused on the reinterpretation and evaluation of vocal performances. The dataset is built upon 2,953 original dual-scenario vocal performances from DramaBox, covering English, German, Spanish, and French, and includes all 9 DramaBox paths. Each performance was regenerated 64 times using the MOSS TTS model (laion/moss-tts-local-transformer-4.55b-voice-acting), resulting in approximately 189,000 total samples. Each sample contains complete generation instructions (including voice descriptions, stage directions, and dialogue text annotated with speech burst cues), target text, original reference audio for voice cloning, and the raw generated 48 kHz FLAC audio. A key feature of this dataset is that comprehensive scoring metrics are provided for each generated sample, including Word Error Rate (WER), voice authenticity and fusion degree, semantic similarity to the prompt, 42-dimensional emotion analysis scores based on EmoNet (covering 40 emotions plus valence and arousal), 192-dimensional speaker embeddings (ECAPA-TDNN), and duration matching accuracy, among others. These metrics are used to calculate two distinct reward functions: Reward_A focuses on voice identity and intelligibility, while Reward_B prioritizes emotional performance similarity, aiming to support multi-dimensional evaluation and optimal sample selection for generated outputs. The dataset is organized into sharded tar archives, which contain audio files and their corresponding scoring Parquet tables, along with global summary files for scores and reference vectors. This dataset is suitable for research tasks including text-to-speech synthesis, voice cloning, emotional speech generation, speaker recognition, and best-of-n sample selection strategies, and is released under the Apache-2.0 license.

提供机构:
LAION eV
创建时间:
2026-07-15
原始信息汇总

数据集概述

基本信息

  • 数据集名称:MOSS-Local DramaBox Full-Performance Reinterpretations (best-of-64)
  • 许可证:Apache-2.0
  • 任务类别:文本到音频(text-to-audio)
  • 语言:英语、德语、西班牙语、法语
  • 标签:TTS、配音、语音克隆、DramaBox、best-of-n、情感、说话人嵌入、moss-tts
  • 数据集规模:100K < n < 1M

数据集内容

该数据集包含 2,953 个完整的双场景 DramaBox 配音表演(涵盖英语、德语、西班牙语、法语,所有 9 条 DramaBox 路径),每个表演被 重新演绎 64 次。所有音频均使用 laion/moss-tts-local-transformer-4.55b-voice-acting 模型从原始表演中进行语音克隆生成,并提供了两种不同方式(语音身份或情感表现)选择最佳片段的完整评分。

数据来源

每组生成方式

  • instruction:样本的完整 Gemini DramaBox 提示(语音描述 + 舞台指导 + 带发声标记的对话,两个场景含 "CUT TO:")
  • text:场景 1 和场景 2 的预期文本
  • reference:原始完整表演音频(按顺序两个部分),编码为 MOSS v2 12-codebook 格式用于语音克隆,并作为比较目标
  • 生成参数audio_temperature 1.0(带参考设置),top-p 0.95,top-k 25,重复惩罚 1.1,每次批量生成 64 个,token 预算 = max(words×6, ref_frames×1.2) 在 12.5 Hz
  • 音频格式:原始 48 kHz FLAC,无后处理

评分列说明

scores.parquet 文件中包含以下评分指标:

列名 含义
wer, inv_wer 与预期文本的词错误率(使用 nvidia/parakeet-tdt-0.6b-v3
genu, blend 真实性和发声混合头部(基于 laion/voiceclap-commercial
prompt_sim VoiceCLAP 中方向文本与音频的余弦相似度
ei_* (42列) Empathic-Insight-Voice-Plus 分数:40 种 EmoNet 情感 + 效价 + 唤醒度(基于 laion/Empathic-Insight-Voice-Pluslaion/BUD-E-Whisper
emonet_42 以上 42 个值以向量形式表示
emotion_cos 样本 42 维向量与参考 42 维向量的余弦相似度("相同感受?")
ecapa_192 ECAPA-TDNN 说话人嵌入(192 维向量,基于 speechbrain/spkrec-ecapa-voxceleb
spk_sim 样本 ECAPA 与参考 ECAPA 的余弦相似度("相同声音?")
dur_match min(时长, 参考时长)/max(时长, 参考时长)
rms_db, peak_db, dur 响度和长度

references.parquet 包含每组参考的 42 维 EmoNet 向量和 ECAPA 嵌入。

两种奖励分数(基于原始列计算,全局 min-max 归一化)

  • 奖励 A(语音身份) = mean( n(spk_sim), n(inv_wer), n(genu), n(blend), n(dur_match) ) 衡量"相同说话人、清晰可懂、至少和原始一样真实?"
  • 奖励 B(情感表现) = emotion_cos × inv_wer 衡量"是否感觉像相同的表演?"

数据布局

data/bucket_XXX.tar ~每个约 100 组:<gid>/<gid>_vNN.flac(64 个片段,48 kHz) + bucket_XXX_scores.parquet scores.parquet 所有片段的所有分数和嵌入 references.parquet 每组的参考向量/嵌入

生成技术栈

许可证

数据集遵循 Apache-2.0 许可证。合成语音由上述模型生成;原始提示/表演来自 TTS-AGI/dramabox-gemini-finetune(CC-BY-4.0 许可证)。

搜集汇总
数据集介绍
moss-local-dramabox-full-reinterpretations-64 数据集图片
构建方式
本数据集基于TTS-AGI/dramabox-gemini-finetune源数据,选取其中2,953段完整的双场景DramaBox表演(涵盖英语、德语、西班牙语、法语及全部9条剧情路径),每段表演经由laion/moss-tts-local-transformer-4.55b-voice-acting模型在声纹克隆条件下,以音频温度1.0、top-p 0.95、top-k 25、重复惩罚1.1的超参数设置,批量生成64次重诠释。生成过程严格遵循原生48 kHz采样率,输出未经后处理的原始FLAC格式音频,同时通过词错误率、语音真实度、情感嵌入相似度等维度为每次生成记录完整评分体系。
使用方法
用户可通过HuggingFace Datasets库直接加载数据集,访问data/bucket_XXX.tar中的分组音频文件及对应评分表。基于scores.parquet中的原始评分列,可依文档公式计算奖励A与奖励B,从而在每组的64次候选中分别按声纹真实性或情感相似性筛选最佳表演。该数据集适用于文本到音频合成、声纹克隆、情感语音重诠释等任务的训练与评估,Apache-2.0许可协议允许自由的学术与商业使用。
背景与挑战
背景概述
该数据集名为MOSS-Local DramaBox Full-Performance Reinterpretations (best-of-64),由LAION机构于近年创建,旨在推动文本到音频生成、语音克隆及情感表达领域的研究。核心研究问题聚焦于如何通过大规模重解释(best-of-64)和双奖励评分机制,在保留原始表演者语音身份与情感轮廓的前提下,生成高质量、富有表现力的语音表演。数据集基于已有的DramaBox双场景表演(来源:TTS-AGI/dramabox-gemini-finetune),利用4.55B参数的MOSS-TTS局部变换器模型,对2,953个完整表演各生成64个变体,总计近19万条语音片段,涵盖英语、德语、西班牙语和法语。该数据集通过精细的评分列(如语音相似度、情感余弦相似度、词错误率等)和两种奖励标准(语音身份导向与情感轮廓导向),为语音克隆、情感表达评估及多任务学习提供了高价值基准,对语音合成领域的可复制性和可改进性研究具有深远影响。
当前挑战
该数据集所解决的领域挑战包括:1)文本到音频生成中,如何平衡语音身份保真度与情感表达准确性,避免机械式克隆丧失表演的灵魂;2)现有语音克隆方法在细粒度情感控制上表现不足,难以捕捉原始表演中微妙的情感动态。构建过程中的挑战则涉及:a)大规模重解释(best-of-64)带来的计算负担,需在8×A100 GPU上实现高效生成与评分流水线(每片段约1.3–1.6秒);b)双奖励标准的定义与归一化,需确保语音身份奖励(融合说话人相似度、可懂度、真实度等)与情感轮廓奖励(情感余弦相似度与可懂度乘积)之间互补且不冲突;c)原始音频的48 kHz高保真编码及12码本MOSS v2特征提取,需避免信息损失;d)多语言(英/德/西/法)场景下,同一韵律模式可能对应迥异的文化表达,增加了跨语言性能评估的复杂性。
常用场景
经典使用场景
在语音合成与声音克隆的研究领域中,该数据集作为一项重要的基准资源,被广泛用于评估文本到语音生成模型在保持说话人身份与情感表达一致性上的表现。其核心使用场景在于,通过对比64次重解释生成的语音样本与原始表演音频在声纹嵌入、词错误率、自然度及情感相似度等多维度的评分,研究者能够系统性地分析模型在不同控制条件(如温度、top-p采样)下的生成质量。该数据集尤其适用于验证“最佳-of-N”采样策略在高质量语音克隆中的作用,为语音合成领域的候选筛选方法提供了精细化的评估框架。
解决学术问题
该数据集针对语音克隆中一个长期存在的学术挑战:如何在保持目标说话人独特音色(说话人同一性)的同时,精准复现原文所蕴含的情感表现力(情感轮廓)。传统的语音克隆研究往往难以同时优化这两个相互制约的目标,而该数据集通过设计两套独立的奖励机制(奖励A侧重声音身份,奖励B侧重情感匹配),系统量化了二者之间的冲突与权衡。这一创新方法为解决多目标优化问题提供了可复现的研究范式,推动学界更加深刻地理解语音生成中音色保真度与情感忠实度之间的内在张力。
实际应用
在实际应用中,该数据集为有声内容制作与个性化语音助手领域提供了关键支撑。例如,在戏剧配音和有声书录制场景中,导演可能需要同一位配音演员以不同的情感基调演绎同一段落,该数据集的重解释评分机制能够帮助自动筛选出既保留演员声音特征又符合特定情感要求的最佳录音。此外,在构建具有情绪感知能力的虚拟角色或辅助沟通设备中,该数据集的双奖励排序方法可被用于实时优化语音输出,使合成语音在模仿特定说话人时能够灵活适应喜怒哀乐等情绪变化,提升人机交互的自然度与亲和力。
数据集最近研究
最新研究方向
该数据集聚焦于文本到语音(TTS)领域中角色化语音表演的合成与评估,特别是通过大规模采样(best-of-64)和双奖励机制,探索语音身份保留与情感表现力之间的权衡。在现代语音克隆与配音技术迅猛发展的背景下,该研究回应了如何从海量候选表演中自动筛选高质量、高保真度表演的核心挑战。通过构建包含英语、德语、西班牙语和法语的多语言、多情感维度的全面评估体系,结合语音嵌入、情感向量等多重指标,为构建具有表现力的语音交互系统提供了关键的数据支撑与计算范式,对推动虚拟角色塑造和个性化语音助理研究具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务