遇见数据集

dramabox-reinterpretations-top3

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

该数据集名为DramaBox reinterpretations,是基于合成语音的数据集,包含约10,000个表演提示(acting prompts),每个提示由TTS模型(laion/moss-tts-local-transformer-4.55b-voice-acting-v2)重新表演64次,并仅发布每个提示中奖励最高的前3个片段,总计约30,000个音频片段。数据集的文本来源为合成表演语料库,混合了英语和德语,包含大量不流畅、词内断句和非连贯内容,典型文本如“Morgan, we are in a negotiation of physical gravity and climbing, which, while just div- any negotiation…”。该数据集适用于自动语音识别(ASR)训练(转录准确但音频困难)、韵律和表达性语音建模、声音爆发检测以及最佳-N 奖励机制研究。数据分为两个部分:当前发布的是边缘案例部分(edge-case half),包含10,000组/30,009个片段,覆盖262个边缘类别(ec000~ec261);第二部分(非边缘材料)正在生成中,将增加约9,980组,最终总计约20,000组。数据以 WebDataset 格式存储(data/top3-NNNN.tar),每个片段包含一个 MP3 文件和对应的 JSON 元数据。JSON 字段包括奖励值(reward_v1c)、奖励组成部分、组内排名、WER、持续时间、ASR 文本、单词级时间戳、字幕、混合度(blend_0_10)、真实性(genuineness_0_6)、情感相似度、EmoNet 40维特征、VoiceNet 57维特征、质量4维特征、声音爆发检测结果(起止时间、类型)以及完整提示和源标识。生成时使用了 v3 情感 LoRA 适配器(TTS-AGI/moss-emotion-loras-v3),其中8个情感(如愤怒、疲惫、恐惧等)用于边缘案例部分。奖励计算为四个组成部分(情感相似度、目标情感、声音爆发混合、真实性)的加权平均乘以 (1 - WER)。数据集中46.8%的候选包含至少一个声音爆发,中位WER为0.17。所有数据均为合成音频,分数由模型输出,未经过人工评估。top-3选择导致数据分布偏向奖励分布的上尾,用于无偏分析应使用原始64候选版本。

The dataset is named DramaBox reinterpretations, a synthetic speech dataset containing approximately 10,000 acting prompts, each re-performed 64 times by a TTS model (laion/moss-tts-local-transformer-4.55b-voice-acting-v2), and only the top-3 highest-reward clips per prompt are released, totaling about 30,000 audio clips. The text source is a synthetic acting corpus, mixing English and German, with abundant disfluencies, intra-word breaks, and incoherent content, e.g., Morgan, we are in a negotiation of physical gravity and climbing, which, while just div- any negotiation…. It is suitable for ASR training (accurate transcription but difficult audio), prosody and expressive speech modeling, vocal burst detection, and best-N reward mechanism research. The data is split into two parts: the currently released edge-case half contains 10,000 groups / 30,009 clips covering 262 edge categories (ec000~ec261); the second part (non-edge material) is being generated, adding about 9,980 groups, totaling ~20,000 groups. Data is stored in WebDataset format (data/top3-NNNN.tar), each clip includes an MP3 file and corresponding JSON metadata. JSON fields include reward value (reward_v1c), reward components, in-group rank, WER, duration, ASR text, word-level timestamps, subtitles, blend_0_10, genuineness_0_6, emotion similarity, EmoNet 40-dim features, VoiceNet 57-dim features, quality 4-dim features, vocal burst detection results (start/end times, type), and full prompt and source identifier. Generation used v3 emotion LoRA adapters (TTS-AGI/moss-emotion-loras-v3), with 8 emotions (e.g., anger, exhaustion, fear) for the edge-case half. The reward is computed as a weighted average of four components (emotion similarity, target emotion, vocal burst blend, genuineness) multiplied by (1 - WER). 46.8% of candidates contain at least one vocal burst, median WER is 0.17. All data is synthetic audio, scores are from model outputs without human evaluation. The top-3 selection biases the distribution toward the upper tail of the reward distribution; for unbiased analysis, the original 64-candidate version should be used.

提供机构:
LAION eV
创建时间:
2026-08-04
原始信息汇总

DramaBox Reinterpretations — Reward-Ranked Top 3 of 64

数据集概览

该数据集包含约 10,000 个表演提示(acting prompts),每个提示由 laion/moss-tts-local-transformer-4.55b-voice-acting-v2 模型重新演绎 64 次,并从中选取奖励得分最高的 3 个版本 发布。总计约 30,000 个音频片段,按 262 个不同的边缘案例类别ec000ec261)大致均匀分布。

⚠️ 注意:本版本为“边缘案例半区”(10,000 组 / 30,009 个片段)。第二个半区(9,980 组,基于非边缘 DramaBox 材料)正在生成中,完成后将添加到同一仓库,使总数达到约 20,000 组。在数据更新前,请以 manifest.parquet 中的实际数字为准。

文本内容警告

  • 脚本来自合成表演语料,混合英语和德语,包含大量不流畅、词中停顿和非连续性内容
  • 典型示例:"Morgan, we are in a negotiation of physical gravity and climbing, which, while just div- any negotiation…"
  • 适用于:ASR 训练(转录文本对困难音频准确)、韵律与表达建模、声音突发检测、Best-of-N 奖励研究
  • 不适用于:任何假设文本为规范语言的场景
  • 中位 WER 为 0.17,仅 1.6% 的候选片段能完全正确转录——这主要源于源文本的不流畅,而非模型失败

数据文件结构

路径 说明
data/top3-NNNN.tar WebDataset 分片:每个片段含一个 .mp3 和一个 .json
data/top3-NNNN.parquet 每分片清单(key、reward、WER、duration、blend、genuineness、burst count)
manifest.parquet 所有分片合并后的总清单

Key 格式<src_id>.top<rank>,rank ∈ {1, 2, 3},按奖励降序排列。

每个片段的 JSON 包含

  • 奖励相关:reward_v1creward_parts(s/t/b/g)、rank_in_group
  • 音频指标:werdurationasr_textwords(词级时间戳)
  • 情感/语音属性:blend_0_10genuineness_0_6emo_simemonet(40 维)、voicenet(57 维含回归值、桶和自然语言标签)、quality(4 维)
  • 突发检测:bursts(起止时间、时长和类型)
  • 提示信息:prompt_captionprompt_generalprompt_script
  • 源身份:src_idsrc_durationcategory

注意:源音频未重复包含于此,src_id 需对照 DramaBox 暂存语料库解析。

生成模型与 LoRA 适配器

  • 基础模型laion/moss-tts-local-transformer-4.55b-voice-acting-v2
  • LoRA 适配器TTS-AGI/moss-emotion-loras-v3,rank 32 / alpha 64,含 40 种情绪适配器
  • 其中 8 种情绪(Anger、Fatigue_Exhaustion、Fear、Malevolence_Malice、Pain、Sadness、Sexual_Lust、Teasing)驱动本语料库的边缘案例半区,按组热切换
  • 适配器切换成本约 0.021 秒(268 个模块),相对生成过程几乎无开销
  • ⚠️ 适配器基于 v2 训练,在旧版检查点上无法正常工作

奖励机制

R = (1.00·s + 1.25·t + 1.00·b + 1.00·g) / 4.25 · (1 − min(WER, 1))

各分量说明:

  • s:基于 42 维特征(40 维 EmoNet + arousal + valence)的余弦相似度,对照源片段——检测“是否重新演绎了相同情绪”
  • t:目标情绪 sigmoid(在 64 个候选组内做 z-score)
  • b:声音突发混合 sigmoid(语料库鲁棒 z-score)
  • g:真实性 sigmoid(语料库鲁棒 z-score)

两个关键设计决策

  1. WER 门槛采用乘法而非除法:约 3/4 候选片段核心得分为负,除法形式会奖励转录错误。独立验证显示,字面 WER × quality 过滤导致 1000 个片段中 602 个得分为 0(60% 的 WER 为 0.00),选出了转录更差的一半。sigmoid 压缩后核心得分严格为正,× (1 − WER) 对每个候选单调递减。
  2. 目标情绪在组内而非语料库内做 z-score:40 个 EmoNet 维度中 20 个语料库 MAD ≤ 0.02,5 个为 0.0,语料库整体上不偏向任何特定情绪,语料库鲁棒 z-score 会除以约 0 而爆炸。组内 z-score 符合组内排序的语义。混合和真实性 MAD 良好(256k 片段上分别为 0.625 和 1.601),保留语料库鲁棒 z-score 以保持跨组可比性。

观测分布(38,400 候选样本,top-3 选择前)

指标 均值 p10 中位数 p90
reward_v1c 0.411 0.265 0.424 0.560
WER 0.329 0.067 0.170 0.444
blend_0_10 2.154 0.000 1.656 4.966
genuineness_0_6 1.656 0.635 1.503 2.945
时长(秒) 15.45 9.44 14.40 21.36

46.8% 的候选片段包含至少一个检测到的声音突发(平均每片段 0.81 个)。

标注说明

  • ASR:CrisperWhisper 2 large,逐字模式,词级时间戳。选择该模型是因为转录文本本身就是交付物,而不仅是排序信号。
  • 声音突发:先定位再分类,最短时长下限 200 ms时间戳是可靠部分;类别名称是较弱的模型先验——分类器对连续语音中的突发不可靠,容易偏向 sigh/gasp/ahem。请基于时间跨度筛选,将标签视为提示。
  • 情感/语音属性:基于 VoiceCLAP 编码器的 MLP 头输出(EmoNet 40、VoiceNet 57、quality 4、genuineness、blend)。均为模型输出,非人工评分。

注意事项

  • 全部为 TTS 模型生成的合成音频,包括任何表面的背景或录音特征
  • 所有分数均为模型输出,未进行人工评估
  • Top-3 选择意味着本发布版是奖励分布的上尾,无偏分析请使用 raw-64 伴生版本
  • top3 标志已在 400 个组上与 reward_v1c 的新排序验证,400/400 完全一致

许可证

other。基于 DramaBox 表演提示语料库的合成生成物衍生。在研究之外的用途前,请自行核查所在司法辖区的相关规定。

搜集汇总
数据集介绍
dramabox-reinterpretations-top3 数据集图片
构建方式
该数据集源于对DramaBox表演提示语料的深度再诠释,通过先进的语音合成模型(laion/moss-tts-local-transformer-4.55b-voice-acting-v2)结合八种特定情感LoRA适配器,对约10,000个表演提示各自执行64次独立演绎,并以综合奖励函数筛选出每次演绎中得分最高的三条,最终形成包含约30,000个音频剪辑的高表现力语音语料。构建过程严格遵循奖励排名机制,奖励函数融合了情感相似度、目标情感强度、声音爆发融合度及自然度等多维度指标,并经过精细的数学处理确保评分稳健性,从而在庞大的候选池中精准提取出显著优于平均水平的演绎片段。
特点
该数据集的核心特色在于其极端的边缘案例覆盖与丰富的标注信息,涵盖262个不同类别,专门聚焦于非典型、情感负载的语音表达,包括大量不流畅、中途断词及非连贯性文本,真实反映了语音表演中的自然多样性。每个音频剪辑均附带详尽的元数据,包括奖励分数、语音识别文本、词级时间戳、情感向量、声音特征及声音爆发段标注,为多维度语音分析提供了坚实基础。值得注意的是,数据集中46.8%的片段包含声音爆发事件,且所有音频均为合成生成,确保了高度可控的实验环境,同时其奖励分布的上尾特性为研究最佳-of-N选择策略提供了独特视角。
使用方法
该数据集适用于多种语音相关任务,尤其适合自动语音识别(ASR)训练,其准确转录的困难音频可有效提升模型的鲁棒性;亦可用于韵律与表现力建模、声音爆发检测及最佳-of-N奖励机制研究。研究者可利用提供的词级时间戳和丰富情感标注进行细粒度分析,或通过配套的原始64候选版本(raw64)进行无偏奖励分布研究。使用时需注意文本的非规范性,避免将其用于依赖良构语言的场景。数据以WebDataset分片和Parquet清单形式提供,便于高效加载与处理,同时需遵循其自定义许可证,适合研究与合规范围内的应用。
背景与挑战
背景概述
DramaBox-reinterpretations-top3数据集由LAION研究团队于2024年创建,旨在应对表达性语音合成与语音情感识别领域中的关键瓶颈。该数据集基于DramaBox表演提示语料,利用先进的moss-tts局部Transformer模型,对约10,000个表演提示进行64次重诠释,并选取奖励评分最高的前三名结果,最终形成包含约30,000个音频片段的语料库。核心研究问题在于如何通过最佳N采样策略与奖励建模,自动生成高度逼真且情感丰富的语音表演。该数据集的发布为表达性TTS、语音动作识别及情感计算等领域提供了大规模、多样化的训练资源,对推动语音智能体的自然交互具有重要影响力。
当前挑战
数据集面临的挑战多元且深刻。领域层面,语音情感表达建模需应对源文本的杂乱性(包括英德混合、非流利与中断),这要求模型在噪声中捕捉真实韵律;同时,奖励函数设计需规避数学陷阱,如多重共线性及对转录错误的偏置,确保选择结果的可靠性。构建过程中,需处理大规模生成的计算开销,以及跨组情感适配器高效切换带来的工程复杂性;此外,音频标注依赖自动语音识别与模型预测,不可避免引入误差,需通过细致的统计检验(如WER门控)平衡精度与鲁棒性。这些挑战共同塑造了数据集在驱动技术边界上的独特价值。
常用场景
经典使用场景
该数据集以约10,000组边缘案例的表演提示为基础,每组经64次重演后按奖励分数筛选出前三名,共计约30,000个高质量语音片段。其核心用途聚焦于情感表达语音合成(Expressive TTS)与语音表演建模研究,尤其针对戏剧化、非流利且混杂英德双语的合成语音。研究者可借此探索不同情感适配器(如愤怒、恐惧等八种边缘情绪)对生成语音的表现力影响,并利用其包含的丰富元数据(如奖励分解、词级时间戳、情绪维度)开展多模态语音生成的质量评估与优化研究。
衍生相关工作
围绕该数据集已衍生若干经典工作,包括构建基于奖励的Top-N重排策略以优化语音合成输出,研究多种情感LoRA适配器在边缘情绪下的行为差异,以及开发针对合成语音的精细质量评估工具(如CrisperWhisper的ASR标注流程)。此外,其公开的原始64次重演全部数据(raw64版本)也支撑了关于奖励分布、采样偏差及生成多样性的系统性分析,彰显了大规模合成语料在推动语音技术前沿研究中的价值。
数据集最近研究
最新研究方向
该数据集聚焦于语音合成与情感表达的前沿探索,通过大规模重演绎与奖励排序机制,推动表现性TTS(文本到语音)研究。其核心贡献在于构建了一个包含约3万条高质量、情感丰富的语音片段的数据集,每条片段均源自同一文本的64次多样化重演,并依据多维度奖励函数(涵盖情感相似度、目标情感匹配度、声音爆发强度及自然度)筛选出前三名。该数据集不仅支持ASR(自动语音识别)在含犹豫、中断等非流利语音上的鲁棒性训练,还促进了情感语音合成、声音爆发检测及奖励模型设计等方向的研究。其创新性的“最优N选”策略,为语音生成的质量评估与自动优化提供了新范式,对推动个性化、高表现力语音交互系统的发展具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务