遇见数据集

dramabox-edge-top3-voice

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

DramaBox edge-case reward-Top-3 语音标注数据集包含 1,494,503 条合成表达性语音话语,源自 DramaBox 边缘案例语料库的奖励模型 Top-3 选择。数据集提供了四类注释:(a)经过修正爆发音的 CrisperWhisper 格式转录文本,其中每个保留的爆发音均带有来自 laion/vocal-burst-detector-v2 的分类名称及其原始时间戳;(b)来自 laion/Empathic-Insight-Voice-Plus 的原始语音评分,包括全话语粒度和每个句子粒度的 40 种情绪、57 个 VoiceNet 维度、真实性、爆发音混合度及 4 个质量评分;(c)基于这些评分生成的程序化字幕,包含 <GENERAL> 和 <SCRIPT> 标签,带有按句子的语调提示(圆括号内)、内联爆发音类别名称(圆括号内)以及停顿时长(方括号内);(d)与元数据对齐的源音频,以 WebDataset tar 分片形式提供,48 kHz 单声道 MP3 编码,160 kbps。数据集总大小约 802 GiB(其中音频约 796 GiB,11,840 小时),分为 128 个分片。所有五个元数据家族(transcripts、scores、bursts、captions、audio)通过 id 字段连接。该数据集适用于自动语音识别(ASR)、文本转语音(TTS)、音频分类、语音情感分析、爆发音检测等任务。需要注意的是,爆发音的时间戳来自 ASR 模型而非人工标注,分类标签准确率有限(argmax 准确率约 58.1%),且类别分布高度集中在少数标签上(前三类占保留爆发音的 72.5%)。字幕可通过仅读取 scores 数据并运行 CPU 脚本重新生成,无需音频或 GPU。

The DramaBox edge-case reward-Top-3 speech annotation dataset contains 1,494,503 synthetic expressive speech utterances derived from the reward model Top-3 selection of the DramaBox edge-case corpus. The dataset provides four types of annotations: (a) CrisperWhisper-formatted transcribed text with corrected vocal bursts, where each retained burst includes a classification name from laion/vocal-burst-detector-v2 and its original timestamp; (b) raw speech scores from laion/Empathic-Insight-Voice-Plus, including 40 emotions, 57 VoiceNet dimensions, authenticity, burst mixture, and 4 quality scores at both utterance and sentence granularity; (c) programmatic captions generated from these scores, containing <GENERAL> and <SCRIPT> tags with per-sentence intonation cues (in parentheses), inline burst category names (in parentheses), and pause durations (in brackets); (d) source audio aligned with metadata, provided as WebDataset tar shards, 48 kHz mono MP3 at 160 kbps. The total dataset size is approximately 802 GiB (audio ~796 GiB, 11,840 hours), divided into 128 shards. All five metadata families (transcripts, scores, bursts, captions, audio) are linked via the id field. The dataset is suitable for tasks such as automatic speech recognition (ASR), text-to-speech (TTS), audio classification, speech emotion analysis, and vocal burst detection. Note that burst timestamps come from an ASR model rather than manual annotation, classification label accuracy is limited (argmax accuracy ~58.1%), and the class distribution is highly concentrated on a few labels (top 3 classes account for 72.5% of retained bursts). Captions can be regenerated by reading only the scores data and running a CPU script, without requiring audio or GPU.

提供机构:
LAION eV
创建时间:
2026-08-02
原始信息汇总

DramaBox edge-case reward-Top-3 — 语音标注数据集

数据集概览

该数据集包含 1,494,503 条合成表现性语音片段(DramaBox edge-case 语料库的 reward-Top-3 筛选结果),并附带四种类型的标注:CrisperWhisper 格式的转写文本(含修正后的声音爆发标注)、两种粒度的原始语音评分、程序化生成的 <GENERAL> + <SCRIPT> 字幕,以及逐字节一致的源音频。

数据规模与格式

  • 总大小:802 GB(其中音频 796 GiB)
  • 音频:48 kHz 单声道 MP3,160 kbps,总时长 11,840 小时,平均片段长度 28.5 秒
  • 分片结构:128 个分片,五个数据家族(audio、transcripts、scores、bursts、captions)通过 id 字段("{group_key}.s{seed}")对齐,分片间无需全局索引。

数据家族(Configurations)

1. transcripts(转写)

  • 包含修正后的 CrisperWhisper 转写,声音爆发以 [Class Name] 形式呈现
  • 提供词级时间戳(words 字段包含 token、起止时间、是否为爆发、句子索引)
  • 爆发标注使用 v2 分类器的类别名称,保留原始时间戳

2. scores(评分)

  • 全局评分:57 维 VoiceNet 回归值(0-6)、40 种 Empathic-Insight 情感、4 项质量评分、真实性(0-6)、声音爆发混合度(0-10)、性别门控值
  • 句子级评分:每个句子(≥8 词)独立评分,共 6,284,328 个句子中 4,588,699 个(73.0%)被评分
  • 评分是一级产物,字幕生成仅依赖此数据,可在 CPU 上几分钟内重新生成

3. bursts(声音爆发)

  • 包含所有原始声音爆发片段(包括被丢弃的),共 5,401,483 个
  • 字段包括:原始 CrisperWhisper 标签、v2 分类器 top-1 类别及概率、无爆发概率、top-5 结果、保留/丢弃原因、所属句子索引
  • 丢弃原因包括:时长不足 200ms(62.0%)、无爆发判定(0.05%)、时间戳异常(0%)

4. captions(字幕)

  • 程序化生成的 <GENERAL> + <SCRIPT> 双段式字幕
  • 句子包含 (圆括号) 中的表达提示、声音爆发类别名,以及 [方括号] 中的停顿标记(阈值 0.35 秒)
  • 元数据记录字幕生成的可复现信息(基线文件哈希、生成器提交版本等)

构建流程

  1. 时长筛选:丢弃所有短于 200ms 的爆发片段
  2. 重新验证:使用 laion/voiceclap-commercial 嵌入 + laion/vocal-burst-detector-v2 分类,5 个折叠类别在 softmax 前被掩码,p(no_burst) ≥ 0.5 的片段被否决
  3. 重新评分:使用 laion/Empathic-Insight-Voice-Plus 对每个话语和 ≥8 词的句子评分
  4. 字幕生成:使用 LAION-AI/procedural-voice-captions 的 in-domain 基线统计和可靠性权重

关键统计

指标 数值
保留爆发片段 2,053,108(占输入片段的 38.0%)
重新验证片段 2,054,127
被否决片段(p(no_burst) ≥ 0.5) 1,019(0.05%)
输入片段中位数时长 0.16 秒(低于 200ms 筛选阈值)

保留爆发片段的类别分布(前 3 类占 72.5%):Low Mumble(26.2%)、Ahem(24.9%)、Contented Sigh(21.4%)

模型信息

角色 模型
转写、时间戳、爆发检测(上游,未重跑) CrisperWhisper-large-v2
爆发分类器 laion/vocal-burst-detector-v2
嵌入器 laion/voiceclap-commercial
57 维语音维度 laion/voicenet-dimension-predictors-commercial
真实性评分 laion/voiceclap-commercial-genuineness
爆发混合度 laion/voiceclap-commercial-vocalburst-blend
40 情感 + 4 质量 + 性别门控 laion/Empathic-Insight-Voice-Plus
字幕生成器 LAION-AI/procedural-voice-captions@4064baf10704

已知局限性

  • 爆发时间戳来自 ASR 模型,未经人工验证,边界误差 100ms 不可见
  • 爆发类别标签是分类器的 top-1,该分类器在其自身验证集上 argmax 准确率仅 58.1%,约五分之二的标签在类别级别是错误的
  • 类别分布高度集中:82 个类别中仅 56 个被预测到,前三类覆盖 72.5% 的保留爆发
  • CrisperWhisper 粗标签与 v2 细类别的一致性较低(可映射标签仅 24.9%),尤其是 yawn(0.2%)、sniff(0.6%)、cough(1.8%)等类别,这种不一致可能源于模型差异而非真实错误

使用建议

  • ASR 训练:音频有意制造了理解难度,转写和修正后的爆发标签使其具有训练价值
  • 音频加载:需使用 tarfile 流式加载(提供了 Python 代码示例),避免使用 webdataset 库的默认 key 分割逻辑
  • 字幕再生成:可仅通过 CPU 运行 derive_captions.py,无需音频和模型下载,支持更换基线和模板
  • 文本增强:使用 augment.py 进行表面模板、同义词轮换、维度洗牌等增强,实现"评分一次、字幕多次"
搜集汇总
数据集介绍
dramabox-edge-top3-voice 数据集图片
构建方式
该数据集源自DramaBox边缘案例语料库的奖励模型Top-3筛选,汇聚了逾149万条合成表现性语音片段。其构建流程匠心独运,并未重复执行语音识别或爆发音定位,而是对既有CrisperWhisper-large-v2输出进行深度再加工。首先,对时长不足200毫秒的爆发音片段予以剔除;继而,借助laion/voiceclap-commercial嵌入器与laion/vocal-burst-detector-v2分类器,对存续片段实施重校验,掩蔽折叠类并依据p(no_burst)阈值否决候选。随后,采用Empathic-Insight-Voice-Plus模型,对每条话语及不少于八个词的句子进行细粒度语音评分,涵盖40种情绪、57维VoiceNet特征、真实性、爆发音融合度及四项质量指标。最终,依据评分数据,经由procedural-voice-captions工具包,自动生成包含<GENERAL>与<SCRIPT>两部分的程序化字幕,并嵌入逐句表演提示与爆发音类别标注。
特点
此数据集之特色在于其多维度的精细标注与匠心独运的架构设计。语音评分被视作一级产物,而非中间步骤,字幕生成仅依赖评分数据,可于CPU上快速重算,无需音频或GPU资源。音频数据以WebDataset tar分片形式存储,与元数据分片严格对齐,确保消费者无需全局索引即可流式访问。爆发音标注历经严格门控,涵盖原始跨度、分类器Top-5概率及丢弃原因,使得不同阈值或门控策略可事后灵活调整,无需重新计算。此外,数据集明确记录了构建过程中的统计特性,如200毫秒时长阈值对爆发音分布的影响,以及标注模型间的分歧程度,为使用者提供了透明、可追溯的元信息。
使用方法
数据集提供多种使用路径。对于语音识别任务,其包含的CrisperWhisper格式转录文本与修正后的爆发音标签,使得原本艰涩难懂的合成语音变得可利用。对于语音情感识别或语音分类任务,研究者可加载scores配置,获取细粒度的多维评分向量,并依据评分自行设计标签体系。对于文本到语音或语音字幕生成任务,captions配置中的程序化字幕可直接用作训练目标。音频数据需通过提供的tarfile流式读取方法加载,规避了WebDataset默认按键分割可能导致的样本错分组问题。同时,字幕可通过derive_captions.py脚本从评分数据重新生成,支持替换基线或调整模板,以满足多样化的文本增强需求。
背景与挑战
背景概述
DramaBox-edge-top3-voice数据集由LAION等机构于2024年创建,旨在为情感语音合成与识别领域提供大规模、精细标注的合成语音资源。该数据集精选了DramaBox边缘案例语料库中奖励模型评分最高的前三条语音,共包含1,494,503条表达性语音片段,并配套了纠正后的CrisperWhisper转录文本、82类声乐爆发事件标注、多层次情感与音质评分以及程序化生成的语音描述。其核心研究问题在于弥合合成语音与真实情感表达之间的鸿沟,推动语音情感识别、语音合成及语音描述生成等方向的发展。该数据集的发布为研究者提供了一个高质量且规模庞大的基准,有望显著促进语音情感计算领域的进步。
当前挑战
该数据集面临多重挑战。在领域层面,语音情感识别与合成长期受限于真实语音数据稀缺、情感标注主观性强及细粒度声学事件(如叹息、笑声)难以精确捕捉等问题;本数据集虽提供大规模合成语音及多维度标注,但合成语音与真实语音的域差异仍未完全解决。构建过程中,挑战尤为突出:首先,声乐爆发事件标注依赖于ASR模型的时间戳,边界精度受限;其次,爆发分类器在自有验证集上的top-1准确率仅为58.1%,类别标签存在显著噪声;再者,200毫秒时长阈值过滤导致短时爆发事件(如轻咳、呼吸)系统性缺失,且类别分布高度集中,前三大类占比超七成,细粒度类别多样性不足。最后,情感与语音质量评分模型在短句(<8词)上可靠度下降,大量句子未获得评分,限制了数据的全面利用。
常用场景
经典使用场景
该数据集主要服务于语音领域的多模态研究,其核心应用场景涵盖自动语音识别(ASR)、文语转换(TTS)以及音频分类任务。鉴于其内嵌了精细的语音爆发事件标注(如笑声、叹息、咳嗽等)以及丰富的韵律与情感维度评分,研究者可利用这些高精度时间戳和类别标签,开展针对非言语声音事件的检测与分类研究。同时,数据集中程序化生成的<GENERAL>与<SCRIPT>描述文本,为语音到文本的跨模态生成提供了天然的平行语料,尤其适用于训练具备情感和表演风格的TTS系统,以及提升ASR模型在含大量语气词、语音爆发及情感表达的真实对话场景中的鲁棒性。
解决学术问题
该数据集直面语音研究中长期存在的几个核心挑战:一是非言语声音事件(如哽咽、笑声、叹息)在传统ASR转录中常被忽略或错误标注,导致下游自然语言理解任务失真;本数据集通过融合CrisperWhisper的粗粒度标签与专用检测器的细粒度类别,实现了对语音爆发事件的精细标注与校订,为事件检测的算法对比提供了基准。二是语音情感与韵律的量化描述缺乏统一标准,该数据集通过引入覆盖40种情绪、57个VoiceNet维度的细粒度评分体系,量化了语音的表现力特征,为情感识别、语音合成中的表达控制等研究提供了大规模监督信号。三是数据集的程序化描述设计,使得从评分到自然语言描述的生成过程可复现、可定制,推动了可解释语音分析技术的发展。
衍生相关工作
该数据集的构建理念和方法论已催生了一系列衍生研究方向。其开创性地将语音评分与程序化文本生成相结合的模式,启发了后续关于‘可解释语音特征’的探索,推动了从隐式语音表征到显式语义描述的统一框架研究。具体而言,基于其语音爆发检测和分类的精细化流程,研究者已开发出更鲁棒的非言语声音事件检测器,并在对话系统研究中融入对 laughter 和 sigh 等事件的响应机制。同时,其发布的评分体系和基线模型,引起了关于语音情感维度与自然语言描述之间映射关系的广泛讨论,促进了跨模态提示学习、语音-文本联合嵌入等技术的发展。值得注意的是,该数据集的规模与标注深度也为评估大型语音模型在情感理解与生成方面的能力提供了重要测试平台,推动了语音领域基础模型的发展与评测体系的完善。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务