遇见数据集

TTS-AGI/ears-dramabox

收藏
Hugging Face2026-06-27 更新2026-07-22 收录
官方服务:

资源简介:

EARS DramaBox训练数据集是一个多说话者数据集,包含来自EARS(表达性无混响语音录音)语料库的16,377个样本。该数据集具有约100多个不同的说话者,并使用Gemma-3-4B-IT生成创意、细致的提示。数据以WebDataset格式(.tar分片)存储,每个样本包括8个文件:.json元数据(包含文本、原始文本、持续时间、BUD-E字幕、语音标签、音色字幕、完整提示和聚焦提示)、.mp3音频文件、.tgt_latent.pt目标音频潜在表示、.ref_latent.pt参考音频潜在表示、.cond_full.pt完整提示条件信息、.cond_focused.pt聚焦提示条件信息、.speaker_emb.pt说话者嵌入和.clap_text.pt CLAP文本嵌入。该数据集适用于文本到语音(TTS)任务,支持多种训练配置,如预配对、同说话者交换和独立样本,有效配置总数至少约65,508个。

EARS DramaBox training dataset is a multi-speaker dataset containing 16,377 samples sourced from the EARS (Expressive Anechoic Speech Recording) corpus. This dataset includes over 100 distinct speakers, and creative and detailed prompts are generated using Gemma-3-4B-IT. The data is stored in WebDataset format as .tar shards, with each sample comprising 8 files: a .json metadata file containing text, original text, duration, BUD-E subtitles, speech tags, timbre subtitles, full prompt and focused prompt; a .mp3 audio file; .tgt_latent.pt for target audio latent representation; .ref_latent.pt for reference audio latent representation; .cond_full.pt for full prompt conditioning information; .cond_focused.pt for focused prompt conditioning information; .speaker_emb.pt for speaker embedding; and .clap_text.pt for CLAP text embedding. This dataset is suitable for text-to-speech (TTS) tasks, supporting multiple training configurations such as pre-paired, same-speaker swapping and independent samples, with a total of at least approximately 65,508 valid configurations.

提供机构:
TTS-AGI
搜集汇总
数据集介绍
TTS-AGI/ears-dramabox 数据集图片
构建方式
ears-dramabox数据集源自EARS(富有表现力的无回声语音记录)语料库,专为多说话人文本到语音合成任务而设计。该数据集包含16,377个样本,涵盖约100位多样化的发音人。在构建过程中,利用Gemma-3-4B-IT大语言模型,依据BUD-E字幕和语音元数据生成富有创意且文学化的提示文本。每个样本均包含目标音频、同发音人的参考音频潜变量、由Gemma-3-12B-IT模型提取的完整及聚焦文本条件嵌入、说话人嵌入以及CLAP文本嵌入。数据以WebDataset格式存储,分为33个tar分片,每片约500个样本,便于高效流式加载与分布式训练。
使用方法
使用该数据集时,推荐采用WebDataset库进行高效加载。用户可通过构造分片URL列表,利用wds.WebDataset接口读取,并对每个样本解析JSON元数据与各类型张量文件。数据集支持多种训练配置:预配对模式中每样本自带同发音人参考;同发音人交换可生成额外配对;独立模式则使用两个提示变体将每个样本扩展为两份。用户可灵活提取元数据中的prompt_full和prompt_focused字段作为文本条件,结合speaker_emb与clap_text嵌入,用于训练或微调多说话人语音合成模型。
背景与挑战
背景概述
语音合成技术近年来在自然度和表现力上取得了显著突破,但多说话人、富有表现力的语音生成仍是该领域的核心挑战。EARS DramaBox数据集由TTS-AGI团队于2026年创建,基于EARS(Expressive Anechoic Recordings of Speech)语料库,专为多说话人文本到语音合成任务设计。该数据集包含16377个样本,覆盖100余位不同音色的英语说话人,并利用Gemma-3大语言模型生成富有创意和文学性的提示词,以捕捉语音的细微情感与风格特征。其构建旨在推动从单一、中性语音到多样化、表现力丰富的语音生成的范式转变,为下一代情感化语音助手和有声内容生产提供了关键数据支撑。
当前挑战
该数据集所解决的领域问题主要在于传统TTS系统难以捕捉多说话人的音色差异与情感表达,现有数据集往往缺乏丰富的语音风格标注和细粒度的声学提示。EARS DramaBox借助LLM生成的描述性提示词,将抽象的语音特质(如“深沉的男低音”、“经历岁月沉淀的语调”)转化为可训练的文本条件。在构建过程中,面临的主要挑战包括:确保大规模说话人录音的消声环境一致性,避免背景噪声干扰;设计有效的提示生成策略,使大模型输出的文学性描述既能准确反映声学特征,又不会引入语义歧义;以及压缩高维语音潜在表征(如目标潜变量和参考潜变量)时,平衡保真度与计算效率。
常用场景
经典使用场景
在语音合成领域,EARS DramaBox数据集被广泛用于多说话人文本到语音(TTS)系统的训练与评估。该数据集汇聚了来自EARS语料库的逾百位英语说话人,提供了超过1.6万个高质量的语音样本,每个样本均包含目标音频、参考音频、说话人嵌入及由大语言模型生成的精细文本条件。研究者常利用其精心设计的提示策略(包括完整提示与聚焦提示),探索如何通过语义丰富的文本描述来精准控制合成语音的韵律、情感与音色,从而在保持高自然度的前提下实现多样化的语音风格迁移。
解决学术问题
该数据集的核心贡献在于解决了多说话人TTS系统中的语音表达性与可控性难题。传统TTS模型往往难以在合成过程中融入细腻的情感色彩与语境信息,而EARS DramaBox通过引入基于Gemma大模型生成的文学化提示(prompt),将语音的声学特征与高层语义描述相关联,从而为建模语音的韵律变化、情感色调和说话人身份提供了更为丰富的监督信号。这一设计有效缓解了数据标注成本高昂与语音风格单一的问题,推动了条件化语音合成从简单标签(如说话人ID)向语义引导的演进,为语音生成的可解释性与多样性研究开辟了新路径。
实际应用
在实际产业应用中,EARS DramaBox数据集为一系列语音交互产品提供了技术支持,包括有声书与广播剧的自动配音、虚拟主播和数字人语音生成,以及个性化语音助手的定制。凭借其多说话人、多风格的特性,开发者可借助该数据集训练出能够根据剧本情感走向自动调整语气与节奏的语音合成模型,显著降低人工录音成本。此外,数据集中的聚焦提示可用于生成特定场景下的语音指令,例如智能家居中轻柔的唤醒请求或车载系统中紧急的导航提示,从而在人机交互中赋予机器更自然、更具感染力的声音表达。
数据集最近研究
最新研究方向
在语音合成领域,EARS DramaBox数据集的最新研究方向聚焦于通过大语言模型生成的高质量文本描述来推动多说话人、高表现力语音合成的边界。该数据集基于EARS语料库,收录了超过100位英语母语者的约1.6万条录音样本,并利用Gemma-3系列模型生成了兼顾声学细节与语义情感的精细提示词,从而实现了对语音风格、音色与叙述语气的精准控制。这一工作与当前生成式AI在可控语音生成、个性化TTS及语音角色扮演等热点方向紧密相连,为构建能够理解并模仿复杂人类交流场景的下一代语音界面提供了关键训练资源,也推动了多模态大模型在语音生成任务中的实用化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务