遇见数据集

TTS-AGI/dramabox-gemini-finetune

收藏
Hugging Face2026-06-23 更新2026-07-22 收录
官方服务:

资源简介:

预计算的DramaBox潜在空间训练数据,包含说话人嵌入,用于AdaLN-Zero说话人条件微调。所有样本都是相同说话人的片段对(参考+目标),并带有Gemini 3.5 Flash提示。

Pre-computed DramaBox latent-space training data with speaker embeddings for fine-tuning with AdaLN-Zero speaker conditioning. All samples are same-speaker part pairs (reference + target) with Gemini 3.5 Flash prompts.

提供机构:
TTS-AGI
搜集汇总
数据集介绍
TTS-AGI/dramabox-gemini-finetune 数据集图片
构建方式
该数据集的构建基于DramaBox平台的音频素材,经过精细化的预处理流程形成。首先,从原始多说话人对话场景中提取出同一说话人的参考音频与目标音频片段,确保两者在语音特征上具有高度一致性。随后,利用WavLM-SV模型和Orange-tbr模型分别抽取说话人嵌入向量,并结合DAC-VAE编码器将音频转换为潜在空间表征。所有样本均通过Gemini 3.5 Flash模型生成描述性语音表演提示语,以丰富条件控制信息,最终以WebDataset格式分片存储,共计94个分片,包含9,397个样本。
特点
数据集的核心特点在于其为语音合成与说话人自适应微调提供了高度结构化的潜在空间训练数据。每个样本均包含参考与目标音频的潜在编码、两种不同维度的说话人嵌入向量,以及详尽的元数据字段,如ASR转录、说话人相似度评分、CLAP奖励分数等。所有样本均保证两位音频片段来自同一说话人且相似度不低于0.6,并剔除了歌唱片段与无参考音频的样本,确保了数据质量与任务针对性。此外,样本跨英语、德语、西班牙语、法语四种语言,覆盖多语言语音表演场景。
使用方法
该数据集主要适用于基于AdaLN-Zero说话人条件机制的条件语音合成模型微调。用户可通过WebDataset库加载分片数据,利用内置的DAC-VAE潜在解码器将tgt_latent与ref_latent转换为波形音频,同时结合wavlm_speaker_emb或orange_speaker_emb进行说话人身份控制。提供的JSON元数据中包含的Gemini提示语可直接作为文本条件输入,而ASR转录与说话人相似度信息则可用于辅助训练中的损失计算与质量评估。推荐使用解码示例中的映射函数将.pth文件加载为PyTorch张量,以高效接入现有训练流程。
背景与挑战
背景概述
DramaBox Gemini Fine-Tune数据集由研究团队于近期构建,旨在推动文本到音频生成领域的发展,特别是针对语音表演(voice acting)任务的高质量数据驱动方法。该数据集围绕从DramaBox平台提取的戏剧化音频片段,利用Gemini 3.5 Flash模型增强提示,并预先计算了潜空间表示与说话人嵌入,为基于AdaLN-Zero说话人条件化的微调提供了关键资源。其核心研究问题聚焦于如何通过同说话人参考-目标音频对来提升目标语音的自然度与表现力,从而弥合传统情感语音合成与戏剧表演之间的鸿沟。该数据集包含9397个样本,覆盖英语、德语、西班牙语和法语,通过引入说话人相似度(≥0.6)、MOS评分与CLAP奖励分数等精细指标,显著增强了语音生成系统对角色独特性与情感细腻度的建模能力,对个性化TTS与交互式叙事系统具有重要影响。
当前挑战
该数据集所解决的领域问题挑战在于文本到语音合成中情感与表现力的匮乏,传统TTS系统难以捕捉戏剧化场景中角色身份的微妙转变与情感波动,导致生成的音频缺乏自然感和感染力。构建过程中面临的主要挑战包括:首先,数据预处理需过滤掉无参考音频的“full_only”样本和缺少说话人嵌入的实例,确保每对样本为同一说话人且相似度不低于0.6,这要求大量计算资源进行说话人验证与嵌入匹配;其次,音频分割(参考段与目标段)需精确到秒级,并依赖ASR转录与CUT TO方向提示进行质量控制,以避免时间切分误差导致语义断裂;最后,Gemini提示的多样性、语言覆盖范围及合成潜空间的兼容性均需反复迭代,以保障跨语言与跨场景下的泛化性能。
常用场景
经典使用场景
在语音合成与配音领域,该数据集最为经典的应用场景在于支持基于说话人条件化的文本到音频生成任务。具体而言,研究者可利用其中精心配对的参考音频与目标音频样本,结合预计算的声学潜空间特征与说话人嵌入向量,对具备自适应层归一化零初始化的生成模型进行微调。该数据集提供了超过九千条高质量的同说话人语音片段对,每条样本均包含丰富的结构化元数据,如Gemini优化后的配音提示语、ASR转录文本及多种说话人语义表征,为构建能够忠实复现特定音色与表现力的神经语音合成系统奠定了坚实的训练基础。
衍生相关工作
基于该数据集的结构化特性,已衍生出一系列具有代表性的研究工作,主要集中于三个方向。其一是针对说话人嵌入融合机制的优化探索,研究者利用WavLM-SV与Orange-tbr提供的双重嵌入表征,对比分析了不同加权融合策略对合成语音自然度的影响。其二是基于潜空间约束的语音编辑方法,通过分析目标潜变量与参考潜变量在时间维度上的对齐关系,发展出能够实现局部语气微调而保持全局音色不变的新型编辑框架。其三则是提示语增强的零样本语音生成工作,利用附带的Gemini优化提示语与CLAP奖励分数,建立了一条从自然语言描述到目标语音属性的可解释映射通道,为后续多模态语音理解与生成系统的设计提供了重要数据支撑。
数据集最近研究
最新研究方向
该数据集聚焦于基于潜空间与说话人嵌入的语音合成微调前沿,尤其适配AdaLN-Zero说话人条件控制架构。通过DramaBox提供的9,397组同说话人参考-目标语音对,结合Gemini 3.5 Flash生成的精细配音提示,数据集为多语言、多情感风格的高质量语音克隆与合成提供了精密训练资源。这一研究方向与当前生成式AI在影视配音、有声书制作及虚拟角色交互中的热点应用紧密相连,特别是通过潜空间解耦与语义引导,推动零样本语音合成在保持音色一致性的同时实现表达力飞跃,对跨语种个性化语音生成技术具有重要的基准意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务