遇见数据集

laion-voice-profiles-sft

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

LAION Voice Profiles — TTS监督微调集是一个用于参考条件文本转语音(TTS)的大规模指令微调数据集。该数据集包含1,200,531个样本,源自500个合成语音档案,每个档案包含842个表演条件组,每组48个候选样本,仅保留基于情感强度、真实感和混合度评分最高的3个样本。每个样本均以MOSS音频标记器v2的码本形式提供(12个码本,帧率为12.5fps),而非原始波形。数据集支持两种条件模式:参考音频+描述,或说话者名称,分别用于语音克隆和语音记忆训练。数据规模为6.3 GB,语言包含英语和德语。数据选择过程详细说明了评分公式(情感强度权重加倍)、参考剪辑的余弦相似度阈值(≥0.60)以及避免固定配对的设计。此外,数据集还提供了独立的程序化描述生成机制,以纠正原始注释中的错误,如极性反转和情感门控问题。该数据集适用于语音克隆、个性化TTS、情感语音合成等任务。

LAION Voice Profiles — TTS Supervised Fine-tuning Set is a large-scale instruction fine-tuning dataset for reference-conditioned text-to-speech (TTS). It contains 1,200,531 samples derived from 500 synthetic voice profiles, each with 842 performance condition groups, and each group having 48 candidate samples, retaining only the top 3 samples based on scores for emotional intensity, realism, and blending. Each sample is provided in the form of MOSS Audio Tokenizer v2 codebooks (12 codebooks, frame rate 12.5fps), not raw waveforms. The dataset supports two conditioning modes: reference audio + description, or speaker name, for voice cloning and voice memory training respectively. Data size is 6.3 GB, with languages including English and German. The data selection process details a scoring formula (emotional intensity weight doubled), cosine similarity threshold for reference clips (≥0.60), and design to avoid fixed pairings. Additionally, the dataset provides an independent programmatic description generation mechanism to correct errors in original annotations, such as polarity reversal and emotional gating issues. This dataset is suitable for tasks such as voice cloning, personalized TTS, and emotional speech synthesis.

提供机构:
LAION eV
创建时间:
2026-08-23
搜集汇总
数据集介绍
laion-voice-profiles-sft 数据集图片
构建方式
该数据集源自500个合成语音画像,每个画像在英德双语下经历同一套固定表演条件矩阵,完整保留所有候选生成结果。构建者从每个语音的842个表演条件组中,以情感强度双倍加权、真实感与爆发混合各占一权的评分公式,对每个条件的48个候选样本进行排序,最终选取最优3条。参考音频刻意取自同语音但不同组的另一条样本,并以说话人嵌入余弦相似度不低于0.60为门槛进行配对,同时采用校正后的重标注树重新提取MOSS音频编码与词级强制对齐,确保时长与编码帧数一致。
特点
数据集包含1,200,531条指令微调样本,覆盖500个语音画像,以MOSS音频分词器v2的12层残差矢量量化码本形式提供目标与参考音频,而非波形。每条记录同时携带参考音频加说明和说话人姓名两种条件提示,可同时训练声音克隆与声音记忆。数据附带词级强制对齐、校正后的完整标注以及生成器原生评分,并显式提供说话人相似度与参考相似度,便于下游重新筛选。情感表达的强度经过刻意加权选择,使语料整体呈现高度情感化的表演特征。
使用方法
使用时应先读取Parquet文件中的二进制字段,将目标与参考编码按指定的uint16小端格式和帧数重塑为帧乘12的矩阵,再借助MOSS音频分词器解码为可听波形。若需原始音频,可通过uid字段关联至标注语料库中的对应MP3。训练时可将prompt_reference或prompt_name直接作为条件输入,也可将instruction_caption替换至指令槽以训练说明跟随能力。所有评分列与归一化项均随行提供,支持用户按自定义权重重新排序或施加额外的说话人相似度门槛。
背景与挑战
背景概述
语音合成领域长期追求从参考音频中克隆音色并复现表演风格,但公开数据多聚焦于朗读式语音,缺乏对情感强度与抑制维度的精细控制。LAION于2025年前后发布laion-voice-profiles-sft,由Christoph Schuhmann与LAION团队构建,基于500个合成声音画像、842种表演条件,从每条件48个候选生成中择取最优3个,形成约120万条参考条件化TTS指令微调样本。该数据集以MOSS音频码本替代波形,首次将声音克隆与声音记忆双重提示统一于同一语料,为情感表演建模和说话人身份解耦提供了大规模结构化基准,对生成式语音社区具有显著推动意义。
当前挑战
该数据集所应对的领域问题,是在参考条件化语音合成中同时实现音色克隆、情感表演与说话人身份保持,其难点在于情感强度与抑制维度的可控生成、参考音频与目标说话人之间的身份一致性,以及跨语言表演条件的泛化。构建过程中的挑战尤为突出:原始标注层因半速解码缺陷导致全部时长与情感维度失真,需以生成器元数据与重标注树双重校验并重新提取MOSS码本;说话人身份对名义参考的相似度整体偏弱,中位仅0.445,迫使参考选择改为同声音内部跨组匹配,并需以0.60余弦阈值在4400万跨声音对中控制误配率;情感门控在不同情感头尺度差异极大时需采用百分位归一化,避免绝对阈值失效。这些挑战共同塑造了该数据集在噪声控制与结构化标注上的独特难度。
常用场景
经典使用场景
在语音合成与声音克隆领域,参考条件式文本到语音(reference-conditioned TTS)建模长期依赖成对录音数据,而该数据集以五十组合成声音档案为基元,为每条声音的八百四十二种表演条件筛选出四十八个候选片段中最优的三条,并为每一条样本随机配对同一声音在不同情绪组中的另一片段作为参考。模型由此可在推理时仅凭一段参考音频与文本描述复现目标音色,或仅凭说话人姓名直接唤起固化音色,从而同时支撑声音克隆与声音记忆两条经典训练路径。
实际应用
在工程实践中,该数据集可直接服务于个性化语音助手、有声内容创作与游戏角色配音等场景。训练所得模型能够依据参考音频迁移音色,并遵循细粒度情绪指令完成表演,例如以强烈而外露的情感念白,或以克制内敛的方式传递张力。其以MOSS音频编解码令牌而非波形存储的特性,使数据在磁盘与内存占用上更为紧凑,便于大规模分布式训练流水线直接消费,亦可通过用户标识字段与标注语料中的原始波形无缝衔接。
衍生相关工作
该数据集衍生出一系列相互衔接的经典工作。其同源直系偏好优化数据集以成对优选与淘汰样本训练模型对齐人类偏好;五百组声音档案的低秩适配器与参考片段仓库使研究者得以按声复现特定音色;而完整的两千零一十二万余条带音频标注语料则为更广泛的多任务语音研究提供了底座。上述工作与重标注树、编解码器及生成模型共同构成一条从数据构建、监督微调到偏好对齐的完整技术链路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务