遇见数据集

laion-voice-profiles-dpo

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

该数据集名为LAION Voice Profiles — TTS DPO pairs,由Christoph Schuhmann和LAION创建,用于文本到语音(TTS)的直接偏好优化(DPO)训练。数据集包含3,451,531个偏好对,每个对共享一个提示(prompt),但chosen和rejected样本在构建方式上不同。数据集基于500个合成语音配置文件,每个配置文件通过固定矩阵的表演条件(如情感和VoiceNet维度)生成大量候选语音,从中选取chosen和rejected。数据集分为三个配置: - emotion:包含1,064,594个对,旨在教导模型为特定语句选择正确的情感语气。rejected样本是同一语音和同一语句,但以错误的情感剂量或维度级别生成。 - truncation:包含1,186,406个对,旨在教导模型不要过早停止。rejected样本是chosen样本在句边界处截断的版本,基于词级强制对齐。 - continuation:包含1,200,531个对,旨在教导模型不要产生幻觉延续。rejected样本是chosen样本后附加同一语音的短失败生成片段。 每个记录都包含两种条件模式(prompt_reference和prompt_name),以及SFT数据集的所有元数据。数据字段包括MOSS代码(12个码本,12.5帧/秒)、强制对齐词边界、情感/维度注释、生成器评分等。数据集还提供了具体的代码示例用于materializing rejected样本,以及在训练中使用两种条件模式的方法。注意:emotion配置的rejected样本直接以字节形式提供,而truncation和continuation的rejected样本需要根据规则从chosen样本生成。

This dataset is called LAION Voice Profiles — TTS DPO pairs, created by Christoph Schuhmann and LAION, used for direct preference optimization (DPO) training of text-to-speech (TTS). It contains 3,451,531 preference pairs, each sharing a prompt, but the chosen and rejected samples differ in construction. The dataset is based on 500 synthetic voice profiles, each generating a large number of candidate voices through a fixed matrix of performance conditions (such as emotion and VoiceNet dimensions), from which chosen and rejected samples are selected. The dataset is divided into three configurations: emotion (1,064,594 pairs, aimed at teaching the model to select the correct emotional tone for a specific utterance), truncation (1,186,406 pairs, aimed at teaching the model not to stop too early), and continuation (1,200,531 pairs, aimed at teaching the model not to produce hallucinated continuations). Each record contains two conditioning modes (prompt_reference and prompt_name), along with all metadata from the SFT dataset. Data fields include MOSS codes (12 codebooks, 12.5 frames per second), forced alignment word boundaries, emotion/dimension annotations, and generator scores. The dataset also provides specific code examples for materializing rejected samples and methods for using the two conditioning modes in training. Note: The rejected samples for the emotion configuration are provided directly in byte form, while those for truncation and continuation need to be generated from the chosen samples according to rules.

提供机构:
LAION eV
创建时间:
2026-08-23
搜集汇总
数据集介绍
laion-voice-profiles-dpo 数据集图片
构建方式
本数据集构建于500个合成语音档案之上,每个档案由同一参考说话人驱动,穿越英语与德语中固定表演条件矩阵,完整保留所有候选生成结果而非仅取优胜者。生成器采用LAION自研的MOSS-TTS局部Transformer模型,声码器为MOSS-Audio-Tokenizer-v2,运行标签为PPILOT2。全部偏好对经由机器自动构建,三个子族分别从同一批顶级候选中提取,选取与拒斥样本共享同一提示,确保对比信号精确聚焦于目标维度的差异。构建过程中对MOSS编码重新分词,以编码器自身时长测量为基准,规避了已知的半速解码缺陷,从而保障了所有时长与编码帧数的内在一致性。
特点
数据集包含约345万条偏好对,划分为情感、截断、续写三个功能族,分别教授模型精准传达语句情感基调、避免过早停止生成、以及抑制幻觉式续写。情感族完整交付双侧编码,截断与续写族则以规则形式存储拒斥样本,仅需一行代码即可实现物化还原。每条记录同时携带参考音频与说话人名称两种条件模式,并附带完整的SFT元数据。数据以MOSS音频编解码器的码本形式存储,不含原始波形,帧长为80毫秒,每帧12个令牌,严格对齐至整数帧边界。
使用方法
使用本数据集时,需借助numpy按小端无符号16位整数解析编码列,重塑为帧数乘以12的矩阵。情感族可直接提取双侧编码;截断族的拒斥样本为选定编码按cut_frames截取的前缀;续写族的拒斥样本则由选定编码与供体编码拼接而成。音频波形需访问laion-voice-profiles-annotated数据集,通过chosen_uid与rejected_uid定位对应tar包成员。训练时可将指令性描述插入条件槽位以学习字幕跟随,或直接使用内置提示模板进行偏好优化。
背景与挑战
背景概述
语音合成领域长期追求情感表达的细腻控制与生成稳定性,但缺乏大规模、细粒度的偏好数据。LAION Voice Profiles—TTS DPO数据集由Christoph Schuhmann与LAION团队于2024年构建,包含3,451,531个偏好对,源自500个合成语音画像,旨在通过直接偏好优化(DPO)教导模型在情感渲染、截断与续写三个维度上区分优劣。该数据集聚焦于语音克隆与情感语音合成中的核心问题,即如何让模型精确匹配文本所需的情感强度并避免提前终止或幻觉续写。其发布为TTS领域的强化学习与偏好对齐提供了重要的数据基础,推动了语音生成质量评估与可控合成的研究。
当前挑战
该数据集所应对的领域挑战在于:情感语音合成需在相同文本下精准调控情感维度与强度,而截断与续写则要求模型学会在恰当位置终止并避免无根据的延续,这些均是当前TTS系统难以稳定实现的问题。构建过程中的挑战更为具体:情感偏好对需从同一语音的多次生成中筛选出目标情感差距至少0.15的样本,并排除因参考音频不匹配而丢弃的样本,导致约30%的候选组被过滤;截断与续写偏好对则依赖强制对齐与失败片段拼接,且需处理因解码错误导致的旧版标注缺陷,确保所有MOSS编码均基于修正后的重新标注。此外,程序化字幕的极性错误与情感门控的归一化问题亦增加了数据构建的复杂性。
常用场景
经典使用场景
在语音合成与偏好对齐领域,该数据集最经典的使用场景乃是直接偏好优化(DPO)训练。借助情感、截断与延续三个子集所构建的百万级偏好对,模型得以在相同提示下对比“优选”与“劣选”语音编码,从而精炼其生成策略。情感子集令模型学会为特定台词匹配恰当的情绪浓度与维度水平;截断子集教会模型避免在句子边界过早终止;延续子集则引导模型抑制幻觉式续写,确保输出在正确音色下自然收束。此三族偏好数据共同构成一套面向文本转语音的高效强化学习框架。
解决学术问题
该数据集直面语音合成研究中若干长期悬而未决的难题。首先,它通过精确的规则化负样本构造,解决了偏好数据稀缺且难以规模化获取的困境,使DPO在TTS领域的应用成为可能。其次,情感子集以最小对形式提供了同一句子在不同情绪剂量与维度下的对照样本,为情绪可控合成研究提供了严谨的评测基础。再者,截断与延续子集分别针对生成过早终止与幻觉续写这两类典型失败模式,为模型鲁棒性研究提供了可量化的诊断工具。其意义在于将偏好学习从文本领域拓展至语音编码空间,推动了语音生成与人类偏好的对齐。
衍生相关工作
该数据集衍生了一系列经典工作,推动了语音偏好学习生态的繁荣。其基座SFT数据集laion-voice-profiles-sft为监督微调提供了同一批合成音色的高质量样本,与DPO数据集形成互补。标注数据集laion-voice-profiles-annotated保留了全部两千万条候选语音及音频,为研究生成多样性与选择策略提供了完整素材。音色LoRA仓库laion-voice-profile-loras-500则允许研究者在特定音色上快速适配,催生了众多个性化语音合成应用。此外,MOSS音频分词器与本地Transformer生成器的开源,使得端到端语音偏好训练流程得以复现与改进,后续工作在此基础上探索了更精细的情绪控制与解码策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务