遇见数据集

tts-realspeech-dpo-en-de

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

LAION TTS Real-Speech DPO (EN+DE) 是一个用于文本到语音(TTS)偏好学习的多语言数据集,包含英语和德语,共3,959,192个偏好对。每个偏好对由“chosen”(真实录音)和“rejected”(损坏版本)组成,其中损坏通过两种方式生成:提前停止(too_short)或过度延长(too_long)。该数据集基于 laion/tts-realspeech-sft-en-de 语料库构建,旨在为TTS模型提供对比学习信号,帮助模型学习生成更自然的语音。 数据集的构建方法包括: - 对于“too_short”损坏,在语言学合理的边界处(句子、从句或停顿)截断真实录音,保留25-75%的音频,且至少1.5秒和3个单词。 - 对于“too_long”损坏,将真实录音后附加其他材料(不同文本的另一个话语或短退化片段)。 数据集使用MOSS-Audio-Tokenizer-v2,每个帧包含12个令牌,帧率为12.5帧/秒。所有损坏点均对齐到整帧。 数据来源包括: - Emolia(CC-BY-4.0):英语和德语。 - KartoffelPhon(CC-BY-4.0):德语和少量英语。 - Multilingual LibriSpeech(MLS,CC-BY-4.0):仅德语。 选择过程中,使用公式 score = norm(genuineness) + norm(blend) + 2 * norm(emotion_strength) 对行进行排序,其中所有项均为经验累积分布函数(ECDF)百分位数。每个情感桶(emotion_bucket)要求情感强度在全部语料库中处于前10%,且原始强度大于1.0,同时是该片段情感强度排名前三的情感之一。 数据集包含以下字段:pair_id、uid、lang、dataset、emotion_bucket、corruption、caption、text、ref_uid、chosen_moss、chosen_frames、rejected_moss、rejected_frames、moss_n_vq、frame_tokens、cut_kind、cut_word_index、cut_time_s、cut_frame、cut_tokens、donor_uid、donor_kind、donor_frames。 注意事项: - 英语侧99.8%来自Emolia,存在语料库偏差。 - 德语侧由Emolia(约44%)、KartoffelPhon(约53%)和MLS(约3%)混合组成。 - 情感标签来自模型预测,而非人工标注。 - 真实性和混合度在(语料库×语言)内归一化。 - 参考音频覆盖率为44.6%,且大多数参考来自同一会话,可能存在信道混淆。 - 文本重复仅在语言内按精确匹配去除。 - 音频为原始编码格式(MP3或FLAC)。 - 包含Sexual Lust和Pain情感桶,可根据需要过滤。

LAION TTS Real-Speech DPO (EN+DE) is a multilingual dataset for text-to-speech (TTS) preference learning, containing English and German, with a total of 3,959,192 preference pairs. Each preference pair consists of chosen (real recording) and rejected (corrupted version), where corruption is generated in two ways: early stopping (too_short) or excessive prolongation (too_long). The dataset is built upon the laion/tts-realspeech-sft-en-de corpus and aims to provide contrastive learning signals for TTS models to help them learn to generate more natural speech. The construction method includes: for too_short corruption, truncating the real recording at linguistically reasonable boundaries (sentence, clause, or pause), retaining 25-75% of the audio, with a minimum of 1.5 seconds and 3 words; for too_long corruption, appending additional materials (another utterance of different text or short degraded segments) to the real recording. The dataset uses MOSS-Audio-Tokenizer-v2, with 12 tokens per frame and a frame rate of 12.5 frames per second. All corruption points are aligned to whole frames. Data sources include: Emolia (CC-BY-4.0): English and German; KartoffelPhon (CC-BY-4.0): German and a small amount of English; Multilingual LibriSpeech (MLS, CC-BY-4.0): German only. Selection uses the formula score = norm(genuineness) + norm(blend) + 2 * norm(emotion_strength), where all terms are empirical cumulative distribution function (ECDF) percentiles. Each emotion bucket requires emotion strength to be in the top 10% of the entire corpus, with raw strength greater than 1.0, and among the top three emotions of that segment. The dataset contains the following fields: pair_id, uid, lang, dataset, emotion_bucket, corruption, caption, text, ref_uid, chosen_moss, chosen_frames, rejected_moss, rejected_frames, moss_n_vq, frame_tokens, cut_kind, cut_word_index, cut_time_s, cut_frame, cut_tokens, donor_uid, donor_kind, donor_frames. Notes: 99.8% of the English side comes from Emolia, introducing corpus bias; the German side is a mixture of Emolia (~44%), KartoffelPhon (~53%), and MLS (~3%); emotion labels are from model predictions, not human annotations; genuineness and blend are normalized within (corpus × language); reference audio coverage is 44.6%, and most references come from the same session, potentially causing channel confusion; text deduplication is only exact match within language; audio is in original encoding format (MP3 or FLAC); includes Sexual Lust and Pain emotion buckets, which can be filtered as needed.

提供机构:
LAION eV
创建时间:
2026-08-23
原始信息汇总

数据集概述

LAION TTS Real-Speech DPO (EN+DE) 是一个用于文本转语音(TTS)模型偏好优化(DPO)训练的数据集,包含约 395.9 万对偏好样本(3,959,192 pairs),语言覆盖英语和德语。

数据集构成

  • 总样本数:3,959,192 对偏好样本(英语 1,974,660 · 德语 1,984,532)
  • 偏好对结构:每个样本包含一个 chosen(真实录音音频)和一个 rejected(同一音频被破坏的版本)
  • 破坏方式:分为 too_short(提前停止)和 too_long(过度延长)两类,模拟 TTS 模型常见的两种失败模式
  • 来源:基于 laion/tts-realspeech-sft-en-de 构建,使用 MOSS-Audio-Tokenizer-v2 进行音频编码

破坏机制

too_short(截断)

  • 基于词级时间戳,在语言上合理的边界处截断,优先级为:句子 > 子句 > 停顿(≥0.3 秒静音间隙)
  • 截断需保留原话语的 25–75%,且音频 ≥1.5 秒、≥3 个词
  • 截断时间对齐到完整 MOSS 帧(每帧 12 个 token,约 80 ms)

too_long(扩展)

  • chosen 后附加额外音频材料,来源为:
    • 另一句不同文本的话语(50%)
    • 短退化片段(50%,来自 SFT 集中的 distractor 行)

数据来源与许可

语料库 许可 包含情况
Emolia CC-BY-4.0 是(英 + 德)
KartoffelPhon CC-BY-4.0 是(德 + 少量英)
Multilingual LibriSpeech (MLS) CC-BY-4.0 仅德语
EuroSpeech 其他(逐议会条款) 排除

EuroSpeech 因许可问题被排除,原因是其音频受议会版权约束(如英国议会音频为议会版权),不符合开放再分发要求。

情感标签机制

  • 使用 Empathic Insight 模型预测情感,非人工标注
  • 每行进入某情感桶需满足三个条件:
    1. 该情感百分位 ≥ 0.90
    2. 原始得分 > 1.0(排除填充)
    3. 该情感属于该片段的前三大情感
  • 验证结果:100% 的行中,桶情感确实出现在其标题中

关键技术与指标

  • MOSS 编码:每帧 12 个 token(80 ms),非 32 个 —— 已在所有 3,959,192 对上验证无违规
  • 标题生成:使用 capfix.fix_one() 函数,修复了极性反转和绝对情感阈值问题
  • 引用音频:44.6% 的行有参考音频(ref_uid),用于条件生成

主要限制

  • 英语侧单一来源:99.8% 英语行来自 Emolia,存在语料库偏差
  • 语言间材料差异:德语大量基于 LibriVox 有声书,与英语素材格式不同
  • 情感标签为模型预测,非人工标注
  • 无“无主导情感”行:该数据集不包含情感中性样本
  • 音频格式不一:Emolia 和 KartoffelPhon 为 MP3,MLS 为 48 kHz FLAC
  • 包含 Lust 和 Pain 等敏感情感桶,需根据应用场景筛选
搜集汇总
数据集介绍
tts-realspeech-dpo-en-de 数据集图片
构建方式
该数据集立足于真实语音语料库,通过偏好对构建方式揭示文本到语音合成模型在情感表达中的失败模式。其核心构建逻辑源自laion/tts-realspeech-sft-en-de,以每条真实录制话语为chosen样本,并针对同一话语的完整文本,从词级时间戳中定位句子、从句或停顿边界,将音频截断至25%至75%区间,形成“过早停止”型rejected;或以另一条不同文本的语音片段及短退化片段作为附加材料,形成“过度延续”型rejected。截断位置严格对齐至MOSS-Audio-Tokenizer-v2的每一帧,即12个编码本令牌,确保切分点落于12的整数倍,并经全量校验。
特点
该数据集以约396万条偏好对彰显其规模,涵盖英语与德语,并由MOSS音频令牌编码构成,不直接存储波形,而将音频信息压缩为12个码本、12.5帧/秒的离散令牌序列。其显著特点在于:所有rejected均属合成式扰动,即经测量后确认真实语料中缺乏匹配的同文本异情感表达;德语因截断策略而均衡至约198万对;每条记录包含完整的23列属性,如截断类型、截断边界、捐赠者信息及可选的参考音频指针,且通过uid与源SFT数据集保持全量连接。
使用方法
使用该数据集时,研究者可借助Hugging Face datasets库流式加载parquet文件,读取chosen_moss与rejected_moss字段,并按chosen_frames与rejected_frames重塑为[帧数, 12]的uint16矩阵,以获取令牌级表示。若需波形或192列完整标注,可通过uid字段连接至laion/tts-realspeech-sft-en-de数据集,该集提供源音频与扩展注释。提示文本由caption与text拼接而成,chosen与rejected共享同一提示,从而支持直接用于直接偏好优化训练。
背景与挑战
背景概述
语音合成领域长期受困于生成语音与真实录音之间的自然度鸿沟,直接偏好优化(DPO)为弥合这一差距提供了新路径,却苦于缺乏大规模、高质量的真实语音偏好数据。LAION 于 2023 至 2024 年间构建的 tts-realspeech-dpo-en-de 数据集,正是针对该瓶颈推出的英文与德语双语音偏好语料,包含 3,959,192 对偏好样本,以真实录音为 chosen、以可控失真为 rejected,覆盖早停与拖长两类典型失败模式。该数据集依托 MOSS-Audio-Tokenizer-v2 编码,联合 Emolia、KartoffelPhon 与 MLS 三大公开语料,摒弃授权受限的 EuroSpeech,为 TTS 模型的情感表达与韵律控制提供了可复现的偏好监督信号,对推动语音生成从“可懂”走向“自然”具有奠基性意义。
当前挑战
该数据集所回应的领域难题,是自回归 TTS 模型在长文本生成中普遍存在的早停与拖长两类失败,二者直接破坏语音的完整性与节奏感,而真实录音与失真样本的配对在自然语料中几乎不可得。构建过程中则面临多重挑战:其一,真实语料中同文本、同说话人的情感对比样本稀缺,经筛查仅占 0.02%,迫使全部偏好对以合成失真方式构造;其二,德语与英语在语料来源上严重不对等,英语几乎完全依赖 Emolia,德语则混合 LibriVox 有声书,形成语言与语域的混淆;其三,情感标签依赖模型预测而非人工标注,百分位门控仅保证“相对突出”而非绝对真实;其四,参考音频仅覆盖 44.6% 的样本,且部分参考与目标共享录音环境,引入信道偏差。这些局限要求使用者在训练与评估时审慎解读模型表现。
常用场景
经典使用场景
在语音合成与情感计算的交叉领域,基于偏好对齐的生成模型优化已成为提升合成语音自然度与表现力的关键路径。该数据集最经典的使用场景在于直接偏好优化(DPO)训练,即利用大规模配对样本中的优选真实录音与劣质合成扰动版本,引导自回归TTS模型学会区分完整、连贯的语音生成与提前截断或过度延长的错误输出。每一对偏好数据共享完全相同的文本与副语言描述提示,模型需在相同条件下偏好真实语音,从而在解码阶段有效抑制语句中断与冗余延续两类典型失败模式。
衍生相关工作
该数据集衍生了一系列围绕偏好对齐与语音标记建模的经典工作。其构造的DPO配对直接催生了基于MOSS-Audio-Tokenizer的自回归TTS模型在情感表现力上的迭代优化,并推动了以帧级截断边界为监督信号的生成控制方法。所附带的全量数值标注与修正后的程序化描述,亦被用于研究描述条件与语音属性之间的对齐关系,以及基于百分位门控的情感数据筛选策略,为后续多语种情感TTS语料构建提供了可借鉴的技术路线。
数据集最近研究
最新研究方向
在语音合成领域,基于人类偏好对齐的生成模型正成为前沿热点,tts-realspeech-dpo-en-de数据集以近四百万对真实录音与合成损坏的偏好对,为直接偏好优化提供了大规模、跨语言的训练资源。该数据集聚焦于TTS模型在字幕条件下常见的失败模式——过早停止与过度生成,通过语言学边界截断和拼接策略构建对比样本,推动了无需强化学习即可实现的情感可控TTS研究。其意义在于,以MOSS音频标记器的帧级编码为基础,揭示了真实语音语料中自然对比对的稀缺性,并促进了合成损坏作为偏好学习代理的可行性验证。该工作为多语言、情感感知的语音合成系统提供了可复现的评估基准,并引发了对数据许可、参考音频偏差等伦理与实用问题的关注。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务