遇见数据集

tts-realspeech-sft-en-de

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

LAION TTS Real-Speech SFT(英文+德文,情感平衡)是一个用于文本到语音(TTS)训练的数据集,包含1,947,272条真实录音(非合成语音),总时长6,996小时,来自自由许可的语料库。数据集在40种情感×2种语言上实现了平衡,每种语言每种情感目标为25,000条。英文达到所有40个情感桶的目标,德文有6个情感桶因供应受限而未能达到。每条数据包含:程序化生成的标题(caption)、带有词级时间戳的转录文本(text)、原始音频、以及目标MOSS-Audio-Tokenizer-v2编码(moss_codes,形状为[T, 12]的uint16数组)。数据来源包括Emolia(CC-BY-4.0)、KartoffelPhon(CC-BY-4.0)和Multilingual LibriSpeech(德语部分,CC-BY-4.0);EuroSpeech因许可证问题被排除。数据集还提供了参考音频(ref_uid)用于条件生成,44.6%的行有参考。设计用于情感可控的TTS,配套有偏好数据集laion/tts-realspeech-dpo-en-de。数据列包括uid、role(sft或distractor)、lang、text、caption、emotion_bucket、sel_score、norm_gen、norm_blend、norm_emo、音频、MOSS编码、VoiceCLAP嵌入、speaker_key等。过滤条件包括:语言标签校正、强制对齐成功、时长3-30秒、至少5个词、10个字符、语言内去重等。情感桶选择基于三个条件:百分位≥90%、原始情感强度>1.0、且该情感是标题中列出的前三名之一。

LAION TTS Real-Speech SFT (English + German, Emotionally Balanced) is a dataset for text-to-speech (TTS) training, containing 1,947,272 real recordings (non-synthetic speech) totaling 6,996 hours from freely licensed corpora. The dataset is balanced across 40 emotions × 2 languages, with a target of 25,000 samples per language per emotion. English achieves the target for all 40 emotion buckets, while German falls short for 6 buckets due to limited supply. Each sample includes: procedurally generated caption, word-level timestamped transcription (text), raw audio, and target MOSS-Audio-Tokenizer-v2 codes (moss_codes, uint16 array of shape [T, 12]). Data sources include Emolia (CC-BY-4.0), KartoffelPhon (CC-BY-4.0), and Multilingual LibriSpeech (German part, CC-BY-4.0); EuroSpeech is excluded due to license issues. The dataset also provides reference audio (ref_uid) for conditional generation, with 44.6% of rows having a reference. It is designed for emotion-controllable TTS, accompanied by a preference dataset laion/tts-realspeech-dpo-en-de. Columns include uid, role (sft or distractor), lang, text, caption, emotion_bucket, sel_score, norm_gen, norm_blend, norm_emo, audio, MOSS codes, VoiceCLAP embeddings, speaker_key, etc. Filtering conditions include: language label correction, successful forced alignment, duration 3-30 seconds, at least 5 words, 10 characters, intra-language deduplication, etc. Emotion bucket selection is based on three conditions: percentile ≥ 90%, raw emotion intensity > 1.0, and the emotion is among the top three listed in the caption.

提供机构:
LAION eV
创建时间:
2026-08-23
原始信息汇总

LAION TTS Real-Speech SFT (EN+DE, emotion-balanced) 数据集详情

基本信息

  • 数据规模:1,947,272 条真实录音语音(非合成),总时长 6,996 小时,音频 token 数约 37.6 亿,对齐词数 79,337,527
  • 语言:英语(999,999 条)、德语(947,273 条)
  • 情感覆盖:40 种情感 × 2 种语言,目标每种情感每语言 25,000 条
  • 许可证:CC-BY-4.0
  • 任务类型:文本转语音(text-to-speech)

数据内容与结构

  • 每行包含:程序化生成的描述性 caption、带词级时间戳的文本转录、原始音频、以及 MOSS-Audio-Tokenizer-v2 目标编码
  • role 字段sft(训练目标,1,947,272 条)与 distractor(131,313 条短退化片段,用于 DPO 集合作幻觉延续捐赠材料),训练前必须按此过滤
  • moss_codes:uint16 格式,形状为 [T, 12],每帧 12 个 token,帧时长 80 ms

数据来源与许可审查

语料库 许可证 包含情况
Emolia CC-BY-4.0 英语 + 德语
KartoffelPhon CC-BY-4.0 德语(及少量英语)
Multilingual LibriSpeech CC-BY-4.0 仅德语(27,438 条)
EuroSpeech other(各国议会条款,非开放许可) 已排除,损失约 820,274 条英语和 486,198 条德语语音

情感平衡情况

  • 英语:40/40 情感桶全部达到 25,000 条
  • 德语:34/40 情感桶达到目标;6 个情感桶供应受限(Pain、Sexual Lust、Infatuation、Pleasure Ecstasy、Shame、Embarrassment),其中 Pain 已完全耗尽(免费许可池中全部可用德语片段均已收录)
  • 未使用弱片段填补缺口

选择机制

  • 评分公式norm(genuineness) + norm(blend) + 2 * norm(emotion_strength)(所有项均为经验 CDF 百分位数)
  • 情感桶准入三条件:情感百分位数 ≥ 0.90、原始情感强度 > 1.0、该情感位于片段前 3 名
  • 稀缺优先填充:按稀缺程度从高到低填充,避免稀有情感被其他情感竞争挤掉
  • 已修复的两个缺陷:28 行重复 uid(删去重复副本);1 行 emotion_bucket 与 caption 不符(删除该行)

参考音频

  • 868,583 个片段(44.6%)具有参考音频,来源包括 Emolia 同录音会话、MLS 同说话人、KartoffelPhon 说话人验证模型验证(余弦 ≥ 0.80)
  • 无说话人姓名,speaker_key 为不透明分组 ID

其他说明

  • Caption 修正:修复了极性反转和 1.0 绝对情感门控两个缺陷;每行包含全部数值输入(40 个 emo_*、114 个 vn_*、4 个 qual_* 等),可在无 GPU 情况下重新生成文字描述
  • 过滤规则:仅使用修正后的语言标签(原标签 471 万条错误)、强制对齐成功、时长 3-30 秒、≥5 词、≥10 字符、且去除各语言内完全重复的文本
搜集汇总
数据集介绍
tts-realspeech-sft-en-de 数据集图片
构建方式
该数据集以真实录音为唯一音源,从Emolia、KartoffelPhon及Multilingual LibriSpeech三个遵循CC-BY-4.0许可的语料库中筛选样本,覆盖英语与德语,并围绕40种情感进行均衡化。筛选采用复合评分机制,综合真实性、人声爆发融合度与情感强度三个经验累积分布函数归一化项,其中情感强度赋予双倍权重,并以情感百分位不低于0.90且原始强度大于1.0为双重门限,确保入选片段情感显著而非仅属罕见。分桶时按情感稀缺程度优先填充,每条语音仅归属一个情感桶,最终保留1,947,272条语句,所有样本均经强制对齐校验与时长、词数过滤。
特点
数据集以参考音频与程序化描述文本为条件,目标为MOSS-Audio-Tokenizer-v2离散编码,每帧12个令牌、帧率12.5赫兹,时长与码帧严格对应,并附词级时间戳。描述文本由修正流程重新生成,扭转了原语料中性别的反向极性与背景噪声的错误表述,情感命名比例亦由94.8%降至11.25%,且情感桶标签在描述中百分之百被提及。所有数值型标注均随行提供,涵盖40个情感维度、57个VoiceNet维度及质量指标,便于离线重述描述文本,数据集中不含任何合成语音,音频以原始编码格式内嵌于Parquet文件,未作转码。
使用方法
加载时通过datasets库以流式方式读取,并依据role字段筛选,仅保留role为sft的1,947,272条训练目标,剔除role为distractor的短退化片段。音频字节可直接从audio列的bytes字段解码,MP3与FLAC格式分别对应不同采样率与位深。训练目标码需将moss_codes按小端uint16解包并重塑为帧数乘12的矩阵,作为自回归模型的监督信号。参考音频由ref_uid指向同一发布中的另一片段,可用于构建目标与参考配对,并借助speaker_key划分说话人隔离的训练与评估集。
背景与挑战
背景概述
语音情感合成长期受制于真实录音的稀缺与情感分布失衡,2019年前后兴起的自监督语音表示虽提升了声学建模能力,却未解决训练数据中情感标签粗糙、语言覆盖偏斜等结构性问题。LAION于2024年发布的tts-realspeech-sft-en-de数据集,由该机构联合多所高校的研究人员构建,旨在为英语与德语的情感条件文本转语音提供大规模、情感均衡的真实语音监督信号。该数据集从CC-BY-4.0许可的公开语料中筛选出1,947,272条真实录音,覆盖40种情感,总时长6,996小时,并附带词级时间戳与MOSS-Audio-Tokenizer-v2离散编码,成为当前情感TTS领域规模最大、标注最细的公开资源之一,为情感可控合成与偏好对齐研究提供了关键基础设施。
当前挑战
该数据集所应对的核心领域挑战在于情感条件TTS中长期存在的情感类别分布极度不均衡与真实录音供给受限问题,尤其德语侧因EuroSpeech许可限制而损失逾48万条标注语料,导致Pain等六类情感无法达到预设配额,Pain桶甚至完全耗尽合格样本。构建过程中的挑战同样严峻:需在跨语料异构录音条件下统一语音质量与情感强度标准,纠正源语料中GEND与BKGN极性的系统性反转及绝对情感阈值造成的标签偏差,处理词级对齐失败与文本重复,并在不引入合成语音的前提下维持40类情感×2语言的均衡抽样。这些约束共同推高了数据筛选与验证的复杂度,也决定了最终发布的规模与构成。
常用场景
经典使用场景
在语音合成领域,基于真实录音的监督微调数据对于构建高表现力、情感可控的TTS系统至关重要。tts-realspeech-sft-en-de数据集最经典的使用场景是训练以参考音频和程序化描述为条件的文本到语音模型,具体而言,模型接收目标文本、一段参考说话人片段以及细粒度的情感与韵律描述,学习生成与参考音色一致且情感匹配的语音。该数据集覆盖英语和德语各40种情感,每个样本均配有MOSS-Audio-Tokenizer-v2的离散声学编码,支持自回归声学建模、情感条件生成以及跨语言音色克隆等核心任务。
实际应用
在实际应用中,该数据集可广泛服务于有声内容创作、虚拟助手语音定制、游戏角色配音、无障碍朗读以及跨语言客服系统等场景。开发者能够利用其丰富的参考音频与情感描述,微调出具备细腻情感表达能力的多语言TTS模型,使合成语音在德语和英语环境下均能传递喜悦、愤怒、悲伤等复杂情绪。由于所有音频均来自可自由分发的语料,并附有完整的词级时间戳和声学编码,该数据集亦适用于构建端到端的语音合成流水线,以及评估模型在真实录音条件下的鲁棒性与泛化能力。
衍生相关工作
围绕该数据集衍生了一系列经典工作,包括基于其训练的情感条件TTS模型、DPO偏好优化语音合成系统以及多语言零样本音色克隆方法。配套发布的laion/tts-realspeech-dpo-en-de偏好集进一步推动了基于人类反馈的语音生成对齐研究,而MOSS-Audio-Tokenizer-v2编码的引入则促进了离散声学建模与自回归生成框架的发展。此外,该数据集还催生了针对情感强度归一化、说话人验证参考选择以及程序化描述修正等下游任务的研究,为语音合成领域的可复现性与数据伦理实践树立了参考范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务