遇见数据集

tts-scaling-ladder-de-en

收藏
Hugging Face2026-09-12 更新2026-09-13 收录
官方服务:

资源简介:

TTS Scaling Ladder DE/EN 是一个为缩放定律实验设计的多层级、平衡、开放许可的语音数据集。它包含八个严格嵌套的层级(tier0 至 tier7)和一个独立的 held-out 评估集。每个层级在语言(德语/英语各 50%)和来源(真实录音/合成语音各 50%)上完全平衡,并在 40 个 EmoNet 情感类别和 57 个 VoiceNet 声音维度上均匀分层。总数据量从 tier0 的 100 小时扩展到 tier7 的 20,000 小时,held-out 集有 80 小时。每个样本包含 MP3 音频、音频令牌代码和 JSON 记录。该数据集适用于文本到语音(TTS)模型训练、语音转换、音频基础模型预训练、情感和声音属性分析以及缩放定律研究。

TTS Scaling Ladder DE/EN is a multi-tier, balanced, openly licensed speech dataset designed for scaling law experiments. It comprises eight strictly nested tiers (tier0 to tier7) and a separate held-out evaluation set. Each tier is perfectly balanced by language (50% German, 50% English) and source (50% real recordings, 50% synthetic speech), and evenly stratified across 40 EmoNet emotion categories and 57 VoiceNet voice dimensions. Data volume ranges from 100 hours in tier0 to 20,000 hours in tier7, with an 80-hour held-out set. Each sample includes MP3 audio, audio token codes, and a JSON record. The dataset is suitable for text-to-speech (TTS) model training, voice conversion, audio foundation model pretraining, emotion and voice attribute analysis, and scaling law research.

提供机构:
LAION eV
创建时间:
2026-09-12
原始信息汇总

TTS Scaling Ladder DE/EN 数据集总结

一、数据集概述

TTS Scaling Ladder DE/EN 是一个用于 TTS(文本转语音)、语音转换及音频基础模型缩放律(scaling-law)实验的嵌套式八层语音数据集。所有层级均为严格嵌套关系(Tier N ⊂ Tier N+1),每层满足以下平衡特性:

  • 语言:50/50 德语/英语
  • 来源:每种语言内部 50/50 真实/合成
  • 分层:在上述四个单元格内,分别按 40 个 EmoNet 情绪类别均匀分布(流程 A)和 57 个 VoiceNet 声音维度 × 10 分位数均匀分布(流程 B)
  • 选择性:最小层级最具选择性,包含最极端的情绪和最高质量样本

二、数据集基本信息

项目 内容
许可证 混合许可证(CC-BY-4.0 / CC-0 / EuroSpeech / other,按来源区分)
语言 德语(de)、英语(en)
任务类别 text-to-speech、audio-classification、audio-to-audio
标签 speech、tts、voice-conversion、scaling-laws、emotion、voice-attributes、vocal-bursts、moss、webdataset
规模 1M < n < 10M
数据集地址 https://huggingface.co/datasets/laion/tts-scaling-ladder-de-en

三、层级结构

tier 每语言小时数(DE / EN) 总计 用途 本版本元素数 本版本小时数
0 50 / 50 100 微核心、基线、超参数搜索 41,771 100.0
1 125 / 125 250 小型收敛测试 100,858 249.9
2 250 / 250 500 声学特征饱和 197,662 500.1
3 500 / 500 1,000 计算最优锚点(1×) 382,768 1,000.0
4 1,250 / 1,250 2,500 2.5× 912,789 2,500.1
5 2,500 / 2,500 5,000 1,764,990 5,000.4
6 5,000 / 5,000 10,000 10× 3,425,099 10,000.7
7 10,000 / 10,000 20,000 全语料基准,20× 6,666,998 20,001.5
held-out 40 / 40 80 评估集,与所有层级不相交,同分层 25,639 80.1
  • 嵌套关系:Tier N ⊂ Tier N+1 为构造性保证。整个版本仅存储一次(tier-7 存量 + held-out,共 6,692,637 个元素,20,081.6 小时,2,694 个分片,1.04 TB tar 文件),每个元素带有 tier 列表示包含它的最小层级索引。
  • Held-out 划分:按与层级完全相同的规则抽取,与所有层级不相交(tier = 8,通过 uid 验证零重叠),位于 data/*/*/heldout/index/*/*/heldout/,loader 配置为 heldout

四、数据配置(Configs)

  • tier0tier7:分别为 tier0tierN 目录的并集
  • heldout:评估集
  • de:单一语言(德语),所有层级
  • en:单一语言(英语),所有层级
  • real:真实来源数据
  • synth:合成来源数据

五、数据加载方式

通过 datasets 库加载

python from datasets import load_dataset R = "laion/tts-scaling-ladder-de-en" t0 = load_dataset(R, "tier0") # 100 h t1 = load_dataset(R, "tier1") # 250 h t2 = load_dataset(R, "tier2") # 500 h t3 = load_dataset(R, "tier3") # 1,000 h t4 = load_dataset(R, "tier4") # 2,500 h t5 = load_dataset(R, "tier5") # 5,000 h t6 = load_dataset(R, "tier6") # 10,000 h t7 = load_dataset(R, "tier7") # 20,000 h ev = load_dataset(R, "heldout") # 80 h de = load_dataset(R, "de")

数据内容

每个元素包含:

  • 音频:MP3 格式(与源仓库逐字节一致)
  • MOSS 编码uint16 [T, 12],12.5 fps
  • JSON 记录:包含程序化配音提示(LAION-AI/procedural-voice-captions 格式,含 GENERAL 行和带逐句表达提示的 SCRIPT、[pause X.Xs] 标记和内联 (Vocal Burst) 标签),以及原始评分、语言、来源、源 uid、源许可证和时长

每个元素的 tar 成员:<uid>.mp3<uid>.moss.npy<uid>.json

解码注意事项

  • vprof_originalvprof_repair 来源为 48 kHz MP3,含两个相同声道,需用 soundfile/torchaudio 解码后取 mean(axis=channels)切勿使用 reshape(-1)(会产生半速信号,长度翻倍)。其他来源均为单声道。audio_sraudio_channels 在索引中。

六、选择规则

许可证过滤(评分前)

真实来源emolia(DE+EN)、mls(仅 DE)、eurospeech(DE+EN)、kartoffelphon(DE)、commonvoice(仅 DE 和 EN 子集)。

合成来源laion-voice-profiles-annotatedorigin=originalorigin=repairvc_sidon)、laion/voice-acting-edge-top3laion/voice-acting-reinterpretations-top3(MOSS 版本)。

排除podcastsnippetsevasnippets、所有 Mediathek 内容、无文档许可证内容、laion/voice-acting-burst-audiolaion-emotional-trajectory-t80laion/moss-voice-identity-repairs

评分

所有指标按语言 × 来源单元格进行最小-最大归一化。关键指标包括 S_gen(真实度)、S_vb(混合度)、40 个 EmoNet 情绪维度得分、57 个 VoiceNet 维度得分。R_quality = S_gen + S_vbR_emotion(e) = 3·S_emo,e + R_quality

分层

每个单元格(语言 × 来源)在两条流程间对半分割:

  • 流程 A(EmoNet,40 类别):按 R_emotion(e) 排序,定义嵌套强度带(band 0–7),主排序为(band 升序,然后 R_quality 降序)。每类别配额为流程 A 体积的 1/40。
  • 流程 B(VoiceNet,57 维度 × 10 分位数 = 570 桶):每个维度值域切分为 10 个等宽区间,桶内按 R_quality 排序。每桶配额为流程 B 体积的 1/570。
  • 去重:元素仅计数一次。固定顺序:先流程 A(40 类别按字母序),后流程 B(570 桶按可用候选小时数升序,稀缺优先)。
  • 嵌套:按主排序遍历,累积小时数,元素获得 tier = min{N : cum_h ≤ q(N) + dur/2}

七、各来源许可证

来源 origin 音频许可证 备注
emolia real CC-BY-4.0
commonvoice real CC-0 仅 DE + EN 子集
eurospeech real other — 议会条款各异 由项目负责人明确发布
kartoffelphon real CC-BY-4.0 约 51% 为 LibriVox 公有领域
mls real CC-BY-4.0 仅德语
vprof_original synth CC-BY-4.0;生成器 Apache-2.0 500 个合成声音档案
vprof_repair synth CC-BY-4.0 身份检查失败的重新录制
vc_sidon synth CC-BY-4.0;Chatterbox VC (MIT) + SIDON vprof_original 同一 take 的语音转换孪生
dramabox_edge synth CC-BY-4.0 266 个手写边缘案例
dramabox_reint synth CC-BY-4.0 MOSS 重新诠释版本

若使用场景不接受 other 许可证,可过滤 licenseCC-BY-4.0 / CC-0(将移除 eurospeech;层级仍嵌套但不再严格平衡)。

八、平衡性(小时数)

各层级平衡

tier DE EN real synth
0 50.0 50.0 50.0 50.0
1 125.0 125.0 124.9 125.0
2 250.0 250.0 250.0 250.0
3 500.0 500.0 500.0 500.0
4 1,250.0 1,250.1 1,250.0 1,250.1
5 2,500.0 2,500.3 2,500.1 2,500.2
6 5,000.3 5,000.5 5,000.3 5,000.4
7 10,000.6 10,000.9 10,000.6 10,000.9
held-out 40.1 40.1 40.0 40.1

各(单元格,流程)目标值(tier 0–7):12.5 / 31.25 / 62.5 / 125 / 312.5 / 625 / 1,250 / 2,500 小时。64 个层级值最大偏差 0.204%;8 个 held-out 值最大偏差 0.238%,均在 0.25% 内。

各来源小时数(tier 7 + held-out)

来源 DE real EN real DE synth EN synth
commonvoice 170.0 (131,515) 69.6 (57,578)
dramabox_edge 156.3 (19,747) 2,547.5 (310,985)
dramabox_reint 52.5 (12,805) 61.4 (15,617)
emolia 2,091.4 (669,330) 4,915.0 (1,505,156)
eurospeech 608.1 (140,828) 32.8 (7,916)
kartoffelphon 2,116.6 (611,467) 2.9 (923)
mls 34.1 (7,889)
vc_sidon 2,050.7 (709,047) 690.4 (394,290)
vprof_original 2,218.8 (747,642) 1,338.1 (651,627)
vprof_repair 542.0 (351,342) 383.3 (346,933)

九、提示(Prompt)结构

rec["prompt"] / 索引 promptLAION-AI/procedural-voice-captions 的 captioner 离线生成(main 分支,PR #4:17 类 ×2 头和基于能量的停顿校正),tags 模板,确定性种子 = stable_hash(uid)

  • GENERAL:按 |z|·可靠性取前 5 个 VoiceNet 维度、前 3 个情绪、真实度、爆发混合,始终包含年龄/性别/音域/语速,相对于打包的域内基线进行 z 标准化。
  • SCRIPT:每句一行 (delivery cue) sentence text。句子在对齐词的句末标点处切分。每句提示均源自片段的全局评分(记录存储句子时间戳以便后续逐句重新评分)。措辞按句子确定性轮换。
  • [pause X.Xs]:连续词或句子之间 ≥ 0.30 秒的间隔,基于存储的词时间戳经基于能量的词尾校正后测量(end_span 保留原始值)。词时间戳来自语料对齐(LAION 语料用 MMS-FA,DramaBox 来源用 Parakeet)。
  • (Vocal Burst):源标注中保留的定位器/分类器 v2 跨度,写在发生处的词间隔(BURST_LABEL_SOURCE=v2)。prompt_x2 为使用 17 类 x2 头命名跨度的同一提示(BURST_LABEL_SOURCE=x2,按召回分层的措辞:精确类别 / Class? / 家族词 / Vocal Burst),存在于有 vb2_* 重新标注的元素中(6,692,637 个元素中的 3,689,357 个)。

十、执行者假设

规范中留空、由执行者采用的两项假设:

  1. 两条流程各占 50%:每个单元格内,一半体积由流程 A 填充,一半由流程 B 填充。
  2. 单一存储、单一 tier:整个版本仅存储一次,每个元素携带 tier = 包含它的最小层级。Tier K 定义为 tier <= K,嵌套由构造保证而非通过提供八份重叠副本来实现。

其余执行者选择(池定义、分位数边界、去重顺序、桶不足处理、语言判定)在规则中标记为 [A]

搜集汇总
数据集介绍
tts-scaling-ladder-de-en 数据集图片
构建方式
该数据集依托明确的开源许可筛选流程,从多个真实与合成语音语料库中采集素材,涵盖Emolia、Common Voice、Eurospeech、Kartoffelphon、MLS等真实来源及LAION语音配置文件、DramaBox等合成来源。构建过程中,所有音频均经过去重、语言判定和统一评分,并以最小-最大归一化方法在每种语言与来源单元内计算质量与情感分数。随后,数据按照两条并行管道进行分层:管道A依据40类EmoNet情感类别均匀采样,管道B依据57个VoiceNet声音维度及其十分位数均匀采样,最终通过嵌套式层级结构生成从tier0至tier7的递增数据集,每一层级均为下一层级的严格子集,确保数据规模与质量之间的可控递进。
特点
该数据集的核心特征在于其嵌套式、平衡且公开许可的八级语音阶梯结构。每一层级均保持德语与英语各占一半,每种语言内真实与合成语音各占一半,并在四种单元内进一步按情感类别和声音维度均匀分层。最小层级tier0聚焦于最极端的情感与最高质量的样本,而更高层级则逐步纳入更广泛的情感与声音属性。所有数据元素均附带音频、MOSS音频标记码和结构化JSON记录,包含程序化语音表演提示、原始评分、语言、来源及许可信息,为TTS、语音转换及音频基础模型的缩放律实验提供了精细可控的资源。
使用方法
该数据集通过Hugging Face datasets库加载,用户可依据实验需求选择不同层级的配置,如tier0至tier7分别对应从100小时至20000小时不等的语音数据,另有heldout配置用于评估。每个层级的数据可通过索引文件定位至对应的WebDataset tar包,其中包含MP3音频、MOSS标记码及JSON记录。用户亦可使用webdataset库进行流式读取,或通过语言配置如de和en筛选特定语种的全部层级。加载时需注意部分来源为48 kHz双声道MP3,应取声道均值以避免解码错误。该数据集适用于缩放律研究、语音合成、语音转换及音频分类等任务,训练时应避免使用heldout分割以确保评估的独立性。
背景与挑战
背景概述
语音合成领域长期受限于高质量多语言数据集的匮乏,规模定律研究难以在受控条件下系统展开。tts-scaling-ladder-de-en由LAION团队构建,于2024年前后发布,旨在为TTS、语音转换及音频基础模型的规模定律实验提供嵌套式数据阶梯。该数据集以德英双语各占半壁、真实与合成音频均等为特色,分层覆盖40类EmoNet情感与57维VoiceNet声学属性,最小层级聚焦极端情感与最高质量样本。其影响力在于首次以严格嵌套结构支撑从100小时至20000小时的跨规模训练与评估,为语音生成模型的缩放行为研究树立了可复现基准。
当前挑战
该数据集所应对的领域问题在于TTS与语音转换模型在跨语言、跨情感及跨声学属性条件下的规模定律尚不明确,缺乏可控变量以分离数据量、数据质量与数据多样性的贡献。构建过程中,研究者需在开放许可约束下整合异源语料,处理德语与英语语料分布不均衡、合成语音与真实录音的声学域差异、重复样本与语言混合样本的剔除、情感与声学属性的分层配额分配,以及嵌套层级在去重与配额舍入下的严格子集保持。此外,48kHz双声道源的解码一致性、逐句提示线索的全局分数映射、以及边界元素的微调平衡均构成显著技术挑战。
常用场景
经典使用场景
在语音生成与音频基础模型的纵深探索中,该数据集最为经典的应用场景是充当缩放定律实验的精密阶梯。八层嵌套子集允许研究者在严格递增的数据规模下(100至20000小时)系统考察模型性能随数据量的变化规律,其中tier3被设计为计算最优锚点。每层内部德英双语、真实与合成语音、四十类情感及五十七维声音属性的均匀分层,使得控制变量式的对照实验成为可能,从而精确衡量数据规模本身对语音合成质量与泛化能力的贡献。
衍生相关工作
该数据集已催生了一系列围绕数据缩放与语音属性建模的经典工作,包括基于相同分层框架的语音合成缩放定律实证研究、利用其情感分层结构的情感可控TTS系统,以及借助VoiceNet维度均匀采样提升声音转换鲁棒性的方法。其配套的LAION-AI/procedural-voice-captions工具被广泛用于程序化配音提示生成,而基于该数据集训练的音频基础模型在零样本语音克隆与副语言迁移任务中展现出显著优势,进一步推动了开放语音数据生态的标准化进程。
数据集最近研究
最新研究方向
面向语音生成模型缩放规律的系统性探索,tts-scaling-ladder-de-en数据集通过构建八层严格嵌套、德英双语均衡、真实与合成语音各半的阶梯式语料库,为TTS及音频基础模型的性能可预测性研究提供了可控的实验平台。该数据集在每一层级内对40类EmoNet情感与57维VoiceNet声纹特征进行分层采样,使研究者能够精确考察模型容量、数据规模与生成质量之间的幂律关系,并推动语音转换、情感语音合成及声学特征饱和效应的量化分析。其开源多许可证架构与MOSS音频标记的集成,亦为可复现的缩放定律研究及跨语言语音生成基准的建立提供了关键基础设施,对语音合成领域的资源分配与模型设计具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务