遇见数据集

laion-emotional-trajectory-t80

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

LAION情感轨迹语音数据集(T≥0.80层级)是一个用于表达性文本转语音(TTS)和音频分类任务的大规模语音数据集。该数据集包含319,765个交叉淡入淡出的语音轨迹,总计4,482音频小时,源自1,598,825个原始片段。每个轨迹是由同一说话人的5个连续话语组成的短序列,其测量到的情感或声音特征从语料库分布的一端单调移动到另一端,且至少跨越整个语料库范围的80%,相邻片段之间的步长不超过25%。音频片段以等功率交叉淡入淡出方式连接成连续音频文件,并使用MOSS-Audio-Tokenizer-v2重新编码为12个码本×1024的token序列,帧率为12.5 fps。每个轨迹携带两级描述:内联的逐片段剧本式描述(包含情感和声音描述符)以及基于渲染音频整体评分的通用描述(分为仅含VoiceNet维度的a变体和含情感词的b变体)。数据集主要来源于vprof_vc(利用Chatterbox-VC和SIDON生成的合成语音配置文件)和emolia(YODAS衍生的情感语音),其中vprof_vc占99.99%。语言主要为英语和德语,但需注意轨迹的语言标签仅取自第一个片段,实际约92.6%的轨迹混合了两种语言。数据集采用WebDataset格式存储,每个tar包包含音频、MOSS token和JSON元数据,同时提供parquet元数据表便于筛选。适用任务包括情感语音合成、语音情感识别、声音特征变化建模等。数据集采用CC-BY-4.0许可证,但合成语音部分有特殊说明。注意:vprof_vc轨迹是构造而非真实观察,情感分类器绝对精度较低,且情感子句因40维门控机制而普遍存在。

The LAION Emotional Trajectory Speech Dataset (T≥0.80 tier) is a large-scale speech dataset for expressive text-to-speech (TTS) and audio classification tasks. It contains 319,765 cross-faded speech trajectories totaling 4,482 audio hours, derived from 1,598,825 original segments. Each trajectory is a short sequence of 5 consecutive utterances from the same speaker, where the measured emotional or voice characteristics monotonically shift from one end of the corpus distribution to the other, spanning at least 80% of the entire corpus range, with a step size between adjacent segments not exceeding 25%. Audio segments are concatenated into continuous audio files using equal-power cross-fading and re-encoded into 12 codebooks × 1024 token sequences using MOSS-Audio-Tokenizer-v2 at a frame rate of 12.5 fps. Each trajectory carries two levels of description: inline per-segment script descriptions (including emotion and voice descriptors) and a general description based on overall rendering audio scoring (divided into a variant with only VoiceNet dimensions and a b variant with emotional words). The dataset mainly originates from vprof_vc (synthetic speech profiles generated using Chatterbox-VC and SIDON) and emolia (emotional speech derived from YODAS), with vprof_vc accounting for 99.99%. The languages are primarily English and German, but note that the language label of each trajectory is taken only from the first segment; in reality, approximately 92.6% of trajectories mix both languages. The dataset is stored in WebDataset format, with each tar package containing audio, MOSS tokens, and JSON metadata, along with a parquet metadata table for easy filtering. Applicable tasks include emotional speech synthesis, speech emotion recognition, and voice feature change modeling. The dataset is licensed under CC-BY-4.0, with special notes for the synthetic speech portion. Note: vprof_vc trajectories are constructed rather than real observations, the absolute accuracy of emotion classifiers is low, and emotional subclauses are ubiquitous due to the 40-dimensional gating mechanism.

提供机构:
LAION eV
创建时间:
2026-08-23
原始信息汇总

LAION Emotional-Trajectory Speech — Tier T≥0.80 数据集概述

基本信息

  • 数据集名称: LAION Emotional-Trajectory Speech — Tier T≥0.80
  • 许可证: CC-BY-4.0
  • 任务类型: 文本转语音 (text-to-speech)、音频分类 (audio-classification)
  • 语言: 英语、德语、法语、西班牙语、意大利语、荷兰语、波兰语、葡萄牙语
  • 数据规模: 100K—1M 条数据
  • 标签: speech, emotion, voice, trajectory, tts, moss, webdataset

核心内容

  • 数据量: 319,765 条交叉淡化语音轨迹,总计 4,482 音频小时,包含 1,598,825 个源片段
  • 核心概念: "轨迹"指由同一位说话者连续说出的 5 个话语组成的短序列,其情感或语音特征从语料库分布的一端单调移动至另一端
  • 关键特性: 每条链在其命名维度上跨越至少 80% 的语料库范围,且相邻片段之间步长不超过 25%

分层体系

数据集中设置了严格嵌套的分层标准(T≥0.20 至 T≥0.80)。本发布为 T≥0.80 层级,是最高标准层。更高层级是低层级的严格子集,因此可在 T≥0.20 上训练、在 T≥0.80 上评估,无需重新下载。

层级 链数 小时 en% de% 其他%
T≥0.80(本发布) 319,765 4,531 59.6 40.4 0.0

构建方式

  • 资格规则: 通过四种规则衡量(B1、AB2、PXR、VN1),所有规则要求步长上限 C=0.25
  • 说话者筛选(严格且无转换): 要求相邻片段余弦相似度≥0.80,且所有片段与首片段余弦相似度≥0.80;不满足条件的链会被剔除
  • 渲染方式: 所有片段统一电平至 −20.0 dBFS RMS,接缝处使用 150 ms 等功率交叉淡化(热点处缩短至 100 ms),48 kHz 单声道,MP3 96 kbps CBR

再标记化

  • 交叉淡化后的拼接属于新音频,因此使用 MOSS-Audio-Tokenizer-v2 重新编码
  • 12 个码本 ×1024,每秒 12.5 帧,每帧 12 个 token(80 ms)
  • 存储为 uint16 [T, 12] 格式的 <chain>.moss.npy 文件

标注说明

双层字幕

  • 逐段内联: 以剧本形式呈现 (情感 · 语音描述) 所说内容,每片段一行
  • 整体概括: 基于渲染后的音频评分生成两种变体
    • caption_general_a: 仅含 VoiceNet 维度,无情感词
    • caption_general_b: 含 VoiceNet 维度+前 2–3 种情感

重要警告

  1. 括号标注含义(需特别区分): 在 vprof_vc 来源中,约 37.7% 的括号是合成提示中的爆发方向而非实际检测,因此每段区分 burst_detected(实际检测)与 burst_scripted(请求但未确认)
  2. 语言标记: 链的 lang_iso 仅取第一个片段,实测 92.6% 的链为混合语言(德语+英语),需根据 langs/lang_mixed 字段过滤

数据集组成

数据集 链数 许可证
vprof_vc 319,650 生成数据(见注释)
emolia 115 CC-BY-4.0

本发布为 CLEAN 版本,已排除来源不明或无法公开再分发的数据。

诚实局限性

  • 轨迹是构造的而非观察到的: 语音配置文件轨迹由同一克隆声音对五个不同文本的独立录制构成,顺序由打包器施加
  • 五种情感无法成为双面规则下的轨迹端点: Awe、Distress、Sadness、Disappointment、Helplessness 的原始得分过度零膨胀
  • 情感评分器绝对能力较弱: 对语音配置文件的 top-1 准确率仅 8.0%(随机水平 2.5%)
  • 约 98% 的链至少包含一种情感: 这是 40 维门控的算术结果,不代表每条链都富有情感

文件格式与加载

数据集以 WebDataset 格式分发(traj-t80-NNNNN.tar),包含 MP3 音频、JSON 元数据和 MOSS token npy 文件,另有 parquet 元数据文件及验证文件。支持通过 Hugging Face 数据集库加载,提供 Python 示例代码。

搜集汇总
数据集介绍
laion-emotional-trajectory-t80 数据集图片
构建方式
该数据集以情感轨迹为核心构建单元,每个轨迹由同一说话人的五段连续话语组成,其情感或音色特征在语料分布中呈单调移动。构建时,所有片段先统一归一化至-20.0 dBFS RMS,再以等功率交叉淡化拼接为连续音频,随后使用MOSS-Audio-Tokenizer-v2对渲染后的波形重新编码,确保令牌序列与拼接音频严格对应。轨迹入选需满足T≥0.80的跨度阈值,且相邻片段间单步变化不超过0.25,同时通过说话人余弦相似度双重校验,保证同一轨迹内说话人身份一致。
特点
数据集涵盖319,765条轨迹、4,482小时音频,来源于1,598,825个片段,语言以英语和德语为主。每条轨迹附带两层描述:逐片段的内联剧本式标注与面向整体拼接音频的通用描述,后者仅基于VoiceNet维度或额外融合情感标签。情感、音色及质量评分均针对渲染后的完整轨迹而非源片段计算,保证标注与音频一致。数据集采用严格嵌套的层级设计,高阈值层级为低阈值层级的子集,便于课程学习与跨层级评估。
使用方法
使用者可通过Parquet元数据文件快速加载全部轨迹的212列属性,并利用tier_max字段筛选所需难度层级,无需重复下载。音频、MOSS令牌及逐轨迹JSON封装于tar分片中,借助chain_id与shard字段即可定位对应成员。加载示例展示了如何读取MP3音频、numpy格式的MOSS编码以及JSON中的描述与分段信息。训练或评估时,可依据tier_max进行嵌套选择,并注意langs与lang_mixed字段以正确处理多语言混合轨迹。
背景与挑战
背景概述
情感语音合成领域长期依赖单点情感标注,即每段语音对应单一情绪标签,模型因此擅长命中目标情感却难以习得情感在时间轴上的连续演变——从戒备到愤怒、从愉悦滑向轻蔑。2026年,LAION发布laion-emotional-trajectory-t80数据集,以“情感轨迹”为核心概念,将同一说话人五段连续话语按情感或音色维度单调排序,经等功率交叉淡化拼接为连续音频,并重新分词。该数据集覆盖三十二万余条轨迹、四千五百余音频小时,以严格嵌套的分层体系为课程学习提供便利,为表达性语音合成与情感语音识别开辟了可度量、可迁移的新范式。
当前挑战
该数据集所应对的领域问题在于:传统语料仅教会模型抵达情感终点,而无法习得情感旅行的过程本身。构建过程中的挑战同样严峻:轨迹需在说话人一致性上通过双余弦阈值约束,相邻与锚定相似度均不得低于零点八,以防身份漂移;拼接引入的声学不连续性要求以等功率交叉淡化与预归一化消除接缝伪影;跨淡化的新音频需重新编码为MOSS令牌,因原始编码在因果上下文下产生显著失真;情感评分器在绝对性能上偏弱,前百分之八的Top-1准确率迫使筛选完全依赖实测分数;此外,轨迹标签仅取首段语言,而实际百分之九十二点六的链条混合两种语言,提示使用者必须以langs与lang_mixed字段进行真实语言筛选。
常用场景
经典使用场景
在情感表达性语音合成与语音情感识别领域,该数据集最经典的使用场景在于训练模型捕捉情感状态的连续演变过程,而非仅仅拟合单一静态情感标签。其核心价值在于提供由同一说话人连续发出的五段话语构成的情感轨迹链,每条链在指定情感维度或声音描述符上单调跨越整个语料库分布范围的至少百分之八十。研究者可利用这些跨淡入淡出拼接且经MOSS-Audio-Tokenizer-v2重新标记化的音频序列,建模从克制到暴怒、从愉悦滑向轻蔑等动态情感过渡,从而推动富有表现力的文本到语音系统实现真正意义上的情感游移与渐变合成。
解决学术问题
该数据集直面学术研究中长期存在的关键难题,即传统情感语音语料库通常为每个片段标注单一情感,导致模型习得命中目标情感的能力,却无法习得情感在时间轴上的迁移过程。通过提供以严格嵌套层级组织的情感轨迹链,并依据经过平局感知中秩经验累积分布函数归一化的分数衡量变化幅度,该数据集使情感状态的可测量旅行成为可训练对象。这解决了情感语音合成中动态轨迹建模缺乏标注数据的问题,也为跨语言与跨说话人情感演化研究提供了可复现、可课程化评估的基准资源,推动了表现性语音生成从静态标签拟合向动态过程建模的范式转型。
衍生相关工作
基于该数据集衍生的经典工作主要围绕情感轨迹建模、课程学习策略以及多层级语音标记化展开。研究者可借助其严格嵌套的层级阶梯设计,训练从宽松到严格阈值的渐进式情感合成模型,并评估模型在最难轨迹链上的泛化能力。MOSS-Audio-Tokenizer-v2对拼接后音频的重新标记化工作,催生了针对连续音频序列的因果编解码器适配研究。两级字幕体系与四十维情感强度、五十七维声音特征描述,则为情感可控文本到语音与声音特征解耦表示学习提供了新的监督信号,并促进了跨语言情感迁移与说话人身份保持等衍生课题的实证探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务