遇见数据集

moss-va-trajectory-corpus

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

该数据集是 MOSS Voice-Acting 项目的情感轨迹语料库公开子集。它包含 7,638,961 条轨迹规格,覆盖 17,722,101 个不同的源剪辑。每条轨迹是一个有序列表,由同一说话人的多个剪辑组成,共同表示情感或 VoiceNet 维度上的逐步变化(例如从平静到愤怒,或从高到低效价)。数据集不包含音频,每行通过 uid 引用剪辑,并记录每一步在维度上的位置。数据来自四个来源:emolia(5,893,310 行)、kartoffelphon(897,830 行)、eurospeech(729,876 行)和 MLS(117,945 行)。轨迹分为四种类型:单情感单调变化(emotion, B1, 3,545,392 行)、单 VoiceNet 维度单调变化(voicenet, VN1, 2,160,000 行)、代理维度尾部变化(proxy_taillift, PXR, 977,981 行)和双情感反向同时变化(emotion_twosided, AB2, 955,588 行)。平均每条轨迹包含 3.51 个剪辑,总参考音频时长 74,858 小时,82.7% 的轨迹在源录音中连续。字段包括 uids、speaker、dataset、lang、lang_iso、family、rule、dim_a、dim_b、d_a、d_b、step_a、step_b、T、C、k、qmax、cmax、contiguous、total_dur、emit_frac、spk_basis、proxy_map 和 track。该数据集主要用于训练和评估随时间变化的情感或语音维度表达,而非单一话语属性的识别或生成。注意:本数据集是过滤后的公开子集,podcast、evasnippets 和 snippets 子集因隐私原因未包含在内。

This dataset is a public subset of the MOSS Voice-Acting projects emotional trajectory corpus. It contains 7,638,961 trajectory specifications covering 17,722,101 distinct source clips. Each trajectory is an ordered list of multiple clips from the same speaker, together representing gradual changes in emotion or VoiceNet dimensions (e.g., from calm to angry, or from high to low valence). The dataset does not contain audio; each line references clips by uid and records the position along each dimension at each step. Data comes from four sources: emolia (5,893,310 lines), kartoffelphon (897,830 lines), eurospeech (729,876 lines), and MLS (117,945 lines). Trajectories are divided into four types: single emotion monotonic change (emotion, B1, 3,545,392 lines), single VoiceNet dimension monotonic change (voicenet, VN1, 2,160,000 lines), proxy dimension tail lift (proxy_taillift, PXR, 977,981 lines), and two-sided emotion reverse simultaneous change (emotion_twosided, AB2, 955,588 lines). On average, each trajectory contains 3.51 clips, with a total reference audio duration of 74,858 hours, and 82.7% of trajectories are contiguous in the source recording. Fields include uids, speaker, dataset, lang, lang_iso, family, rule, dim_a, dim_b, d_a, d_b, step_a, step_b, T, C, k, qmax, cmax, contiguous, total_dur, emit_frac, spk_basis, proxy_map, and track. This dataset is primarily used for training and evaluating time-varying emotional or vocal dimension expressions, rather than single utterance attribute recognition or generation. Note: This dataset is a filtered public subset; the podcast, evasnippets, and snippets subsets are not included due to privacy reasons.

提供机构:
LAION eV
创建时间:
2026-08-28
原始信息汇总

数据集概述

MOSS Voice-Acting — Emotional Trajectory Corpus(公开子集) 是一个用于语音情感表达建模的文本-语音(TTS)训练数据集,重点关注情感随时间变化的轨迹,而非单一话语的情感属性。

核心信息

  • 数据集规模:包含 7,638,961 条轨迹规格,覆盖 17,722,101 个独立源音频片段
  • 内容形式:数据集中不包含任何音频,每行数据通过 UID 引用音频片段,并记录各片段在情感或 VoiceNet 维度上的位置。
  • 用途:用于训练和评估模型在时间维度上对情感变化(如从平静逐渐过渡到愤怒)的建模能力。
  • 许可协议:CC-BY-4.0。
  • 语言:英语、德语、法语、西班牙语、意大利语、葡萄牙语、荷兰语、波兰语。

数据结构

每行数据包含以下关键字段:

字段 说明
uids 按顺序排列的片段 ID(逗号分隔)
speaker 所有片段共用的说话人
dataset, lang, lang_iso 来源、语言及语言代码
family, rule 轨迹构建方式
dim_a, dim_b 所步行的维度(如 emo_Contemplation
d_a, d_b 各维度上的总距离
step_a, step_b 每步距离
T, C, k 单调性阈值、一致性阈值和步数
qmax, cmax 轨迹满足的质量上界
contiguous 片段在源录音中是否相邻
total_dur 总时长(秒)
emit_frac, spk_basis, proxy_map, track 选择记录信息

数据构成

按来源划分:

来源 行数
emolia 5,893,310
kartoffelphon 897,830
eurospeech 729,876
mls 117,945

按轨迹类型划分:

family 规则 行数 步行的内容
emotion B1 3,545,392 单一情感头部,单调变化
voicenet VN1 2,160,000 单一 VoiceNet 维度
proxy_taillift PXR 977,981 代理维度及其尾部
emotion_twosided AB2 955,588 两种情感同时反向变化

统计特征:

  • 每条轨迹平均包含 3.51 个片段(2 片段:1,611,017 条;3 片段:2,303,104 条;4 片段:1,974,481 条;5 片段:1,750,359 条)。
  • 引用的音频总时长约 74,858 小时
  • 82.7% 的轨迹在源录音中是连续的。

筛选说明

这是一个经过筛选的发布版本。从 podcastevasnippetssnippets 来源生成的轨迹被保留(未公开),因为这些来源的转录文本不属于开放的真实语音发布内容,且轨迹行会明确指出使用了哪些片段。未筛选的完整语料库(10,653,713 行)保持私有。

相关资源

搜集汇总
数据集介绍
moss-va-trajectory-corpus 数据集图片
构建方式
在情感语音合成研究领域,如何建模情感随时间的动态演变是亟待解决的核心问题。该数据集的构建跳出了单一话语属性标注的窠臼,以“轨迹”为基本单元组织数据。每条轨迹由同一说话人的若干片段按序排列而成,这些片段沿某一情感维度或VoiceNet维度单调或等距地移动,例如从平静渐次过渡至愤怒,或沿效价维度均匀下降。构建方从emolia、kartoffelphon、eurospeech及mls四个来源中提取候选片段,依据预设规则(如B1、VN1、PXR、AB2)筛选并组装轨迹,同时记录每步在目标维度上的位置、总距离与步长,并施加单调性阈值与一致性阈值以保障轨迹质量。最终发布的公开子集囊括7,638,961条轨迹规格,引用17,722,101个独立片段,而涉及非公开转录来源的轨迹则被剔除,以保护语料边界。
特点
该数据集最显著的特色在于其以“时间演变”而非“静态属性”为建模目标。每条记录并不包含音频波形,而是以片段uid的有序列表刻画情感或VoiceNet维度上的渐进路径,这使模型必须学习如何逐步抵达目标状态,而非仅命中某一瞬时标签。数据覆盖四种轨迹族:单情感单调推进、单VoiceNet维度行走、代理维度向尾部抬升以及双情感反向同时移动,平均每条轨迹包含3.51个片段,总引用音频时长约74,858小时,其中82.7%的轨迹在原始录音中片段相邻。此外,每条轨迹附带单调性、一致性、质量边界等元数据,为细粒度筛选与评估提供了充分依据。
使用方法
该数据集适用于训练和评测语音合成模型的情感动态控制能力。研究者可依据`family`与`rule`字段筛选特定类型的轨迹,利用`uids`按序检索对应音频片段,并以`dim_a`、`dim_b`及`step_a`、`step_b`等字段监督模型学习维度上的渐进变化。`T`与`C`阈值可用于过滤低质量轨迹,`contiguous`字段则有助于区分连续录音与拼接片段。该公开子集与laion/moss-tts-local-transformer-4.55b-voice-acting-v2系列模型及偏好适配器配套,可直接用于监督微调或偏好优化流程,技术报告提供了完整的实验配置与评估协议。
背景与挑战
背景概述
语音合成领域长期聚焦于单句情感属性的静态建模,而真实场景中的情感表达本质上是动态且连续变化的。LAION研究团队构建的moss-va-trajectory-corpus数据集于2024年发布,旨在推动表达性语音合成从离散标签预测向时序情感轨迹建模的范式转变。该数据集包含约764万条轨迹规格,覆盖逾1772万条源音频片段,涉及八种语言,通过有序片段序列刻画情感维度的渐进演化,为语音表演生成模型提供了细粒度的过程级监督信号。
当前挑战
该数据集所应对的核心挑战在于情感时序建模的复杂性:模型需在保持说话人身份一致的前提下,精确控制情感强度沿指定维度的单调渐进变化,而非仅匹配静态情感标签。构建过程中面临多重困难:轨迹片段需满足单调性、一致性与质量阈值的严格约束,跨数据源的说话人覆盖与语言分布不均衡,以及因版权与隐私限制而过滤掉播客等来源导致的样本偏差。此外,如何生成具有感知自然性的情感渐变语音,以及评估轨迹的时序连贯性,仍是当前亟待突破的难题。
常用场景
经典使用场景
在情感语音合成与表现力建模领域,对情感动态演变的精细刻画正日益成为研究焦点。该数据集的经典使用场景在于训练和评估模型对情感轨迹的建模能力,即让合成语音不再局限于单一静态情感标签,而是能够沿特定情感或VoiceNet维度实现渐进、连续且可控的过渡。每一行轨迹规范以有序片段序列的形式,精确记录了从平静到愤怒、或从高效价到低效价的逐步迁移过程,为模型学习情感的时间演化提供了细粒度监督信号。
解决学术问题
传统情感语音数据集多聚焦于离散或静态的情感类别标注,难以支撑对情感动态性的学术探究。该数据集直面这一瓶颈,解决了情感在时间维度上连续变化建模的核心难题,为情感轨迹的单调性、一致性与步长控制提供了可量化基准。其超过七百万条轨迹规范与七万余小时参考音频,使研究者得以系统检验模型在情感渐变、双情感对冲等复杂条件下的表现,推动了表现力语音合成从静态分类向动态轨迹生成的范式迁移。
衍生相关工作
该数据集直接催生了一系列围绕表现力语音合成的前沿工作,包括基于局部Transformer的语音表演基础模型moss-tts-local-transformer-4.55b-voice-acting-v2及其第三轮监督微调版本,以及通过直接偏好优化获得的最佳偏好适配器moss-va-sft3-dpo-lora-p2。相关技术报告系统阐述了轨迹语料在训练与评估中的核心作用,后续研究亦在此基础上探索了情感轨迹的可解释性、跨语言迁移与更细粒度的韵律控制,形成了以轨迹建模为特色的研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务