遇见数据集

WordVoice-5A

收藏
arXiv2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

WordVoice-5A是由华南理工大学等机构联合构建的大规模双语细粒度标注数据集,旨在为基于大语言模型的文本到语音系统提供精确的词级声学控制基础。该数据集包含约4684小时的语音数据,涵盖中英文双语,总计约5226万个字符或词汇,并提供了时长、边界、能量、音高和语调五个维度的词级标注。数据创建过程采用严格的语音学指导流程,通过双重对齐模型提取时间戳,并结合响度优化和一致性检查,确保了标注的高精度与可靠性。该数据集主要应用于语音合成领域,特别支持有声书朗读和视频配音等需要高精度词级声学干预的场景,以解决现有TTS系统在细粒度控制方面的瓶颈问题。

WordVoice-5A is a large-scale bilingual fine-grained annotated dataset jointly constructed by South China University of Technology and other institutions. It aims to provide a precise word-level acoustic control foundation for text-to-speech (TTS) systems based on large language models (LLMs). This dataset contains approximately 4,684 hours of speech data covering both Chinese and English, with a total of about 52.26 million characters or words, and provides word-level annotations in five dimensions: duration, boundary, energy, pitch, and intonation. The construction of this dataset follows a strict phonetics-guided workflow, where timestamps are extracted via a dual alignment model, combined with loudness optimization and consistency checks to ensure high accuracy and reliability of the annotations. This dataset is mainly applied in the field of speech synthesis, and specifically supports scenarios requiring high-precision word-level acoustic intervention such as audiobook narration and video dubbing, aiming to address the bottleneck problem of existing TTS systems in fine-grained control.

创建时间:
2026-07-08
原始信息汇总

数据集核心信息

  • 数据集名称: WordVoice-5A
  • 数据集规模: 4,700小时(4.7k-hour)双语数据
  • 标注维度: 5维字级标注
    • 时长 (Duration)
    • 边界 (Boundary)
    • 能量 (Energy)
    • 音高 (Pitch)
    • 音调 (Tone)
  • 数据用途: 支持基于大语言模型(LLM)的高精度、多维度字级解耦控制语音合成(TTS),实现显式的字级韵律控制与零样本合成稳定性。

所属模型与框架

  • 模型名称: WordVoice
  • 核心机制:
    • 边界符(Bound-Token)机制: 在LLM中实现自适应多任务韵律规划与灵活人工干预。
    • 细粒度声学调制模块: 增强token到波形(token-to-waveform)阶段的控制能力。
  • 合成模式:
    • 自由模式(Free Mode): 模型自主进行韵律规划。
    • 控制模式(Control Mode): 用户可显式操纵特定单词的五维声学属性。
搜集汇总
数据集介绍
构建方式
WordVoice-5A数据集基于LEMAS语料库的原始音频与文本,通过一套严谨的语言学引导的自动化标注流水线构建。流程分为三个阶段:首先,利用MFA与Qwen3FA双模型进行时间戳对齐,并引入基于响度的优化机制以修正词边界噪声;随后进行严格的一致性校验,仅保留对齐质量最高的数据(前8%)。其次,提取持续时间与五级声学边界两类时间属性。最后,通过信号处理与专家引导的形态学建模,从截断的帧级特征中提取能量、基频与七类语调特征,从而获得涵盖五个维度的词级标注,最终形成约4700小时的双语大规模数据集。
使用方法
该数据集专为基于大语言模型的语音合成系统设计,支持双模式使用。在自由模式下,模型自主预测每个词的五个声学属性,作为宏观韵律规划器以生成自然语音。在控制模式下,用户可直接为指定词提供各维度的期望值(如高能量或特定语调),替换模型的自主预测,实现精准、解耦的零样本词级干预。数据集中包含的帧级属性还可用于训练后端的精细声学调制模块,以弥补离散编码的细节损失,确保生成的波形严格遵循预设的词级声学特征,适用于有声书配音、视频配音等需要精细韵律控制的应用场景。
背景与挑战
背景概述
WordVoice-5A数据集由华南理工大学、虎牙公司、同济大学及香港理工大学的研究团队于2026年联合创建,旨在解决大规模语言模型(LLM)在语音合成中缺乏精细粒度控制的核心难题。现有基于LLM的文本到语音(TTS)系统虽已实现高度自然度,却依赖隐式端到端生成范式,导致对词级声学属性(如时长、能量、音高与语调)的操控极为粗放。为突破这一瓶颈,该团队构建了迄今规模最大的双语词级标注语音数据集——WordVoice-5A,涵盖约4700小时的中英文语音及超过5200万字符/词条,并首创五维词级标注(时长、边界、能量、音高与语调)。该数据集通过语言学引导的自动化标注流程,实现了高精度、多维度声学特征提取,为显式可控语音合成奠定了坚实的数据基础,其开源发布亦推动了TTS领域从隐式生成向显式可控范式的关键转型。
当前挑战
WordVoice-5A所面临的挑战聚焦于两个方面。在领域问题层面,现有LLM-TTS系统因缺乏词级结构边界而无法实现高精度、多维度的声学操控,无法满足有声书叙述与视频配音等场景对局部韵律的确定性干预需求,例如精确控制特定词的持续时长或情感重音。在数据集构建层面,挑战尤为严峻:首先,传统强制对齐工具存在显著噪声,需通过双模型交叉验证与基于响度的优化机制剔除低质量对齐,最终仅保留前8%的高置信度数据;其次,词级能量与音高的提取需通过截断策略(如仅取核心50%或80%的帧)以规避协同发音干扰;最后,为同时覆盖声调与语调语言,团队设计了基于二次多项式回归的专家引导形态学建模方法,将连续音高轮廓映射为7类离散韵律形态,从而在保持语言学可解释性的同时实现高度可控的离散化表征。
常用场景
经典使用场景
在语音合成研究领域,随着大型语言模型(LLM)的引入,文本到语音(TTS)系统在自然度上取得了显著突破,但隐式端到端生成范式导致了粗粒度的声学控制瓶颈。WordVoice-5A数据集应运而生,其最经典的使用场景在于为基于LLM的TTS系统提供精确的词汇级声学属性控制。该数据集以约4700小时的双语(中文和英文)语音为基础,通过语言引导的注释流水线,标注了时长、边界、能量、基频和声调五个维度的词汇级声学特征,从而将原本隐式的语音生成过程转化为显式、可解释且高度可控的范式,尤其适用于需要对特定词汇进行精细韵律干预的合成任务。
解决学术问题
该数据集的核心学术贡献在于解决了当前TTS研究中长期存在的细粒度声学控制缺失问题。现有方法多依赖全局嵌入或自然语言指令,难以实现对单个词汇的确定性韵律操控。WordVoice-5A通过提供大规模词汇级多维注释,为研究人员探索显式声学规划提供了数据基础,揭示了如何在不牺牲零样本合成稳定性的前提下,实现解耦的多维度声学属性干预。这一工作填补了词汇级精细标注数据的严重匮乏空白,推动了TTS系统从隐式生成向显式可控范式的转变,为后续的音韵规划、声学链式推理等研究奠定了关键资源。
实际应用
在实际应用中,WordVoice-5A所支撑的词汇级精细控制能力展现出广阔前景。在有声书录制场景中,创作者能够精确调整特定词语的时长、能量或音调,以细腻传达人物情感与叙事节奏;在视频配音领域,该数据集使得语音与口型的时间对齐更加严格,有效解决了跨模态同步的瓶颈。此外,在多语种语音交互、个性化语音助手以及富有表现力的对话系统中,用户可以通过显式指定目标词汇的声学属性,实现高度拟人化且可定制的语音输出,从而极大提升了人机交互的自然度与表现力。
数据集最近研究
最新研究方向
WordVoice-5A数据集为大规模双语词级声学标注语料库的构建开辟了新范式。当前,基于大语言模型的文本转语音系统虽在自然度上取得突破,却因隐式端到端生成范式而难以实现精准的局部韵律操控。WordVoice-5A通过语言学引导的标注流水线,对4.7k小时的中英文语音进行时长、边界、能量、基频和声调五维度词级标注,为可解释、可干预的细粒度语音合成奠定了数据基础。该数据集直接推动了WordVoice框架的诞生,其通过显式边界令牌机制在自回归生成中引入“声学规划”过程,并配合流匹配阶段的细粒度风格调制模块,实现了对多维声学属性的解耦控制。这一进展不仅满足了有声书叙述、视频配音等场景对确定性韵律干预的刚性需求,更将语音合成从隐式生成转向显式可控的范式,为后续基于指令的TTS和情感对话系统的可解释性研究提供了关键数据支撑。
相关研究论文
  • 1
    WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS华南理工大学; 虎牙公司; 同济大学; 香港理工大学; 佛山大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务