遇见数据集

FineEdit

收藏
github2026-06-19 更新2026-06-26 收录
数据链接:
官方服务:

资源简介:

FineEdit是一个大规模、结构化配对的英语语音数据集,专为支持FineCombo-TTS(Interspeech 2026)而构建,旨在用于文本到语音合成中学习精确的相对声学属性控制。每个样本组织为三元组:(源语音、控制描述、目标语音),源语音和目标语音仅在特定声学属性上不同,使模型能够学习基于参考的精确转换。

FineEdit is a large-scale, structured paired English speech dataset developed specifically to support FineCombo-TTS (Interspeech 2026). It is designed for learning precise relative acoustic attribute control in text-to-speech synthesis. Each sample is organized as a triplet: (source speech, control description, target speech). Source and target speeches differ only in specific acoustic attributes, enabling models to learn reference-based precise speech conversion.

创建时间:
2026-06-18
原始信息汇总

数据集概述

FineEdit 是一个大规模、结构化的配对英文语音数据集,专为支持 FineCombo-TTS(Interspeech 2026)构建,旨在学习文本到语音合成中精确的相对声学属性控制。

数据组织结构

每个样本以三元组形式组织:(源语音, 控制描述, 目标语音)。源语音与目标语音仅在单一特定声学属性上存在差异,使模型能够学习基于参考的精确变换,而非绝对属性。

目录结构与来源

  • pair-prosody/:相对韵律控制的JSON元数据,基于 LibriTTS-R 构建,包含语速和音高修改。
  • pair-emotion/:相对情感控制的JSON元数据,基于 ESD 数据集,涵盖5种情感。
  • pair-timbre/:相对音色控制的JSON元数据,通过将具有相似声学特征的说话人进行交叉配对构建,基于 LibriTTS-PTextrolSpeech 注释。
  • code-change-prosody/:用于韵律处理的并行批量处理脚本(FFmpeg + GNU Parallel)。
  • metadata/:直接源自 LibriTTS-RTextrolSpeech 的基线元信息及说话风格/韵律注释。

数据下载

由于文件大小限制,大型增强音频文件托管在 Google Drive 上,文本注释和脚本可直接从本仓库获取。

组件 格式 来源 下载链接
配对元数据 .json GitHub 仓库
增强脚本 .sh GitHub code-change-prosody/
韵律音频包 .tar.gz Google Drive 下载

上游源数据集:

搜集汇总
数据集介绍
FineEdit 数据集图片
构建方式
FineEdit是专为支持可控制文本到语音合成中的精细相对声学属性学习而构建的大规模结构化配对英文语音数据集。其构建核心在于以三元组形式组织样本,即每一条数据包含源语音、控制描述与目标语音。源语音与目标语音之间仅存在单一指定声学属性的差异,从而引导模型学习基于参考的精确变换,而非绝对属性映射。该数据集在构建过程中充分利用了多个已有高质量资源:韵律对数据基于LibriTTS-R进行语音速率和基频修改生成;情感对数据依托ESD数据集覆盖五种情感类别;音色对数据则通过交叉配对具有相似声学轮廓的说话人,并引入LibriTTS-P与TextrolSpeech的标注信息完成构建。此外,数据集还提供了用于并行批量处理的脚本和基线元信息,便于研究者直接展开相关工作。
特点
FineEdit数据集的核心特点在于其精细化的相对声学属性控制能力,能够帮助模型捕捉并学习从源语音到目标语音之间仅针对某一属性的变化规律,而非对绝对属性值的依赖。其三元组结构天然支持参考语音引导的变换学习,显著提升了控制精度与泛化性。数据集规模宏大,覆盖韵律、情感和音色三大核心声学维度,具备良好的结构化程度与领域包容性。韵律控制涉及语速与基频的调节,情感控制涵盖五种不同情绪状态,音色控制则通过说话人相似性配对实现多样化的音色变换。所有元数据与标注均经过规范化处理,便于直接作为训练或评估基准。整体上,该数据集为细粒度可控语音合成研究提供了坚实的数据基础与系统化的评估框架。
使用方法
使用FineEdit数据集时,研究人员首先需要从GitHub仓库获取配对元数据JSON文件和增强脚本,同时从Google Drive下载大型增强音频文件。基于提供的元数据与脚本,用户可以直接加载数据处理管线,将三元组结构用于模型训练与评估。模型可以设计为接收源语音与文本描述,生成与目标语音在指定声学属性上一致的输出。为完整复现实验环境,建议同时获取上游来源数据集LibriTTS-R、LibriTTS-P和TextrolSpeech。使用过程中,可通过将元数据与对应音频按三元组对齐,构建用于控制性语音合成任务的输入输出对。数据集同时提供基准元信息与风格/韵律标注,支持在多种控制维度上进行系统性的对比实验与消融分析。
背景与挑战
背景概述
FineEdit数据集由清华大学计算机科学与技术系的研究团队于2026年创建,发表于Interspeech 2026会议,旨在解决文本到语音合成中精确声学属性可控性的核心研究问题。该数据集通过构建大规模结构化配对英文语音样本,每个样本以三元组形式组织,包含源语音、控制描述和目标语音,仅在一个特定声学属性上存在差异,从而支持模型学习基于参考的精确变换而非绝对属性。FineEdit基于LibriTTS-R、ESD等高质量源数据集构建,覆盖韵律、情感和音色三大控制维度,为可控语音合成领域提供了标准化训练资源,推动了细粒度声学属性操控技术的发展。
当前挑战
FineEdit面临的挑战首先体现在领域问题层面:传统TTS模型难以实现离散声学属性(如语速、音高、情感强度)的精准独立调节,常导致属性间相互干扰或生成语音不自然。其次,构建过程中需克服多重技术障碍:如何从LibriTTS-R和ESD等异构数据源中提取一致且可比的声学特征,如何在保留源语音核心内容的前提下通过FFmpeg等工具进行无损或低损韵律修改,以及如何跨数据库配对具有相似声学轮廓的说话人以构建音色控制样本,这些均对数据预处理和标注精度提出了严苛要求。
常用场景
经典使用场景
在语音合成领域,对韵律、情感和音色等声学属性进行精细化的相对控制是长期以来的研究难点。FineEdit数据集为此应运而生,其核心设计为三元组结构,即每一条样本均包含源语音、控制描述文本和目标语音,且源与目标仅在单一声学属性上存在差异。这一特性使得该数据集被广泛用于训练基于参考语音的相对属性控制模型,例如FineCombo-TTS框架,通过精准学习源语音到目标语音的声学变换映射,实现自然流畅的细粒度合成操控。无论是调整语速与基频的韵律变换,还是跨越五种情感的类别迁移,FineEdit都提供了结构化的配对数据,成为可控文本到语音研究中验证和优化算法的基础标杆。
实际应用
在产业落地层面,FineEdit所支撑的相对属性控制技术已展现出广阔的应用前景。语音助手和有声书制作场景中,用户往往希望在不改变说话人身份的前提下,微调朗读语速或情感基调,FineEdit训练出的模型可依据一段简短的参考语音实现对合成语音的高效调校。此外,在影视配音、虚拟主播和辅助发音矫正等领域,该数据集驱动的系统能够根据少数自然样本快速合成符合特定情绪或节奏要求的目标语音,避免了传统方法中漫长的人工参数调试过程。音频后期制作中,FineEdit的理念亦被用于精简混音流程,使得编辑者仅凭陈述性描述即可完成专业级的声学属性修正,显著提升了生产效率。
衍生相关工作
FineEdit的问世直接催生了一系列具有影响力的衍生工作。围绕其相对控制核心思想,研究者进一步设计了融合文本描述与参考音频的多模态条件编码器,如FineCombo-TTS中提出的联合注意力机制,实现了更稳定的多属性协同合成。在此基础上,后续工作探索了将相对控制扩展至轻声、强调等更细粒度的韵律层级,并利用FineEdit的韵律子集进行预训练,显著降低了下游任务的数据需求。在情感合成方向上,基于FineEdit的情感配对数据,学界陆续提出了情感强度连续调节和混合情感表达生成等新框架。此外,该数据集的解耦设计理念也推动了说话人音色快速适配与零样本声音克隆等方向的发展,形成了以精细化为导向的语音合成研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务