FineEdit
收藏资源简介:
FineEdit是一个大规模、结构化配对的英语语音数据集,专为支持FineCombo-TTS(Interspeech 2026)而构建,旨在用于文本到语音合成中学习精确的相对声学属性控制。每个样本组织为三元组:(源语音、控制描述、目标语音),源语音和目标语音仅在特定声学属性上不同,使模型能够学习基于参考的精确转换。
FineEdit is a large-scale, structured paired English speech dataset developed specifically to support FineCombo-TTS (Interspeech 2026). It is designed for learning precise relative acoustic attribute control in text-to-speech synthesis. Each sample is organized as a triplet: (source speech, control description, target speech). Source and target speeches differ only in specific acoustic attributes, enabling models to learn reference-based precise speech conversion.
数据集概述
FineEdit 是一个大规模、结构化的配对英文语音数据集,专为支持 FineCombo-TTS(Interspeech 2026)构建,旨在学习文本到语音合成中精确的相对声学属性控制。
数据组织结构
每个样本以三元组形式组织:(源语音, 控制描述, 目标语音)。源语音与目标语音仅在单一特定声学属性上存在差异,使模型能够学习基于参考的精确变换,而非绝对属性。
目录结构与来源
pair-prosody/:相对韵律控制的JSON元数据,基于 LibriTTS-R 构建,包含语速和音高修改。pair-emotion/:相对情感控制的JSON元数据,基于 ESD 数据集,涵盖5种情感。pair-timbre/:相对音色控制的JSON元数据,通过将具有相似声学特征的说话人进行交叉配对构建,基于 LibriTTS-P 和 TextrolSpeech 注释。code-change-prosody/:用于韵律处理的并行批量处理脚本(FFmpeg + GNU Parallel)。metadata/:直接源自 LibriTTS-R 和 TextrolSpeech 的基线元信息及说话风格/韵律注释。
数据下载
由于文件大小限制,大型增强音频文件托管在 Google Drive 上,文本注释和脚本可直接从本仓库获取。
| 组件 | 格式 | 来源 | 下载链接 |
|---|---|---|---|
| 配对元数据 | .json |
GitHub | 仓库 |
| 增强脚本 | .sh |
GitHub | code-change-prosody/ |
| 韵律音频包 | .tar.gz |
Google Drive | 下载 |
上游源数据集:
- LibriTTS-R:https://www.openslr.org/141/
- LibriTTS-P:https://github.com/line/LibriTTS-P
- TextrolSpeech:https://github.com/jishengpeng/TextrolSpeech





