expressive-eng-tts
收藏资源简介:
该数据集是一个完全合成的、富有表现力的乌干达英语文本到语音(TTS)数据集,专为微调具有真实乌干达英语口音、韵律和表达性说话行为的对话语音模型而设计。数据集包含由3个合成说话人(2名女性,1名男性)生成的语音,共100个训练样本,音频格式为单声道WAV,采样率为24kHz。与大多数现有的开源乌干达英语语音数据集(主要包含朗读文本录音)不同,本数据集专注于表达性对话语音生成,以支持现代语音基础模型。数据集中嵌入了表达性注释标记(如<laugh>、<cough>、<sigh>、<chuckle>、<yawn>),以模拟对话中的非语言发声和行为,帮助模型学习对话真实性、表达转换和语音动态。所有音频样本均使用Realistic Labs的eng_v1模型(基于Sunbird/SALT数据集训练)合成生成。数据集适用于对话TTS微调、乌干达英语口音适应、表达性语音合成、对话语音生成、语音基础模型研究、语音AI代理、韵律建模和多说话人表达性TTS等任务。为提升质量,建议在预处理中过滤音频时长低于6秒或高于9秒的样本。数据集已知局限性包括完全合成生成、可能包含合成伪影、说话人多样性有限(3个合成说话人)以及表达性覆盖可能无法完全代表真实世界对话行为。数据集采用Apache-2.0许可证,并由Realistic Labs持续更新。
This dataset is a fully synthetic, expressive Ugandan English text-to-speech (TTS) dataset designed for fine-tuning conversational speech models with authentic Ugandan English accents, prosody, and expressive speaking behaviors. It contains speech generated by 3 synthetic speakers (2 female, 1 male), totaling 100 training samples, with audio in mono WAV format at a sampling rate of 24kHz. Unlike most existing open-source Ugandan English speech datasets (primarily containing read-aloud text recordings), this dataset focuses on expressive conversational speech generation to support modern speech foundation models. The dataset incorporates expressive annotation tags (such as <laugh>, <cough>, <sigh>, <chuckle>, <yawn>) to simulate non-verbal vocalizations and behaviors in conversations, helping models learn conversational authenticity, expressive transitions, and speech dynamics. All audio samples are synthetically generated using Realistic Labs eng_v1 model (trained on the Sunbird/SALT dataset). The dataset is suitable for tasks such as conversational TTS fine-tuning, Ugandan English accent adaptation, expressive speech synthesis, conversational speech generation, speech foundation model research, speech AI agents, prosody modeling, and multi-speaker expressive TTS. To enhance quality, it is recommended to filter samples with audio durations below 6 seconds or above 9 seconds during preprocessing. Known limitations include being fully synthetic, potential synthetic artifacts, limited speaker diversity (3 synthetic speakers), and expressive coverage that may not fully represent real-world conversational behaviors. The dataset is licensed under Apache-2.0 and is continuously updated by Realistic Labs.
数据集概述
数据集名称: Expressive Ugandan English TTS Dataset
数据集标识: r-labs/expressive-eng-tts
许可证: Apache-2.0
语言: 乌干达英语(Ugandan English)
任务类别: 文本转语音(Text-to-Speech)
数据集规模: 少于1000个样本(n<1K)
数据集目的
该数据集是一个完全合成的乌干达英语表达性语音数据集,专为对话式文本转语音(TTS)微调而设计。其目标是弥补现有开源乌干达英语语音资源(主要为朗读文本录音)在表达性韵律、对话节奏、非语音发声、情感变化和自然对话行为方面的不足,支持现代对话式语音基础模型的训练与微调。
数据集详情
-
语言与口音
- 语言:乌干达英语
- 口音:乌干达
- 领域:对话语音
- 风格:表达性
-
说话人
- 总说话人数:3(均为合成说话人)
- 女性:2
- 男性:1
-
音频规格
- 格式:WAV
- 采样率:24kHz
- 声道:单声道
- 语音类型:完全合成
- 风格:表达性对话语音
-
数据集结构
- 仅包含一个训练集(train),共100个样本
- 特征包括:speaker_id(字符串)、text(字符串)、audio(音频,采样率24000Hz)
- 数据集大小:约41.5 MB(download_size: 约40.3 MB)
合成数据生成
所有音频样本均使用 Realistic Labs 的 eng_v1 模型生成,该模型基于 Sunbird/SALT 数据集 训练,并用于合成表达性的乌干达英语对话语音。
表达性标签
数据集中包含嵌入在文本提示中的表达性注释标签,用于模拟对话式语音行为。常见标签包括:
<cough><laugh><sigh><chuckle><yawn>
这些标签旨在帮助模型学习对话真实感、表达性转换、非语言发声生成以及对话语音动态。
预训练推荐
为提高数据集质量和保持对话一致性,建议在预处理时过滤掉音频时长低于6秒或高于9秒的样本,因为这些样本合成质量较低。过滤有助于提升音频一致性、生成质量、训练可靠性和对话样本平衡。
推荐用途
该数据集适用于:
- 对话式TTS微调
- 乌干达英语口音适配
- 表达性语音合成
- 对话语音生成
- 语音基础模型研究
- 语音AI代理
- 韵律建模
- 多说话人表达性TTS
潜在模型应用
可用于微调或适配以下类型的模型:
- OpenAI 风格语音模型
- Gemini 风格TTS系统
- Orpheus TTS
- XTTS 类架构
- 多说话人对话模型
- 表达性语音代理
局限性
- 完全合成的音频,可能包含合成伪影
- 说话人多样性有限(仅3个合成说话人)
- 对话行为是合成近似,可能无法代表所有真实对话行为
- 表达性覆盖范围有限
偏见与注意事项
该数据集反映了底层生成模型 eng_v1 所学到的模式,以及其来源训练分布的偏差。合成语音可能无法完全捕捉真实乌干达英语使用者的多样性。
更新
该数据集会持续更新,未来可能包含更多生成样本、更佳生成质量、更广泛的表达性覆盖以及预处理优化。需要可重复性的用户应固定数据集版本。
示例用法
python from datasets import load_dataset
dataset = load_dataset("r-labs/expressive-eng-tts", split="train")
引用格式
bibtex @dataset{rlabs_expressive_eng_tts, title={r-labs/expressive-eng-tts: Expressive Synthetic Ugandan English Conversational TTS Dataset}, author={Realistic Labs}, year={2026} }
关于 Realistic Labs
Realistic Labs 正在构建面向非洲语言的语音AI基础设施,旨在使对话式语音系统更好地代表服务不足的语言、口音和语音社区。





