遇见数据集

expressive-eng-tts

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

该数据集是一个完全合成的、富有表现力的乌干达英语文本到语音(TTS)数据集,专为微调具有真实乌干达英语口音、韵律和表达性说话行为的对话语音模型而设计。数据集包含由3个合成说话人(2名女性,1名男性)生成的语音,共100个训练样本,音频格式为单声道WAV,采样率为24kHz。与大多数现有的开源乌干达英语语音数据集(主要包含朗读文本录音)不同,本数据集专注于表达性对话语音生成,以支持现代语音基础模型。数据集中嵌入了表达性注释标记(如<laugh>、<cough>、<sigh>、<chuckle>、<yawn>),以模拟对话中的非语言发声和行为,帮助模型学习对话真实性、表达转换和语音动态。所有音频样本均使用Realistic Labs的eng_v1模型(基于Sunbird/SALT数据集训练)合成生成。数据集适用于对话TTS微调、乌干达英语口音适应、表达性语音合成、对话语音生成、语音基础模型研究、语音AI代理、韵律建模和多说话人表达性TTS等任务。为提升质量,建议在预处理中过滤音频时长低于6秒或高于9秒的样本。数据集已知局限性包括完全合成生成、可能包含合成伪影、说话人多样性有限(3个合成说话人)以及表达性覆盖可能无法完全代表真实世界对话行为。数据集采用Apache-2.0许可证,并由Realistic Labs持续更新。

This dataset is a fully synthetic, expressive Ugandan English text-to-speech (TTS) dataset designed for fine-tuning conversational speech models with authentic Ugandan English accents, prosody, and expressive speaking behaviors. It contains speech generated by 3 synthetic speakers (2 female, 1 male), totaling 100 training samples, with audio in mono WAV format at a sampling rate of 24kHz. Unlike most existing open-source Ugandan English speech datasets (primarily containing read-aloud text recordings), this dataset focuses on expressive conversational speech generation to support modern speech foundation models. The dataset incorporates expressive annotation tags (such as <laugh>, <cough>, <sigh>, <chuckle>, <yawn>) to simulate non-verbal vocalizations and behaviors in conversations, helping models learn conversational authenticity, expressive transitions, and speech dynamics. All audio samples are synthetically generated using Realistic Labs eng_v1 model (trained on the Sunbird/SALT dataset). The dataset is suitable for tasks such as conversational TTS fine-tuning, Ugandan English accent adaptation, expressive speech synthesis, conversational speech generation, speech foundation model research, speech AI agents, prosody modeling, and multi-speaker expressive TTS. To enhance quality, it is recommended to filter samples with audio durations below 6 seconds or above 9 seconds during preprocessing. Known limitations include being fully synthetic, potential synthetic artifacts, limited speaker diversity (3 synthetic speakers), and expressive coverage that may not fully represent real-world conversational behaviors. The dataset is licensed under Apache-2.0 and is continuously updated by Realistic Labs.

创建时间:
2026-06-02
原始信息汇总

数据集概述

数据集名称: Expressive Ugandan English TTS Dataset
数据集标识: r-labs/expressive-eng-tts
许可证: Apache-2.0
语言: 乌干达英语(Ugandan English)
任务类别: 文本转语音(Text-to-Speech)
数据集规模: 少于1000个样本(n<1K)


数据集目的

该数据集是一个完全合成的乌干达英语表达性语音数据集,专为对话式文本转语音(TTS)微调而设计。其目标是弥补现有开源乌干达英语语音资源(主要为朗读文本录音)在表达性韵律、对话节奏、非语音发声、情感变化和自然对话行为方面的不足,支持现代对话式语音基础模型的训练与微调。


数据集详情

  • 语言与口音

    • 语言:乌干达英语
    • 口音:乌干达
    • 领域:对话语音
    • 风格:表达性
  • 说话人

    • 总说话人数:3(均为合成说话人)
    • 女性:2
    • 男性:1
  • 音频规格

    • 格式:WAV
    • 采样率:24kHz
    • 声道:单声道
    • 语音类型:完全合成
    • 风格:表达性对话语音
  • 数据集结构

    • 仅包含一个训练集(train),共100个样本
    • 特征包括:speaker_id(字符串)、text(字符串)、audio(音频,采样率24000Hz)
    • 数据集大小:约41.5 MB(download_size: 约40.3 MB)

合成数据生成

所有音频样本均使用 Realistic Labseng_v1 模型生成,该模型基于 Sunbird/SALT 数据集 训练,并用于合成表达性的乌干达英语对话语音。


表达性标签

数据集中包含嵌入在文本提示中的表达性注释标签,用于模拟对话式语音行为。常见标签包括:

  • <cough>
  • <laugh>
  • <sigh>
  • <chuckle>
  • <yawn>

这些标签旨在帮助模型学习对话真实感、表达性转换、非语言发声生成以及对话语音动态。


预训练推荐

为提高数据集质量和保持对话一致性,建议在预处理时过滤掉音频时长低于6秒高于9秒的样本,因为这些样本合成质量较低。过滤有助于提升音频一致性、生成质量、训练可靠性和对话样本平衡。


推荐用途

该数据集适用于:

  • 对话式TTS微调
  • 乌干达英语口音适配
  • 表达性语音合成
  • 对话语音生成
  • 语音基础模型研究
  • 语音AI代理
  • 韵律建模
  • 多说话人表达性TTS

潜在模型应用

可用于微调或适配以下类型的模型:

  • OpenAI 风格语音模型
  • Gemini 风格TTS系统
  • Orpheus TTS
  • XTTS 类架构
  • 多说话人对话模型
  • 表达性语音代理

局限性

  • 完全合成的音频,可能包含合成伪影
  • 说话人多样性有限(仅3个合成说话人)
  • 对话行为是合成近似,可能无法代表所有真实对话行为
  • 表达性覆盖范围有限

偏见与注意事项

该数据集反映了底层生成模型 eng_v1 所学到的模式,以及其来源训练分布的偏差。合成语音可能无法完全捕捉真实乌干达英语使用者的多样性。


更新

该数据集会持续更新,未来可能包含更多生成样本、更佳生成质量、更广泛的表达性覆盖以及预处理优化。需要可重复性的用户应固定数据集版本。


示例用法

python from datasets import load_dataset

dataset = load_dataset("r-labs/expressive-eng-tts", split="train")


引用格式

bibtex @dataset{rlabs_expressive_eng_tts, title={r-labs/expressive-eng-tts: Expressive Synthetic Ugandan English Conversational TTS Dataset}, author={Realistic Labs}, year={2026} }


关于 Realistic Labs

Realistic Labs 正在构建面向非洲语言的语音AI基础设施,旨在使对话式语音系统更好地代表服务不足的语言、口音和语音社区。

搜集汇总
数据集介绍
expressive-eng-tts 数据集图片
构建方式
该数据集的构建依托于Realistic Labs开发的eng_v1模型,该模型基于Sunbird/SALT数据集训练而成。研究团队利用该模型针对乌干达英语的韵律与表达特征,全合成生成了包含3位虚拟说话者(2女1男)的情感化对话语音。数据生成过程中,通过嵌入<cough>、<laugh>、<sigh>等表达性标签,模拟真实对话中的非言语行为与情感过渡,最终形成以WAV格式存储、采样率为24kHz的单声道音频样本集。
特点
该数据集的核心特点在于聚焦乌干达英语的情感化对话语音生成,弥补了现有开源数据集以朗读式语音为主的不足。数据集中每个样本均包含说话者标识、文本转写及对应的情感标签,支持模型学习自然的对话节奏、韵律变化与真实交互行为。样本时长经过精心筛选(6至9秒),以确保合成质量与训练稳定性,同时采用Apache-2.0许可协议发布,便于学术研究与商业应用。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,使用load_dataset('r-labs/expressive-eng-tts', split='train')即可获取训练数据。该数据集适用于微调对话式文本转语音模型、进行乌干达英语口音适应、情感化语音合成以及语音基础模型的训练。建议在预处理阶段过滤掉时长低于6秒或高于9秒的样本,以提升数据一致性与生成质量。
背景与挑战
背景概述
该数据集由Realistic Labs于2026年创建,专注于乌干达英语的表达性对话语音合成,旨在弥补当前开源乌干达英语语音资源主要局限于朗读文本录音的不足。研究团队利用自身研发的eng_v1模型,基于Sunbird/SALT数据集进行训练,并合成了包含3个合成说话人(2女1男)的100个语音样本。核心研究问题在于推动乌干达英语在表达性对话语音生成领域的应用,为现代语音基础模型(如OpenAI TTS、Gemini TTS等)提供精细调优数据。该数据集的出现对非洲语音AI研究具有重要推动作用,促进了边缘语言与口音在语音交互系统中的融合发展。
当前挑战
该数据集所解决的领域挑战在于,传统乌干达英语语音资源多面向朗读式或脚本化语音,缺乏现代对话系统所需的表达性韵律、非语言发声(如笑声、咳嗽)及情感变化,难以支撑高质量对话语音合成。构建过程中面临合成语音质量受限的挑战,完全依赖生成模型导致可能引入合成伪影,且仅包含3个合成说话人,多样性不足。此外,表达性行为合成仅为近似模拟,无法完全反映真实对话中的复杂动态,需在预处理中剔除时长低于6秒或高于9秒的样本以维持一致性,进一步限制了数据规模和覆盖范围。
常用场景
经典使用场景
该数据集最经典的使用场景在于为文本到语音(TTS)系统提供表达性对话语音的微调资源。它聚焦于乌干达英语的口音与韵律特征,通过合成三名说话人(两女一男)的语音,并嵌入<cough>、<laugh>、<sigh>等非言语发声标签,使得模型能够学习自然对话中的停顿、情感波动和节奏变化。这弥补了传统阅读式语音数据集在口语化表达上的不足,尤其适用于开发具有地域口音特色的对话式语音助手或交互系统。
衍生相关工作
该数据集衍生出了一系列相关工作的方向。基于其合成语音和标签结构,学界可以研究跨口音的TTS迁移学习,例如将从乌干达英语对话数据中习得的表达性模式应用到其他非洲语言。同时,数据集可被用于训练语音事件检测模型,以识别对话中的笑声、叹息等非言语行为。此外,它催生了针对低资源口音的表达性语音质量评估方法,以及考虑地域口音偏差的公平性研究,从而推动语音AI在多样性语言社区中的可靠部署。
数据集最近研究
最新研究方向
该数据集聚焦于乌干达英语对话式文本转语音(TTS)的前沿研究方向,核心在于填补当前开源语音数据在表达性、对话韵律及非言语发声(如笑声、叹息、咳嗽等)上的空白。随着OpenAI TTS、Gemini TTS及Orpheus TTS等现代语音基础模型的兴起,对多口音、多风格的对话语音生成需求激增。这一数据集通过合成三位说话者的真实感语料,为非洲英语口音的语音AI研究提供了关键资源,特别在语音代理、情感对话系统及低资源语言适配中具有深远意义,推动了语音交互从朗读式向自然对话式的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务