UrduTTS
收藏官方服务:
资源简介:
UrduTTS 是一个面向乌尔都语文本转语音(TTS)和自动语音识别(ASR)研究的高质量语音语料库,总时长约92小时,包含57,873条语句。每条语句提供三种对齐的文本表示:原生乌尔都语脚本(波斯-阿拉伯体)、IPA音素序列(带重音标记、由eSpeak NG生成)以及确定性拉丁转写。音频为单声道16位PCM WAV格式,采样率44.1 kHz,平均时长5.71秒,99.9%的片段长度在2–15秒之间。数据集划分为训练集(64.21小时/40,511条)、验证集(18.41小时/11,575条)和测试集(9.24小时/5,787条)。所有录音来自4位男性朗读者,源自公共领域有声读物(LibriVox等),转录通过Whisper自动生成,未经人工验证。该语料库可用于乌尔都语TTS、ASR、字素-音素转换、罗马化以及低资源语言语音资源构建。基于该语料库的论文(LREC 2026)证明,使用音素化输入比罗马化输入在VITS和Glow-TTS上各项指标均更优。限制包括:仅男性声音、无说话者标签、转录存在ASR错误、9.8%的罗马化字段含有残留阿拉伯语变音符号、语言为正式朗读语体而非对话。遵循CC BY-NC 4.0许可证,仅限非商业用途。
创建时间:
2026-09-10
搜集汇总
数据集介绍

构建方式
乌尔都语作为约2.5亿使用者的语言,在语音技术领域长期面临资源匮乏的困境,现有语料库或规模有限、或未公开、或音质参差。UrduTTS的构建遵循可复现的流水线范式:从LibriVox、Internet Archive等公共领域录音中筛选发音清晰、无背景噪声的音频,经由pydub以400毫秒静音阈值切分,并通过边界同步策略避免词首截断;随后采用基于Whisper的自动语音识别管道生成乌尔都语文本,再依次派生确定性的拉丁转写与eSpeak NG音素化标注,最终形成三路对齐的文本表示。
特点
该语料库的核心特色在于为每条语音提供三种对齐的文本表示:乌尔都语原文字、国际音标音素序列以及拉丁罗马化转写,从而首次使音素化与罗马化输入的受控对比成为可能。数据集包含91.86小时、57,873条话语,采样率44.1 kHz,按话语级随机划分为训练、评估与测试三部分,种子固定为42,确保可复现。音素层保留了送气、卷舌、鼻化元音及重音标记,而罗马化层则刻意反映真实罗马乌尔都语的固有损失,为量化表征差异提供了理想基准。
使用方法
使用者可通过HuggingFace datasets库以一行代码加载UrduTTS,获取包含音频数组、乌尔都语转写、音素序列和罗马化文本的样本。针对内存受限场景,可利用流式模式避免下载完整约88 GB数据;若需匹配论文中的TTS训练设置,可通过cast_column将音频重采样至22.05 kHz。该数据集直接服务于乌尔都语语音合成与识别、字素到音素转换及转写研究,并可作为低资源语言资源构建的模板,但须遵守CC BY-NC 4.0许可证,不得用于商业用途或声音克隆。
背景与挑战
背景概述
乌尔都语作为全球逾2.5亿使用者的语言,在语音技术领域长期处于资源匮乏状态,现有语料库规模有限、未公开或音频质量参差不齐。2026年,M Kaab Bin Shahid与Muhammed Izharuddin在LREC会议上发布了UrduTTS数据集,旨在突破罗马化转写对乌尔都语语音合成的制约。该数据集提供91.86小时录音室品质朗读语音,涵盖57,873条话语,每条均附有乌尔都文、音素化(IPA)及罗马化三层对齐文本,成为当前公开可用的最大乌尔都语TTS语料库。其核心研究问题在于验证音素化输入相较罗马化输入在语音合成各指标上的优越性,并为低资源语言资源构建提供可复用的范式。
当前挑战
乌尔都语TTS领域的核心挑战在于,罗马化转写无法可靠编码该语言丰富的语音对比,如送气与不送气辅音、卷舌音及鼻化元音,且缺乏正字法标准,导致模型难以学习关键音位对立。构建过程中,数据来源的域限制带来显著局限:所有说话人均为男性且发音标注未公开,阻碍多说话人建模;文本转写由Whisper自动生成而非人工校验,识别错误会传播至三个文本层;约9.8%的罗马化文本残留阿拉伯语变音符号;音素化依赖eSpeak NG的规则前端,对波斯-阿拉伯文中短元音还原的固有歧义无法消解;语料仅涵盖正式朗读风格,缺失会话语体与语码转换现象,限制了模型的泛化能力。
常用场景
经典使用场景
在低资源语音技术探索中,乌尔都语作为拥有逾两亿五千万使用者的语言,长期受制于高质量语音语料的匮乏。UrduTTS以九十二小时演播室级朗读语音与五万七千余条话语,配以乌尔都文、音素化国际音标及罗马化三层对齐转写,为文本到语音合成提供了迄今规模最大的公开资源。其最经典的使用场景在于,以音素化输入训练VITS、Glow-TTS等端到端声学模型,并与罗马化输入进行严格对照实验,从而在客观失真度量与主观平均意见得分上系统评估不同文本表征对合成自然度与可懂度的决定性影响。
解决学术问题
该数据集直面乌尔都语语音研究中长期悬而未决的核心难题:罗马化转写缺乏正字法标准,且无法可靠编码送气与不送气、卷舌、鼻化元音及咽音等音位对立。同一词汇可因书写者而异,模型因而难以习得关键音位对比。UrduTTS通过提供确定性的音素化层,使研究者得以量化这种表征损失,并在受控条件下验证音素化输入在多项指标上全面优于罗马化输入,从而为低资源语言的文本表征选择提供了实证依据,推动了乌尔都语语音合成从经验性尝试向可复现基准的转变。
衍生相关工作
伴随LREC 2026论文的发布,UrduTTS催生了一系列围绕音素化与罗马化对比的经典工作,包括在Coqui TTS框架下从零训练VITS与Glow-TTS的完整复现流程,以及涵盖梅尔倒谱失真、信噪比、词错误率与音节错误率的客观评测套件。其配套代码库提供了从音频分段、边界同步、基于Whisper的转写、确定性罗马化到eSpeak NG音素化的可运行流水线,为后续研究者在其他南亚语言中复制该对照实验、拓展多说话人条件及改进音素化前端奠定了方法学基础。
以上内容由遇见数据集搜集并总结生成




