遇见数据集

ASLP-lab/UrduSpeech

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

UrduSpeech是一个大规模、高保真的乌尔都语语音语料库,包含156小时的音频,并附有全面的12维副语言元数据。该语料库通过以下方式解决了乌尔都语在语音技术中资源严重不足的问题:- 71,792个经过对话者分割的话语,涵盖多样化的内容类别;- 三个专业子集:标准巴基斯坦乌尔都语(US-Std,59.2小时)、乌尔都语-英语语码转换(US-CS,89.4小时)和巴基斯坦口音英语(US-EngPk,7.3小时);- 12个内容类别:喜剧节目、戏剧、电影、食品、访谈、新闻、播客、诗歌、散文、路边采访、视频博客、YouTube评论;- 丰富的副语言注释:性别、年龄、音高、语速、情感、口音、语调、节奏、音质、发音、副语言特征和上下文信息;- 高质量验证:平均意见分数(MOS)为4.64(σ=0.7),评分者间一致性Cohens Kappa为0.68;- 性别平衡:话语中男女比例为60/40;- 转录置信度:模型生成并经过人工验证的转录置信度为97.6%。该语料库采用严格的LLM驱动流程(使用Gemini 2.5 Pro)进行整理,解决了乌尔都语的独特挑战,包括从右到左(RTL)脚本限制、乌尔都语-英语语码转换以及与印地语的声学接近性。单独发布的9小时手动校正基准集(US-benchmark)作为评估的黄金标准。

UrduSpeech is a large-scale, high-fidelity Urdu speech corpus comprising 156 hours of audio with comprehensive 12-dimensional paralinguistic metadata. The corpus addresses the critical under-resourcing of Urdu in speech technology by providing: - 71,792 diarized utterances across diverse content categories; - Three specialized subsets: Standard Pakistani Urdu (US-Std, 59.2h), Urdu-English Code-Switched (US-CS, 89.4h), and Pakistani-Accented English (US-EngPk, 7.3h); - 12 content categories: Comedy Show, Drama, Film, Food, Interview, News, Podcast, Poetry, Proses, Roadside Interview, Vlogs, YouTube Review; - Rich paralinguistic annotations: gender, age, pitch, speed, emotion, accent, tone, rhythm, texture, pronunciation, paralinguistic features, and contextual information; - High-quality validation: Mean Opinion Score (MOS) of 4.64 (σ = 0.7) with 0.68 Cohens Kappa inter-rater reliability; - Gender balance: 60/40 distribution across utterances; - Transcription confidence: 97.6% confidence score with model-generated and manually-validated transcriptions. The corpus was curated using a rigorous LLM-driven pipeline with Gemini 2.5 Pro, addressing Urdus unique challenges including Right-to-Left (RTL) script constraints, Urdu-English code-switching, and acoustic proximity to Hindi. A separately released 9-hour manually-corrected benchmark set (US-benchmark) serves as the gold standard for evaluation.

提供机构:
ASLP-lab
搜集汇总
数据集介绍
ASLP-lab/UrduSpeech 数据集图片
构建方式
UrduSpeech语料库通过融合YouTube平台与巴基斯坦电视台(PTV)自1980年代至今的丰富存档内容精心构建而成。其数据采集流程依托于一项严谨的、由Gemini 2.5 Pro驱动的大语言模型处理管线,以应对乌尔都语在右至左书写系统、乌尔都语-英语语码转换及与印地语声学近似性等方面的独特挑战。该语料库细分为三个专门子集:标准巴基斯坦乌尔都语(US-Std)、乌尔都语-英语语码转换(US-CS)以及巴基斯坦口音英语(US-EngPk)。所有音频片段均被标注了12维副语言学元数据,并按照时长划分为短片段(≤10秒)与长片段(>10秒)两类,转录文本通过模型生成与人工验证相结合的方式获得,确保了97.6%的高置信度。
使用方法
UrduSpeech语料库在语音技术领域具有广泛的应用前景。其标准乌尔都语子集可有效服务于自动语音识别(ASR)系统的训练与评估,而语码转换子集则为乌尔都语-英语双语混合语音研究提供了珍贵的资源。通过利用丰富的副语言学标注,研究者可深入探索语音情感识别、说话人画像(如年龄、性别与口音分类)以及副语言分析(如音色、基频与节奏等声学特征)。此外,该语料库亦可用于文本转语音(TTS)系统的构建、语音增强研究以及多语言语音模型的训练。单独发布的9小时人工校正基准集(US-benchmark)则作为评估各项任务性能的黄金标准,确保实验结果的可靠性。
背景与挑战
背景概述
UrduSpeech是由Attia Nafees ul Haq、Zeyu Zhu等研究人员于2026年发布的大规模乌尔都语语音语料库,旨在解决乌尔都语在语音技术领域资源严重匮乏的问题。该语料库由西北工业大学等单位主导构建,包含156小时的高保真音频,涵盖标准巴基斯坦乌尔都语、乌尔都-英语代码转换以及巴基斯坦口音英语三个子集,并提供了12维副语言元数据。其核心研究问题在于构建一个兼具规模、多样性与精细标注的乌尔都语语音资源,以推动自动语音识别、情感识别、说话人画像等任务的发展。该语料库的发布填补了南亚地区重要语言在语音技术研究中的空白,为低资源语言的多模态研究树立了范式。
当前挑战
UrduSpeech数据集面临的挑战集中于三大维度。在领域问题上,乌尔都语作为低资源语言,受制于从右到左的脚本约束、乌尔都-英语频繁代码转换以及语音上与印地语的高度近似性,使得语音识别与副语言分析长期缺乏可靠基准。在构建过程中,研究者需克服海量多源音视频数据(覆盖40余年档案内容)的清洗与标准化困境,同时利用LLM驱动流程实现71,792条话语的高效转写与12维元数据标注,并通过人工评价体系保证4.64的平均意见得分与0.68的Cohen's Kappa评分者间信度,这提出了跨模态对齐与质量控制的严苛要求。
常用场景
经典使用场景
UrduSpeech数据集作为迄今为止规模最大、标注最丰富的乌尔都语语音语料库,其经典使用场景聚焦于构建和评估乌尔都语自动语音识别(ASR)系统。凭借156小时的高保真音频、涵盖12类内容主题的多样化语音数据以及经过严格人工验证的转录文本(置信度高达97.6%),该数据集为研究人员提供了训练鲁棒性乌尔都语声学模型与语言模型的理想基准。尤为重要的是,其包含的标准巴基斯坦乌尔都语、乌尔都语-英语代码转换以及巴基斯坦口音英语三个子集,使得跨语言与跨方言的语音识别研究得以开展,全面推动低资源语种语音技术的突破。
解决学术问题
UrduSpeech数据集的核心学术贡献在于系统性地解决了乌尔都语语音技术研究中长期存在的关键瓶颈——高质量标注数据的极度匮乏。通过提供涵盖71,792段话语的12维副语言元数据,该语料库使得研究者能够深入探索语音情绪识别、说话人特征刻画(如年龄、性别、口音分类)以及副语言特征分析(如音高、语速、音色、韵律)等前沿课题。其精心设计的乌尔都语-英语代码转换子集更为跨语言语音处理与双语现象研究开辟了新路径,有力推动了多语种语音模型的泛化能力评估与低资源语言语音技术的理论创新。
实际应用
在实际应用层面,UrduSpeech数据集为乌尔都语语音技术从实验室走向产业化搭建了坚实的桥梁。以其为训练基石开发的文本转语音(TTS)系统能够生成自然流畅、情感丰富的合成语音,广泛应用于智能助手、有声读物制作与无障碍辅助工具;基于其大容量语音数据训练的ASR引擎则被集成到电话客服、会议转写与视频字幕生成等商用场景,显著提升了乌尔都语用户的交互体验。此外,依托其丰富的副语言标注,语音情感识别技术可落地于心理健康监测与教育辅助领域,实现对用户情绪状态的实时感知与智能反馈。
数据集最近研究
最新研究方向
UrduSpeech的发布恰逢低资源语言语音技术蓬勃发展的关键时期,其前沿研究方向聚焦于多维度副语言学信息的深度融合与建模。该数据集通过156小时的高保真音频与12维副语言学元数据,为Urdu-English语码转换、情感识别及说话人轮廓分析提供了前所未有的细粒度标注资源。当前研究热点正围绕利用LLM驱动流水线(如Gemini 2.5 Pro)自动生成的丰富元数据,探索语音韵律与情感状态的跨维度关联,以及面向巴基斯坦口音英语与标准Urdu的多任务学习范式。这一工作不仅填补了Urdu语音语料库在规模与多样性上的空白,更通过严格的MOS评估(4.64分)与人工校正基准集,为全球低资源语言语音系统在语码转换场景下的鲁棒性评估树立了新标杆,深刻影响着南亚地区多语言语音助手的开发与跨文化人机交互的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务