遇见数据集

UrduSpeech

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

UrduSpeech是一个大规模、高保真的乌尔都语语音语料库,总时长156小时,包含71,792个经过说话人分割的话语,并附有全面的12维副语言学元数据。该语料库旨在解决乌尔都语在语音技术领域资源严重不足的问题。数据集覆盖12个内容类别:喜剧节目、戏剧、电影、美食、访谈、新闻、播客、诗歌、散文、街头采访、视频博客和YouTube评论。它由三个专门的子集构成:标准巴基斯坦乌尔都语(US-Std,59.2小时)、乌尔都语-英语语码转换(US-CS,89.4小时)和巴基斯坦口音英语(US-EngPk,7.3小时)。每个子集进一步按音频时长分为短片段(≤10秒,共55,407段)和长片段(>10-35秒,共16,243段)。数据收集自YouTube和巴基斯坦电视台(PTV)的档案内容,时间跨度超过40年(从1980年代至今),覆盖巴基斯坦及海外巴基斯坦人社区,确保了说话人(包括媒体专业人士和非专业人士)和口音的多样性。每个音频实例都配有详细的元数据,包括:转录文本(具有97.6%的置信度评分)、说话人ID、音频类别、时长、词数、字符数以及12维的副语言学标注(如性别、年龄、音高、语速、情感、口音、语调、节奏、音质、发音、副语言学特征和上下文信息)。数据集在性别分布上保持平衡(男性60%,女性40%),并包含不同年龄段的说话人。质量评估显示其平均意见得分(MOS)为4.64(σ=0.7),评分者间一致性Cohens Kappa为0.68。此外,还单独发布了一个经过人工全面校正的9小时基准集(US-benchmark),用于评估。该数据集适用于多种语音任务,包括自动语音识别(ASR)、语码转换研究、语音情感识别、说话人画像(年龄、性别、口音分类)、副语言学分析、文本到语音(TTS)、语音增强以及多语言语音模型训练。数据集采用Creative Commons Attribution 4.0 International (CC-BY-4.0) 许可证发布。

UrduSpeech is a large-scale, high-fidelity Urdu speech corpus with a total duration of 156 hours, containing 71,792 speaker-segmented utterances, and accompanied by comprehensive 12-dimensional paralinguistic metadata. The corpus aims to address the severe shortage of resources for Urdu in speech technology. The dataset covers 12 content categories: comedy shows, drama, movies, food, interviews, news, podcasts, poetry, prose, street interviews, vlogs, and YouTube comments. It consists of three specialized subsets: Standard Pakistani Urdu (US-Std, 59.2 hours), Urdu-English code-switching (US-CS, 89.4 hours), and Pakistani-accented English (US-EngPk, 7.3 hours). Each subset is further divided by audio duration into short segments (≤10 seconds, totaling 55,407 segments) and long segments (>10-35 seconds, totaling 16,243 segments). Data was collected from YouTube and Pakistan Television (PTV) archives, spanning over 40 years (from the 1980s to present), covering Pakistan and overseas Pakistani communities, ensuring diversity in speakers (including media professionals and non-professionals) and accents. Each audio instance is accompanied by detailed metadata, including: transcription text (with a 97.6% confidence score), speaker ID, audio category, duration, word count, character count, and 12-dimensional paralinguistic annotations (such as gender, age, pitch, speech rate, emotion, accent, intonation, rhythm, voice quality, pronunciation, paralinguistic features, and context). The dataset maintains balanced gender distribution (60% male, 40% female) and includes speakers from different age groups. Quality assessment shows a Mean Opinion Score (MOS) of 4.64 (σ=0.7) and inter-rater agreement Cohens Kappa of 0.68. Additionally, a manually corrected 9-hour benchmark set (US-benchmark) is separately released for evaluation. The dataset is suitable for various speech tasks, including automatic speech recognition (ASR), code-switching research, speech emotion recognition, speaker profiling (age, gender, accent classification), paralinguistic analysis, text-to-speech (TTS), speech enhancement, and multilingual speech model training. The dataset is released under the Creative Commons Attribution 4.0 International (CC-BY-4.0) license.

创建时间:
2026-05-25
原始信息汇总

数据集概括

  • 数据集名称: UrduSpeech
  • 数据集规模: 156 小时高质量乌尔都语语音,包含 71,792 个已进行说话人分离的语音片段。
  • 质量评估: 平均意见得分 (MOS) 为 4.64 (标准差 0.7),Cohen’s Kappa 评分者间信度为 0.68,转录置信度高达 97.6%。
  • 许可协议: Creative Commons Attribution 4.0 International (CC-BY-4.0)。

数据集子集

数据集包含三个专业子集:

  • US-Std (标准巴基斯坦乌尔都语): 59.2 小时
  • US-CS (乌尔都语-英语代码混合): 89.4 小时
  • US-EngPk (巴基斯坦口音英语): 7.3 小时

数据结构与实例

数据集根目录下按子集组织,每个子集分为 short (≤10 秒,共 55,407 段) 和 long (>10 秒,共 16,243 段) 两个文件夹。每个文件夹下按 12 种内容类别(喜剧节目、戏剧、电影、美食、访谈、新闻、播客、诗歌、散文、街头采访、Vlog、YouTube 评论)存放音频文件及对应的 JSONL 元数据文件。

每条数据实例包含两类 JSONL 文件:

  • 转录文件: 提供说话人 ID、音频类别、时长、词数、字符数、转写文本、置信度分数等信息。
  • 副语言特征文件: 提供说话人的性别、年龄、音高、语速、情感、口音、语调、节奏、音色、发音、副语言特征(如背景音)和语境信息等多达 12 维的元数据。

数据统计

  • 说话人性别分布: 女性 40% (28,802 段),男性 60% (42,990 段)。
  • 说话人年龄分布: 青年 (34,126 段)、中年 (33,495 段)、儿童 (1,804 段)、老年 (2,367 段)。
  • 唯一说话人数量: 估计超过 1,000 人。

数据来源与收集

数据来源于 YouTube 和巴基斯坦电视台 (PTV) 自 1980 年代至今的档案内容,涵盖媒体专业人士和非专业发言人(如Vlog博主、街头采访者、海外巴基斯坦人),地理覆盖巴基斯坦及巴基斯坦侨民。

预期用途

  • 自动语音识别 (ASR)
  • 代码混合语言研究
  • 语音情感识别
  • 说话人画像(年龄、性别、口音分类)
  • 副语言特征分析
  • 文本转语音 (TTS)
  • 语音增强
  • 多语言语音模型训练

非预期用途

  • 未经同意识别或追踪个人
  • 生成模仿特定个人的合成语音
  • 违反隐私或文化规范的内容

基准测试

附带一个独立的 US-benchmark 基准测试集(9 小时),所有转录由母语者人工校对,修正了代码混合歧义,并保留了 12 维副语言元数据,按三个子集、12 种内容类别及长短音频格式进行划分。

附加资源

  • Demo 演示: https://interspeech-urdu-demo.github.io/corpus-demo/
  • 论文: https://arxiv.org/abs/2605.17846
搜集汇总
数据集介绍
UrduSpeech 数据集图片
构建方式
UrduSpeech语料库的构建依托于严谨的LLM驱动流水线,采用Gemini 2.5 Pro模型应对乌尔都语独特的从右至左脚本约束、乌尔都语-英语代码切换及与印地语的声学邻近性等挑战。数据源涵盖YouTube与巴基斯坦电视台(PTV)自1980年代至今的存档内容,经过精心筛选以涵盖多元化说话者——包括媒体训练与非专业人士、博主、街头受访者及海外巴基斯坦人。音频被分割为71,792段对话片段,并按时长分为短片段(≤10秒,55,407段)与长片段(10-35秒,16,243段),同时依据内容类型划分为喜剧、戏剧、新闻等12个类别,最终形成标准乌尔都语、乌尔都语-英语代码切换及巴基斯坦口音英语三个专门子集。
特点
该语料库的显著特点在于其大规模与高保真度,总计156小时音频配备12维副语言元数据,涵盖性别、年龄、音高、语速、情感、口音、语调、节奏、音色、发音、副语言特征及语境信息。音频质量经人工评估获得4.64的Mean Opinion Score(标准差0.7),Cohen's Kappa值为0.68,转录置信度高达97.6%。性别分布均衡(男性60%,女性40%),说话者总数超过1,000人,覆盖青少年至老年各年龄段。独立的9小时手动校正基准集(US-benchmark)作为黄金标准,进一步强化了数据集的可靠性与研究价值。
使用方法
UrduSpeech的设计支持多种语音研究任务,包括构建与评估乌尔都语自动语音识别系统、探索乌尔都语-英语代码切换现象、进行语音情感识别与说话者画像(年龄、性别、口音分类)、分析副语言特征(如音色、音高、节奏),以及训练高质量文本转语音系统。数据以短片段(≤10秒)与长片段(>10秒)组织形式存储于标准子集、代码切换子集与巴基斯坦口音英语子集中,每段音频附带转录JSONL文件与副语言JSONL文件,前者提供说话者ID、音频类别、时长、词数、字符数及置信度,后者则包含丰富的声学与语境描述。研究者可直接通过HuggingFace平台加载使用,并依据CC-BY-4.0许可自由分发与修改。
背景与挑战
背景概述
UrduSpeech是一个由Attia Nafees ul Haq、Zeyu Zhu、Jingbin Hu、ChunJiang He和Lei Xie等人于2026年发布的大规模乌尔都语语音语料库,包含156小时的高保真音频及12维副语言元数据。乌尔都语作为全球超过2亿人使用的语言,在语音技术领域长期面临资源匮乏的困境,尤其在自动语音识别、情感计算和副语言分析等前沿研究方向,缺乏覆盖多种方言、口音和语体的高质量标注数据。该语料库通过构建包含标准巴基斯坦乌尔都语、乌尔都语-英语语码转换语和巴基斯坦口音英语三个子集的多样化语音数据,填补了这一空白,其平均意见评分高达4.64,转写置信度达到97.6%,为乌尔都语语音技术研究提供了坚实的基准资源,对推动低资源语言语音技术的发展具有重要影响力。
当前挑战
语音技术研究中,乌尔都语面临多项独特挑战。从领域问题来看,乌尔都语使用从右至左书写系统,自动识别系统在处理其复杂脚本时面临显着困难;同时乌尔都语与印地语在声学特征上高度相似,导致语音辨别极具挑战性;此外,巴基斯坦广泛存在的乌尔都语-英语语码转换现象,要求ASR系统具备跨语言的灵活适应能力。从语料库构建角度,研究团队在数据收集与处理过程中也面临艰巨挑战:需从YouTube和巴基斯坦电视台跨越40年的档案内容中筛选高质量音频,确保涵盖媒体专业人士与非专业发言人的多样性;需协调12个内容类别和3个子集的平衡分布,并实现60/40的性别比例;还需设计严谨的副语言特征标注框架,通过人工评估实现0.68的Cohen's Kappa组间信度,确保标注质量的可靠性和一致性。
常用场景
经典使用场景
UrduSpeech数据集为乌尔都语语音技术领域提供了大规模、高保真的语音资源,其最经典的使用场景涵盖自动语音识别、语种内与语种间的代码切换研究、以及副语言特征分析。该数据集精细划分了标准乌尔都语、乌尔都语-英语混合码及巴基斯坦腔英语三个子集,并收录了涵盖喜剧、新闻、诗歌等12类内容的逾7万条话语,使得研究人员能够系统性地探索多语种混杂环境下的语音识别模型鲁棒性、跨语种韵律迁移机制,以及基于丰富副语言标签的情感与说话人轮廓解析。
衍生相关工作
基于UrduSpeech的数据架构与标注范式,研究者已衍生出多项经典工作,包括面向低资源语言的鲁棒端点检测与语种辨识模型,以及融合12维副语言特征的跨模态情感推理框架。其配套发布的9小时人工校正基准集(US-benchmark)成为评估乌尔都语语音系统性能的黄金标尺,激发了针对代码切换边界的语言学可解释性分析,并催生了利用大语言模型辅助语音语料库构建的新方法论,有效推动了南亚多语种语音合成与识别技术的标准化进程。
数据集最近研究
最新研究方向
UrduSpeech数据集的发布为低资源语言语音技术研究注入了新动能,尤其是围绕乌尔都语在自动语音识别(ASR)、情感识别及副语言分析领域的前沿探索。该语料库凭借156小时高质量音频与12维副语言元数据,精准回应了乌尔都语因书写系统特殊性、乌英代码混合及与印地语的声学相似性而长期面临的技术瓶颈。当前,学界正聚焦于借助其丰富标注(如情绪、韵律、口音)构建多任务学习框架,推动跨语言迁移学习与多模态理解。此外,针对巴基斯坦英语口音子集的深度剖析,为全球化语境下的口音稳健性研究提供了稀缺标杆。结合LLM驱动的数据清洗流水线,UrduSpeech不仅为低资源语音生态树立了可复现的范式,更在文化与技术交叉点上促进了包容性语音系统的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务