遇见数据集

Shirali/N_Nazarbayev_Speech_corpus

收藏
Hugging Face2023-02-22 更新2024-03-04 收录
官方服务:

资源简介:

--- license: cc0-1.0 --- About Dataset This dataset is taken from https://www.kaggle.com/datasets/bolattleubayev/nursultan-nazarbayev-speech-dataset The dataset consists of manually labelled 9341 wav files (around 14.8 hours) taken from speeches of The First President of the Republic of Kazakhstan Nursultan Nazarbayev published online. 7919 files (12.1 hours) are in Russian and 1422 files (2.7 hours) in Kazakh. Minimum duration: 0.42 sec, maximum: 13.00 sec, mean: 5.71 sec. The dataset was collected as a part of a research effort of Nazarabyev University Human-Robot Interaction Lab by Bolat Tleubayev, Ruslan Polichshuk, Zhanel Zhexenova, and Anara Sandygulova. This is ongoing open source project, so the dataset might expand in future. The .csv files are separated by '|' instead of ',' to avoid confusion with punctuation.

该数据集包含9341个手动标记的wav文件,主要来自哈萨克斯坦首任总统努尔苏丹·纳扎尔巴耶夫的在线演讲。其中7919个文件为俄语,1422个文件为哈萨克语。文件时长从0.42秒到13.00秒不等,平均时长为5.71秒。数据集由Nazarabyev大学人机交互实验室的研究团队收集,并可能在未来扩展。

提供机构:
Shirali
原始信息汇总

数据集概述

数据集来源

数据集内容

  • 包含9341个手动标记的wav文件,总时长约14.8小时。
  • 其中7919个文件(12.1小时)为俄语,1422个文件(2.7小时)为哈萨克语。
  • 文件时长范围:最短0.42秒,最长13.00秒,平均时长5.71秒。

数据集用途

  • 该数据集作为纳扎尔巴耶夫大学人机交互实验室的研究成果,由Bolat Tleubayev, Ruslan Polichshuk, Zhanel Zhexenova, 和 Anara Sandygulova收集。

数据集更新状态

  • 这是一个持续更新的开源项目,未来可能会有所扩展。

文件格式说明

  • .csv文件使用|分隔符,而非,,以避免与标点符号混淆。

许可证

  • 数据集遵循CC0-1.0许可证。
搜集汇总
数据集介绍
构建方式
该数据集源自哈萨克斯坦共和国首任总统努尔苏丹·纳扎尔巴耶夫公开发表的演讲音频,由纳扎尔巴耶夫大学人机交互实验室的研究团队精心构建。原始音频经人工标注后,共整理出9341个WAV格式文件,总时长约14.8小时,其中俄语语音7919个(12.1小时),哈萨克语语音1422个(2.7小时)。数据集的构建遵循开源原则,未来可能进一步扩展。为规避标点符号混淆,CSV文件采用竖线分隔符而非逗号。
特点
数据集具备显著的语种多样性与规模优势,涵盖俄语与哈萨克语两种语言,为多语言语音研究提供了宝贵资源。音频时长分布广泛,从最短0.42秒至最长13.00秒,平均时长5.71秒,这种差异增强了数据集的鲁棒性与适用性。所有文件均经过人工精确标注,确保了标注质量,适用于语音识别、说话人识别及语言分析等任务。
使用方法
用户可通过HuggingFace平台直接访问该数据集,加载WAV音频文件与对应的CSV标注信息。CSV文件以竖线分隔,便于解析。数据集适用于语音识别模型训练、跨语言语音分析及政治演讲语料研究等场景。研究人员可结合开源工具如Librosa或PyTorch进行预处理与建模,同时注意未来版本可能更新,建议关注项目动态以获取最新数据。
背景与挑战
背景概述
在语音识别与自然语言处理领域,多语种口语资源的稀缺性长期制约着低资源语言技术的突破。Shirali/N_Nazarbayev_Speech_corpus数据集由纳扎尔巴耶夫大学人机交互实验室于近年创建,主要研究人员包括Bolat Tleubayev、Ruslan Polichshuk、Zhanel Zhexenova及Anara Sandygulova。该数据集聚焦于哈萨克斯坦首任总统努尔苏丹·纳扎尔巴耶夫的公开演讲,涵盖俄语与哈萨克语双语音频,共计9341个WAV文件(约14.8小时),其中俄语占12.1小时、哈萨克语占2.7小时。作为一项开源项目,其核心研究问题在于为哈萨克语及俄语语音识别提供高质量标注语料,弥补中亚语言资源匮乏的现状,对推动多语种语音技术发展与低资源语言研究具有重要示范意义。
当前挑战
该数据集面临的核心挑战首先在于领域问题层面:哈萨克语作为低资源语言,其语音识别模型常因训练数据不足而性能受限,且俄语与哈萨克语在音系、语法结构上的显著差异增加了跨语言泛化的难度。此外,数据集构建过程中遭遇多重技术难点:音频来源为公开演讲,存在背景噪声、语速不均及情感表达差异等非理想声学条件;手动标注工作耗时巨大,需确保9341个文件的时间戳与文本对齐精度,且以‘|’分隔的CSV格式虽避免标点混淆,却对后续解析工具的兼容性提出要求。开源项目的持续扩展特性也带来版本管理与标注一致性维护的挑战。
常用场景
经典使用场景
在语音识别与自然语言处理领域,Shirali/N_Nazarbayev_Speech_corpus 数据集为多语种语音建模提供了宝贵的资源。该数据集收录了哈萨克斯坦首任总统努尔苏丹·纳扎尔巴耶夫的公开演讲录音,涵盖俄语与哈萨克语两种语言,总计约14.8小时的语音数据。研究者常利用这一语料库进行低资源语言的语音识别系统训练,尤其关注跨语言声学模型的迁移学习。其精细的标注和较长的语音时长分布,使其成为评估端到端语音识别算法性能的理想基准。
衍生相关工作
该数据集衍生了一系列具有影响力的学术工作,如基于该语料库的说话人识别研究、多语种语音情感分析以及语音合成系统的适配工作。部分研究者利用其标注信息探索了政治演讲中的韵律特征与说服力之间的关系,推动了计算语言学与政治传播学的交叉研究。此外,该数据集还被用于验证无监督预训练模型在低资源语言上的泛化能力,相关成果已发表在语音与语言处理领域的顶级会议中。
数据集最近研究
最新研究方向
该数据集聚焦于中亚地区多语种政治演讲语音的自动处理与识别研究,尤其关注哈萨克语与俄语的双语混合语音数据。随着低资源语言语音技术成为前沿热点,该数据集为构建面向突厥语系的语音识别模型提供了稀缺的标注语料。当前研究趋势包括利用该数据探索跨语言迁移学习、说话人特征提取以及政治演讲中的情感分析与韵律建模。其意义在于推动中亚地区语言资源数字化,助力多语种语音助手与智能交互系统的本土化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务