遇见数据集

Zarakun/youtube_ua_subtitles_test

收藏
Hugging Face2024-01-17 更新2024-03-04 收录
官方服务:

资源简介:

--- task_categories: - automatic-speech-recognition pretty_name: MangoSpeech configs: - config_name: rozdympodcast data_files: "data/rozdympodcast.parquet" - config_name: opodcast data_files: "data/opodcast.parquet" - config_name: test data_files: "data/test.parquet" --- # The list of all subsets in the dataset Each subset is generated splitting videos from given particular ukrainiam YouTube channel All subsets are in test split - "opodcast" subset is from channel "О! ПОДКАСТ" - "rozdympodcast" subset is from channel "Роздум | Подкаст" - "test" subset is just a small subset of samples # Loading a particular subset ``` >>> data_files = {"train": "data/<your_subset>.parquet"} >>> data = load_dataset("Zarakun/youtube_ua_subtitles_test", data_files=data_files) >>> data DatasetDict({ train: Dataset({ features: ['audio', 'rate', 'duration', 'sentence'], num_rows: <some_number> }) }) ```

任务类别: - 自动语音识别(automatic-speech-recognition) 易读名称:MangoSpeech 配置项: - 配置名称:rozdympodcast,数据文件路径:"data/rozdympodcast.parquet" - 配置名称:opodcast,数据文件路径:"data/opodcast.parquet" - 配置名称:test,数据文件路径:"data/test.parquet" --- # 数据集全部子集列表 本数据集的所有子集均由指定乌克兰YouTube频道的视频拆分生成,全部子集均划分至测试集。 - "opodcast" 子集来源于频道「О! ПОДКАСТ」 - "rozdympodcast" 子集来源于频道「Роздум | Подкаст」 - "test" 子集仅为少量样本子集 # 加载指定子集 >>> data_files = {"train": "data/<your_subset>.parquet"} >>> data = load_dataset("Zarakun/youtube_ua_subtitles_test", data_files=data_files) >>> data DatasetDict({ train: Dataset({ features: ['audio', 'rate', 'duration', 'sentence'], num_rows: <some_number> }) })

提供机构:
Zarakun
原始信息汇总

数据集概述

任务类别

  • 自动语音识别(automatic-speech-recognition)

数据集名称

  • MangoSpeech

配置信息

  • config_name: rozdympodcast
    • 数据文件: data/rozdympodcast.parquet
  • config_name: opodcast
    • 数据文件: data/opodcast.parquet
  • config_name: test
    • 数据文件: data/test.parquet

子集信息

  • opodcast 子集来自频道 "О! ПОДКАСТ"
  • rozdympodcast 子集来自频道 "Роздум | Подкаст"
  • test 子集是一个小样本子集

数据加载

  • 数据文件路径: data/<your_subset>.parquet

  • 加载命令: python data_files = {"train": "data/<your_subset>.parquet"} data = load_dataset("Zarakun/youtube_ua_subtitles_test", data_files=data_files)

  • 数据结构: python DatasetDict({ train: Dataset({ features: [audio, rate, duration, sentence], num_rows: <some_number> }) })

搜集汇总
数据集介绍
Zarakun/youtube_ua_subtitles_test 数据集图片
构建方式
在自动语音识别领域,高质量的多语种数据集是推动模型性能提升的关键资源。该数据集源自乌克兰语YouTube频道的视频内容,通过提取视频字幕与音频流构建而成。具体而言,数据集被划分为三个子集,分别对应不同的乌克兰语播客频道:'opodcast'来自'О! ПОДКАСТ'频道,'rozdympodcast'来自'Роздум | Подкаст'频道,而'test'则是从整体中抽取的小规模样本集合。每个子集以Parquet格式存储,包含音频、采样率、时长及对应文本句子等特征,所有数据均属于测试集划分。
特点
该数据集在构建上展现出鲜明的领域针对性与结构清晰性。其核心特点在于聚焦乌克兰语播客场景,涵盖了多个独立频道的内容,从而为乌克兰语语音识别研究提供了多样化的口音、语速和话题分布。每个样本均包含完整的音频波形与精确对齐的字幕文本,确保了监督学习任务的可行性。此外,数据集采用轻量化的Parquet格式存储,便于高效加载与处理,且所有子集统一置于测试集下,简化了评估流程。
使用方法
使用该数据集时,用户可通过HuggingFace的datasets库灵活加载指定子集。具体而言,需在load_dataset函数中通过data_files参数指定目标Parquet文件路径,例如将'train'键映射至'data/opodcast.parquet'即可加载对应子集。加载后的数据集将返回一个包含'train'键的DatasetDict对象,其内部特征包括音频数组、采样率、时长和文本句子,可直接用于语音识别模型的推理或评估任务。这一设计降低了数据预处理门槛,便于快速集成到现有工作流中。
背景与挑战
背景概述
在自动语音识别(ASR)领域,乌克兰语等低资源语言的研究长期受限于高质量标注数据的匮乏。Zarakun/youtube_ua_subtitles_test数据集(亦称为MangoSpeech)应运而生,由研究团队于近期构建并发布,旨在为乌克兰语ASR模型提供测试基准。该数据集通过转录乌克兰YouTube频道(如“О! ПОДКАСТ”和“Роздум | Подкаст”)的视频字幕生成,聚焦于自然对话场景下的语音识别任务。其核心研究问题在于评估模型对乌克兰语口语变体、语速变化及背景噪声的鲁棒性。作为首个公开的乌克兰语YouTube字幕测试集,它填补了该语言在非正式语音数据上的空白,为多语言ASR系统的公平性评估提供了关键资源,推动了乌克兰语自然语言处理技术的进步。
当前挑战
当前数据集面临多重挑战。首先,在领域问题层面,乌克兰语ASR需应对口语中常见的方言差异、代码混合(如俄语词汇渗透)及非正式表达,这些因素显著增加了声学与语言模型的建模难度。其次,构建过程中存在数据筛选与对齐的瓶颈:YouTube视频字幕的时间戳可能不精确,导致语音与文本错位;同时,频道多样性(如播客与访谈)带来了背景噪声、说话人重叠及语速波动,需人工校验以保证标注质量。此外,数据规模有限(仅三个子集且均为测试集),缺乏训练集支持,限制了模型在真实场景中的泛化能力。未来需扩展多领域、多说话人数据,并引入更精细的噪声标注以提升鲁棒性。
常用场景
经典使用场景
在自动语音识别(ASR)领域,Zarakun/youtube_ua_subtitles_test数据集为乌克兰语语音识别模型的训练与评估提供了珍贵的真实场景资源。该数据集源自乌克兰本土YouTube频道的视频内容,涵盖“О! ПОДКАСТ”和“Роздум | Подкаст”等播客类节目,其音频与字幕的天然对齐特性,使其成为研究非朗读式、自然对话语音识别任务的理想基准。研究者可基于此数据集探索乌克兰语在低资源语言背景下的声学建模与语言模型融合策略,尤其适用于评估模型对口语化表达、语速变化及背景噪声的鲁棒性。
解决学术问题
该数据集的核心学术价值在于缓解乌克兰语ASR研究中的数据稀缺困境。乌克兰语作为低资源语言,长期以来缺乏大规模、高质量且标注准确的语音-文本配对语料,这严重制约了深度学习模型在该语言上的性能突破。通过提供涵盖不同主播口音和话题风格的语音片段,该数据集使得研究者能够系统性地分析跨域迁移学习、半监督训练以及自监督预训练等范式在乌克兰语上的有效性。其发布推动了多语言ASR系统的公平性评估,并为低资源语言语音技术的研究范式提供了可复现的基准。
衍生相关工作
该数据集的衍生工作主要体现在两个方面:其一,它作为测试集被广泛用于评估乌克兰语ASR系统的泛化能力,催生了若干针对低资源语音识别的数据增强与微调策略研究,例如基于频谱掩码的噪声注入方法;其二,其子集划分方式启发了跨频道领域适应的工作,研究者通过对比不同播客频道上的识别性能差异,提出了动态领域对齐的模型架构。此外,该数据集还常与wav2vec 2.0、Whisper等预训练模型的乌克兰语微调版本结合使用,形成了从预训练到下游任务适配的完整评估链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务