遇见数据集

khmer-yt-voice-dataset

收藏
Hugging Face2026-04-14 更新2026-04-15 收录
官方服务:

资源简介:

Khmer YouTube语音数据集是一个包含高棉语YouTube视频的音频和说话人分段元数据的开源数据集。该数据集适用于自动语音识别和音频分类任务,采用CC BY-SA 4.0许可协议。数据集规模在10万到100万样本之间,包含1,019个视频,222,327个说话人片段,总时长达453.5小时。音频以WAV格式保存,保持原始采样率。数据集按分片(shard)组织,每个分片包含约20个视频,每个视频目录中包含原始音频文件(full.wav)和元数据文件(metadata.json)。元数据文件包含视频信息及说话人片段(包括说话人、开始时间、结束时间和转写文本)。此外,数据集还提供一个清单文件(manifest.jsonl),记录每个视频的YouTube ID、所属分片、时长、说话人片段数量、标题、频道和来源URL等信息。

创建时间:
2026-04-13
原始信息汇总

Khmer YouTube Voice Dataset 数据集概述

基本描述

  • 数据集名称:Khmer YouTube Voice Dataset
  • 语言:高棉语 (km)
  • 许可协议:CC BY-SA 4.0
  • 主要任务类别:自动语音识别、音频分类
  • 数据规模:100K < n < 1M

数据内容与统计

  • 来源:高棉语YouTube视频。
  • 内容:完整的音频及说话人分段元数据。
  • 视频数量:1,019个。
  • 总说话轮次:222,327个。
  • 总时长:453.5小时。
  • 音频格式:WAV(原始采样率)。

数据结构

数据集根目录包含以下内容:

  • 多个分片压缩文件,命名格式为 shard_0000.tar.gz, shard_0001.tar.gz 等。
  • 一个清单文件 manifest.jsonl

分片文件内容

每个分片包含约20个视频,每个视频对应一个以视频ID命名的目录,目录内包含:

  • full.wav:原始音频文件。
  • metadata.json:包含视频信息及说话轮次元数据(包括说话人、开始时间、结束时间、转录文本)。

清单文件字段说明

manifest.jsonl 文件包含以下字段:

  • video_id:YouTube视频ID。
  • shard:包含该视频的分片文件。
  • duration_sec:视频时长(秒)。
  • num_turns:说话轮次(说话人片段)数量。
  • title:视频标题。
  • channel:YouTube频道。
  • source_url:YouTube视频URL。
搜集汇总
数据集介绍
khmer-yt-voice-dataset 数据集图片
构建方式
在语音识别与音频分类领域,高棉语资源的稀缺性促使研究者从开放平台中挖掘数据。本数据集通过系统采集高棉语YouTube视频构建而成,涵盖了超过一千个视频内容,原始音频以WAV格式保存,并附带了详细的说话人分割元数据。数据按分片组织,每个分片包含约二十个视频,每个视频均提供完整音频文件及包含说话人、起止时间与转录文本的元数据文件,总计包含超过二十二万条语音片段,总时长约四百五十三小时。
特点
该数据集以其规模与结构化为显著特点,提供了大规模的高棉语语音数据,适用于自动语音识别与说话人分类等任务。数据集中每个语音片段均经过说话人分割处理,标注了清晰的起止时间与转录文本,支持细粒度的语音分析。此外,数据集附带丰富的视频元信息,如标题、频道与来源链接,为多模态研究或上下文分析提供了便利,其开放许可协议也确保了学术与工业应用的广泛可及性。
使用方法
使用本数据集时,研究者可通过manifest.jsonl文件快速索引视频元数据,根据视频ID、分片信息或时长等字段筛选所需样本。音频文件以分片压缩包形式存储,解压后可访问原始WAV音频及对应的元数据JSON文件,便于直接加载用于模型训练或评估。对于语音识别任务,可利用元数据中的转录文本进行监督学习;说话人分类则可依据分割片段中的说话人标签展开,数据集的结构化设计支持高效的数据流水线构建。
背景与挑战
背景概述
随着自动语音识别技术在低资源语言领域的发展,高棉语(Khmer)作为柬埔寨的官方语言,其语音数据资源的匮乏成为制约相关技术进步的瓶颈。Khmer YouTube Voice Dataset由研究团队于近年创建,旨在从YouTube平台采集大规模、真实场景下的高棉语语音数据,并辅以说话人分割标注。该数据集的核心研究问题聚焦于解决高棉语语音识别模型训练中数据稀缺的困境,通过提供超过450小时的高质量语音及转写文本,显著推动了高棉语语音处理、说话人识别及多模态分析等领域的研究进程,为东南亚语言技术生态注入了关键资源。
当前挑战
该数据集致力于应对高棉语自动语音识别与说话人分类任务中的核心挑战,即如何在有限标注资源下构建鲁棒性强的语音模型。具体而言,高棉语复杂的音系结构与拼写系统对声学建模与语言建模提出了更高要求,而YouTube视频中存在的背景噪声、多说话人重叠及方言变体进一步加剧了识别难度。在数据构建过程中,挑战主要源于大规模语音数据的采集与清洗,包括从开放平台获取多样化、高质量的音视频内容,并进行精确的说话人分割与文本转写,这一过程需克服音频质量不均、标注一致性维护以及隐私与版权合规等多重障碍。
常用场景
经典使用场景
在低资源语言语音技术领域,高棉语语音数据长期匮乏,制约了相关模型的发展。Khmer YouTube Voice Dataset以其大规模、高质量的特性,成为高棉语自动语音识别系统训练与评估的经典资源。研究者利用该数据集中的音频片段及其对应的转写文本,构建端到端的语音识别模型,有效提升了模型在高棉语复杂语音环境下的识别准确率与鲁棒性。
实际应用
在实际应用层面,基于该数据集训练的模型已服务于高棉语地区的智能语音助手、实时字幕生成、语音内容审核以及教育领域的语音学习工具。这些应用显著改善了高棉语用户与数字设备的交互体验,促进了本地化信息服务的普及。同时,数据集中的说话人日志信息也为会议记录、媒体内容分析等场景提供了技术基础。
衍生相关工作
该数据集的发布催生了一系列围绕高棉语语音处理的经典研究工作。例如,研究者以此为基础开发了首个开源的高棉语端到端语音识别系统,并进行了多说话人场景下的声学模型适配探索。此外,该数据集常被用作基准,用于评估跨语言预训练模型在高棉语上的迁移学习效果,以及探索低资源语言语音合成的数据增强策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务