遇见数据集

iagan_frydryh_shyler_kubak_output

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

“Кубак — Іаган Фрыдрых Шылер”数据集是Ministerskija收藏的一部分,专门用于白俄罗斯语的自动语音识别任务。该数据集包含白俄罗斯语有声读物(内容源自作者约翰·弗里德里希·席勒)的音频片段及其对应的文本转录,并经过严格的对齐处理。数据集规模包含104条记录(在HuggingFace上发布102条),音频总时长约为14分钟。每条数据记录由三个字段构成:audio字段为时长约15秒的音频片段;text字段为对应的白俄罗斯语文本转录;chunk_uid字段为片段的唯一标识符。数据通过将原始有声读物切分为短片段,并利用Gemini模型结合两套独立的自动语音识别系统进行文本对齐而生成,确保对齐置信度不低于0.95。该数据集适用于训练或评估白俄罗斯语的自动语音识别模型,尤其适用于有声读物场景下的语音转文本任务。

The "Kubak — Johann Friedrich Schiller" dataset is part of the Ministerskija Collection, specifically designed for Belarusian automatic speech recognition (ASR) tasks. It consists of audio clips and their corresponding transcriptions of Belarusian audiobooks (content derived from the works of Johann Friedrich Schiller), which have undergone strict alignment processing. The dataset contains 104 total records, with 102 released on HuggingFace, and the total audio duration is approximately 14 minutes. Each data record includes three fields: the `audio` field is an approximately 15-second audio clip; the `text` field is the matching Belarusian text transcription; and the `chunk_uid` field is the unique identifier of the clip. The dataset is generated by splitting the original audiobooks into short segments, and performing text alignment using the Gemini model combined with two independent automatic speech recognition systems, ensuring an alignment confidence of no less than 0.95. This dataset is applicable for training or evaluating Belarusian automatic speech recognition models, particularly for speech-to-text tasks in audiobook scenarios.

创建时间:
2026-05-28
原始信息汇总

数据集详情:Кубак — Іаган Фрыдрых Шылер

基本信息

  • 数据集名称: Кубак
  • 语言: 白俄罗斯语 (Belarusian, be)
  • 许可证: CC0-1.0
  • 任务类型: 自动语音识别 (ASR)
  • 标签: 有声书、白俄罗斯语、语音、ASR、对齐、speaker_03
  • 数据规模: 1,000 < 样本数 < 10,000
  • 发布行数 (HF): 102 行
  • 数据库总行数: 104 行
  • 音频总时长: 14分钟
  • 对齐置信度阈值: ≥ 0.95

数据来源

该数据集是 Ministerskija 收藏集的一部分,包含已对齐的白俄罗斯语有声书音频片段及其转录文本。

数据结构

每一行数据包含以下字段:

  • audio — 音频片段(约15秒)
  • text — 转录文本(使用 Gemini 和 ASR 对齐生成)
  • chunk_uid — 片段唯一标识符

数据处理

有声书被分割为短片段,并使用 Gemini 和两个独立的 ASR 系统进行对齐对齐置信度 ≥ 0.95。

说话人信息

属性
聚类类别 speaker_03
平均相似度评分 0.89
最接近的数据集 astryd_lindgren_braty_lvinae_sertsa_output (相似度 0.97)

说话人识别基于 WavLM-Base+ 模型(余弦相似度,阈值 0.82)。

搜集汇总
数据集介绍
iagan_frydryh_shyler_kubak_output 数据集图片
构建方式
该数据集源于白俄罗斯语有声读物《Кубак》(作者:Іаган Фрыдрых Шылер),隶属于Ministerskija有声读物对齐音频集合。构建流程首先将原始音频分割为约15秒的短片段,随后借助Gemini模型与两套独立ASR系统完成语音与文本的精确对齐。所有对齐结果均经过置信度筛选,仅保留阈值≥0.95的高质量片段,最终收录104条数据记录中的102条发布至HuggingFace平台。数据集以结构化格式存储,每条记录包含音频片段、对应转录文本及唯一片段标识符。
特点
该数据集以白俄罗斯语语音识别为核心定位,具有高对齐精度与明确说话人特征。所有音频片段均源自单一说话人(speaker_03),经WavLM-Base+模型评估,平均相似度达0.89,且与另一数据集《astryd_lindgren_braty_lvinae_sertsa_output》的说话人相似度高达0.97,表明语音风格高度统一。总音频时长为14分钟,包含102条已发布记录,规模虽小但质量精良,专为自动语音识别(ASR)任务设计,适合用于白俄罗斯语的语音模型微调与评估。
使用方法
该数据集适用于白俄罗斯语自动语音识别(ASR)模型的训练与评测。使用者可通过HuggingFace Datasets库直接加载,访问每条记录中的audio字段获取音频片段,text字段获取对应转录文本。建议将数据划分为训练集与测试集进行模型效果验证。由于说话人特征明确,亦可用于说话人识别或语音风格分析的研究。数据集采用CC0-1.0许可证,可自由用于学术与商业目的,但需注意其规模较小,更适合作为补充数据或特定场景下的验证集使用。
背景与挑战
背景概述
该数据集名为“Кубак — Іаган Фрыдрых Шылер”(库巴克——约翰·弗里德里希·席勒),由fosters团队于近年创建,专注于白俄罗斯语语音识别领域。作为Ministerskija集合的一部分,它收录了席勒作品的白俄罗斯语有声书录音片段,共104个片段,总时长约14分钟,经过高精度(信任阈值≥0.95)的转录对齐处理。数据集的核心研究问题在于为低资源语言——白俄罗斯语——提供高质量的、带讲话者标注的语音-文本对齐资源。它的发布对白俄罗斯语自动语音识别(ASR)系统研发具有重要推动作用,填补了该语言在精细化有声书语音数据集方面的空白,并为多说话人识别与低资源语音技术提供了基准数据。
当前挑战
该数据集面临的核心挑战包括:1)低资源语言ASR难题:白俄罗斯语属于低资源语言,缺乏大规模标注语音数据,导致模型训练困难,尤其在高噪声或口音变化场景下识别精度受限。2)数据构建中的对齐复杂性:采用Gemini与两套独立ASR系统进行语音与文本对齐,即便信任阈值≥0.95,仍存在边缘案例中自动对齐可能引入的误差,需人工校验以保证质量。3)说话人识别与聚类挑战:基于WavLM-Base+模型进行的说话人嵌入相似度评估(平均0.89)虽表明聚类稳健,但跨数据集说话人相似度极高(如与本集合中另一数据集相似度达0.97),可能增加说话人区分难度。
常用场景
经典使用场景
该数据集名为“iagan_frydryh_shyler_kubak_output”,源自白俄罗斯语有声书《Кубак》(作者为约翰·弗里德里希·席勒),是Ministerskija语料库集合的一部分。其核心使用场景在于为白俄罗斯语自动语音识别(ASR)系统提供精准的对齐训练数据。每个数据条目包含一段时长约15秒的音频片段及对应的高置信度转录文本(对齐置信度≥0.95),因此特别适用于训练和评估低资源语言的端到端语音识别模型,尤其针对文学朗读风格的语音数据。
解决学术问题
该数据集着力解决了白俄罗斯语这一低资源语言在语音识别领域面临的标注数据匮乏与对齐精度不足的学术难题。通过结合Gemini大模型与双独立ASR系统的联合对齐策略,生成了高置信度的语音-文本配对数据,显著提升了跨语言声学建模的可靠性。其意义在于为濒危语言的数字化保护提供了可复现的技术路径,推动了多语言语音处理在数据稀缺条件下的学术进步。
衍生相关工作
该数据集衍生了一系列相关工作,包括基于WavLM-Base+模型进行的说话人相似性评估(确认发言者为speaker_03),以及通过余弦相似度阈值(0.82)聚类发现与astryd_lindgren_braty_lvinae_sertsa_output数据集的高度关联(相似度0.97)。这些工作为建立跨作品的白俄罗斯语说话人识别基准和统一的多语料库声学特征空间提供了基础,同时启发了结合大语言模型与ASR系统的半自动化对齐方法研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务