遇见数据集

raisa_baravikova_vershy_pra_kahanne_output

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

该数据集名为“Вершы пра каханне — Раіса Баравікова”,是白俄罗斯诗人Raisa Baravikova爱情诗的有声读物集合,属于Ministerskija系列的一部分,专门提供对齐的白俄罗斯语有声读物音频及其转录文本,用于自动语音识别(ASR)任务。数据集包含150个音频-文本对(其中122个已发布在Hugging Face平台),总音频时长约为31分钟。每个数据样本包括一个约15秒的音频片段(audio)、对应的转录文本(text)以及一个唯一的片段标识符(chunk_uid)。数据通过将原始有声读物分割成短片段,并利用Gemini模型结合两个独立的ASR系统进行音频与文本的对齐处理生成,置信度阈值设定为不低于0.95,确保了高质量的对齐结果。该数据集适用于白俄罗斯语的语音识别模型训练、评估以及相关语音技术研究。

The dataset is named Вершы пра каханне — Раіса Баравікова and is a collection of audiobooks featuring love poems by Belarusian poet Raisa Baravikova. It is part of the Ministerskija series, dedicated to providing aligned Belarusian audiobook audio and transcriptions specifically for automatic speech recognition (ASR) tasks. The dataset contains 150 audio-text pairs (with 122 released on the Hugging Face platform), with a total audio duration of approximately 31 minutes. Each data sample consists of an audio segment of about 15 seconds (audio), the corresponding transcription text (text), and a unique segment identifier (chunk_uid). The data was generated by splitting the original audiobook into short segments and aligning audio and text using the Gemini model combined with two independent ASR systems, ensuring high-quality alignment with a confidence threshold of at least 0.95. This dataset is suitable for training and evaluating Belarusian speech recognition models, as well as for related speech technology research.

创建时间:
2026-06-01
原始信息汇总
  • 语言: 白俄罗斯语 (be)

  • 许可协议: CC0-1.0 (cc0-1.0)

  • 任务类别: 自动语音识别 (automatic-speech-recognition)

  • 标签: 有声书、白俄罗斯语、语音、ASR、对齐、speaker_01

  • 数据集规模: 1,000 到 10,000 条 (1K<n<10K)

  • 正式名称: Вершы пра каханне — Раіса Баравікова

  • 作者: Раіса Баравікова

  • 所属合集: Ministerskija — 白俄罗斯语有声书的校准音频与转录本集合

  • 数据统计:

    • 已发布的行数 (HF): 122
    • 数据库总数: 150
    • 音频总时长: 0小时31分钟
    • 置信度阈值: ≥ 0.95
  • 数据结构:

    • 每条数据包含:
      • audio: 音频片段 (约15秒)
      • text: 转录文本 (由Gemini + ASR对齐生成)
      • chunk_uid: 片段的唯一标识符
  • 数据处理:

    • 有声书被分割成短片段,并使用Gemini和两个独立的ASR系统与转录文本进行对齐。
    • 对齐置信度 ≥ 0.95。
  • 说话人信息:

    • 说话人聚类: speaker_01
    • 平均相似度评分: 0.899
    • 最接近的数据集: genadz_pashkou_output (相似度 0.95)
    • 说话人识别模型: WavLM-Base+ (使用余弦相似度,阈值为0.82)
搜集汇总
数据集介绍
raisa_baravikova_vershy_pra_kahanne_output 数据集图片
构建方式
该数据集源自白俄罗斯诗人Раіса Баравікова的诗歌集《Вершы пра каханне》,属于Ministerskija收藏的一部分,专注于对齐后的白俄罗斯语有声书音频与转录文本。数据集的构建过程首先将原始有声书音频切割为约15秒的短片段,随后利用Gemini模型与两套独立的自动语音识别系统进行语音与文本的强制对齐。为确保对齐质量,仅保留置信度不低于0.95的片段,最终从初始的150行数据中精选出122行公开发布。每个数据行包含音频文件、对应转录文本及唯一片段标识符,音频总时长约31分钟,属于中等规模的高质量对齐语音数据集。
特点
该数据集的核心特点在于其高精度的对齐质量与纯净的说话人特性。所有音频片段的对齐置信度均达到0.95以上,有效确保了语音与文本的时间一致性。数据集仅包含一位说话人(speaker_01),经WavLM-Base+模型鉴定,其声纹相似度平均高达0.899,且与另一数据集genadz_pashkou_output的说话人相似度达到0.95,表明数据集中语音特征高度统一,适合用于单一说话人语音识别或说话人验证研究。此外,数据集涵盖白俄罗斯语诗歌这一特殊语料类型,为低资源语言的语音研究提供了宝贵资源。
使用方法
该数据集可直接用于自动语音识别模型的训练与评估,尤其适合白俄罗斯语等低资源场景。用户可通过HuggingFace Datasets库加载数据,每个样本的'audio'字段提供音频片段,'text'字段对应转录文本,可直接作为ASR任务的输入输出对。由于说话人高度一致,也可用于说话人识别模型的训练,或作为多数据集联合训练中说话人自适应部分的数据来源。数据集采用CC0-1.0许可证,允许自由使用与分发,但建议使用者参考原始对齐方法,以确保在扩展时保持数据一致性。
背景与挑战
背景概述
该数据集名为“Вершы пра каханне — Раіса Баравікова”(爱情诗——拉伊莎·巴拉维科娃),是Ministerskija集合的一部分,专注于白俄罗斯语语音识别领域。该数据集由fosters团队于近期创建,旨在构建对齐的高质量白俄罗斯语有声读物录音与转录。核心研究问题在于解决低资源语言——白俄罗斯语的自动语音识别(ASR)数据稀缺问题,通过精细的对齐处理提升ASR系统在诗词语境下的识别能力。数据集包含约122个公开文本行,总音频时长31分钟,置信度阈值不低于0.95,展示了在有限资源下达到高精度数据对齐的技术路径,对推动白俄罗斯语语音技术发展具有重要意义。
当前挑战
该数据集面临的主要挑战来自于低资源语言的领域特性与构建过程中的技术难度。在领域问题层面,白俄罗斯语作为低资源语言,缺乏大规模、多样化的语音训练数据,现有的ASR模型性能受限,尤其在诗词语境中,文学性语言的韵律与特有词汇增加了识别复杂性。在构建过程中,数据集需将完整的音频书分割为约15秒的短片段,并依赖Gemini模型与两个独立ASR系统进行对齐,确保对齐置信度≥0.95的高标准,这要求模型在噪声环境下具有极强稳定性。此外,单个说话者(speaker_01)的声学特征一致性强(相似度平均0.899),但与其他数据集说话者(如genadz_pashkou_output,相似度0.95)的差异仍需通过WavLM模型精细区分,以防止交叉污染,确保数据集纯净度。
常用场景
经典使用场景
在低资源语言语音识别领域,该数据集主要服务于白俄罗斯语自动语音识别系统的构建与评估。作为白俄罗斯语有声读物《爱情的诗歌》的精心对齐版本,它提供了约31分钟、150条高质量语音片段,每条约15秒,覆盖单一朗读者speaker_01的清晰发音。研究者常将其作为白俄罗斯语ASR的验证集或小规模微调数据,特别适用于测试语音到文本系统在诗歌类文学语料上的泛化能力。其高对齐置信度(≥0.95)确保了转录准确性,使其成为白俄罗斯语语音技术发展的重要标杆。
解决学术问题
该数据集直面白俄罗斯语作为低资源语言在语音识别领域面临的核心困境——缺乏高质量、对齐精准的语音-文本对。通过整合Gemini模型与双ASR系统的对齐策略,它有效解决了诗歌类音频中韵律复杂、停顿不规则带来的转录难题。学术意义上,它不仅填补了白俄罗斯语文学语音资源空白,还为跨语言ASR中的单一说话者识别与语音特征提取提供了对照基准。其开源性质(CC0-1.0)激励了更多低资源语言语音研究的开展。
衍生相关工作
该数据集是Ministerskija有声读物合集的重要组成,其对齐方法论和单一说话者聚类特性,催生了诸如genadz_pashkou_output等相似白俄罗斯语数据集的构建。相关工作包括基于WavLM-Base+的说话人识别基准测试、跨诗集ASR模型迁移学习研究,以及将诗歌类容错数据用于增强低资源ASR鲁棒性的实证分析。这些衍生工作共同推动了白俄罗斯语在多模态语音处理领域的系统性探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务