遇见数据集

ales_zhuk_praklytaya_lyubow_output

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

该数据集是白俄罗斯语自动语音识别数据集,属于Ministerskija收藏的一部分,包含对齐的白俄罗斯语音频书籍录音及其转录文本。数据集基于白俄罗斯作家Алесь Жук的音频书籍《Пракляты любоў》创建。音频书籍被分割成约15秒的短片段,并使用Gemini和两个独立的自动语音识别系统与转录文本进行对齐处理,对齐置信度阈值设定为≥0.95。数据集包含1,038个音频片段,其中854个在HuggingFace平台上发布,音频总时长为3小时33分钟。每个数据样本包含三个字段:audio(音频片段)、text(对应的转录文本)和chunk_uid(片段的唯一标识符)。该数据集适用于白俄罗斯语自动语音识别任务的研究与开发,特别适用于音频书籍场景下的语音识别模型训练和评估。

This is a Belarusian automatic speech recognition (ASR) dataset, part of the Ministerskija collection, which contains aligned Belarusian audiobook recordings and their corresponding transcriptions. The dataset is developed based on the audiobook *Пракляты любоў* by Belarusian writer Алесь Жук. The original audiobook was segmented into short clips of approximately 15 seconds, and aligned with their transcriptions using Gemini and two independent ASR systems, with an alignment confidence threshold set to ≥0.95. The dataset includes 1,038 audio segments, 854 of which are released on the HuggingFace platform, with a total audio duration of 3 hours and 33 minutes. Each data sample contains three fields: `audio` (the audio segment), `text` (the corresponding transcription text), and `chunk_uid` (the unique identifier of the segment). This dataset is suitable for research and development of Belarusian automatic speech recognition tasks, and is particularly applicable to the training and evaluation of speech recognition models in audiobook scenarios.

创建时间:
2026-05-28
原始信息汇总

数据集概述

数据集名称: Пракляты любоў (Cursed Love) — Алесь Жук (Ales Zhuk)

语言: 白俄罗斯语 (Belarusian)

许可证: CC0-1.0

任务类别: 自动语音识别 (Automatic Speech Recognition)

标签: 有声书, 白俄罗斯语, 语音, ASR, 对齐, speaker_02

数据规模: 1,000 < 样本数 < 10,000


数据集详情

  • 作者: Алесь Жук (Ales Zhuk)
  • 所属合集: Ministerskija — 白俄罗斯语有声书的对齐音频录音及转录集合。
  • 已发布行数 (HF): 854 条
  • 数据库总行数: 1,038 条
  • 音频时长: 3小时33分钟
  • 置信度阈值: ≥ 0.95

数据结构

每条记录包含以下字段:

  • audio — 音频片段(约15秒)
  • text — 转录文本(通过 Gemini 和 ASR 对齐)
  • chunk_uid — 片段的唯一标识符

数据处理

  • 有声书被分割成短片段,并利用 Gemini 和两个独立的 ASR 系统与转录文本进行对齐。
  • 对齐置信度 ≥ 0.95。

说话人信息

  • 说话人聚类: speaker_02
  • 平均相似度评分: 0.949
  • 最接近的数据集: kuzma_chorny_zyamlya_output(相似度 0.97)
  • 识别模型: WavLM-Base+(余弦相似度,阈值=0.82)
搜集汇总
数据集介绍
ales_zhuk_praklytaya_lyubow_output 数据集图片
构建方式
该数据集源自白俄罗斯作家阿列斯·茹克的有声书《Пракляты любоў》,属于Ministerskija有声书收藏系列的一部分。构建过程涉及将原始音频切分为约15秒的短片段,随后利用Gemini模型与两套独立的自动语音识别系统联合进行转录对齐。所有片段的对齐置信度均设定不低于0.95,以确保文本与语音的高度匹配。最终数据集包含854条公开记录,总音频时长约为3小时33分钟。
特点
数据集专注于白俄罗斯语语音识别任务,具有高精度对齐和单一朗读者两大核心特点。朗读者被识别为speaker_02聚类,其平均相似度评分高达0.949,与kuzma_chorny_zyamlya_output数据集中的语音特征最为接近(相似度0.97)。每条记录均包含音频文件、对应转录文本及唯一的片段标识符,便于精准索引与复用。数据集以CC0-1.0许可发布,可用于学术研究与非商业应用。
使用方法
该数据集适用于白俄罗斯语自动语音识别模型的训练与评估。用户可直接加载HuggingFace上的音频与转录对,用于有监督的微调或对齐质量的验证。由于数据集包含单一朗读者且音频清晰,特别适合研究说话人无关条件下的语音识别性能。借助chunk_uid字段,可回溯每个片段在原始有声书中的位置。数据集的标准化结构兼容主流ASR框架,如Whisper或Wav2Vec2的输入格式。
背景与挑战
背景概述
该数据集名为“Пракляты любоў”(作者:Алесь Жук),创建于近期,由研究者fosters主导,属于“Ministerskija”集合的一部分,专注于白俄罗斯语音识别(ASR)领域。其核心研究问题在于为低资源语言白俄罗斯语提供高质量的语音-文本对齐数据,通过将音频书《诅咒的爱》分割为短片段(约15秒)并利用Gemini和两套独立ASR系统进行转录对齐,最终生成854条公开发布的高置信度(≥0.95)数据。该数据集对白俄罗斯语自动语音识别研究具有重要推动作用,填补了该语言在语音资源上的空白,并为多说话人语音分析提供了样例(如speaker_02聚类)。
当前挑战
该数据集面临的主要挑战包括:1) 领域问题方面,白俄罗斯语作为低资源语言,缺乏大规模语音语料库,使得ASR系统训练困难,且语音-文本对齐的准确性直接影响模型性能,需达到极高置信度;2) 构建过程中,音频书的长语音如何精准分割为语义连贯且长度一致的片段,同时避免跨词截断,是技术难点;多系统(Gemini与双ASR)的协同对齐需严格筛选高置信度样本(阈值0.95),导致大量低质量数据被舍弃;此外,说话人识别(如speaker_02与kuzma_chorny_zyamlya_output的相似度0.97)引入的聚类误差可能影响数据集纯净度。
常用场景
经典使用场景
该数据集聚焦于白俄罗斯语音识别领域,收录了白俄罗斯作家Алесь Жук创作的有声读物《Пракляты любоў》的音频片段及其精准对齐的文本转录。经典使用场景在于为白俄罗斯语的自动语音识别(ASR)模型提供训练与评估数据,尤其适用于低资源语言场景,推动该语种在语音技术中的发展。
实际应用
实际应用中,该数据集可用于开发白俄罗斯语智能语音助手、有声读物自动转录工具及语音搜索系统。在文化传承领域,它支持数字化白俄罗斯文学,帮助非母语学习者通过语音交互提升语言能力,并促进当地媒体与教育资源的无障碍访问。
衍生相关工作
该数据集衍生出的经典工作包括基于WavLM-Base+的说话人聚类与相似性分析,其识别出的说话人speaker_02被进一步用于构建多说话人语音数据集。相关工作如《kuzma_chorny_zyamlya_output》等同类对齐语料库的产出,推动了白俄罗斯语ASR的联合训练与基准测试,形成可复用的研究资源生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务