遇见数据集

anatol_vyartsinski_pesnya_pra_hleb_output

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

“Песня пра хлеб”是一个白俄罗斯语自动语音识别(ASR)数据集,属于Ministerskija系列的一部分,该系列是白俄罗斯语有声读物音频与转录文本的对齐集合。数据集基于作家Анатоль Вярцінскі的作品构建。原始有声读物被分割成约15秒的短音频片段,并利用Gemini和两个独立的ASR系统与转录文本进行了高置信度(≥ 0.95)的对齐处理。每个数据样本包含三个字段:`audio`(音频片段)、`text`(对应的转录文本)和`chunk_uid`(片段的唯一标识符)。该数据集在Hugging Face上公开发布了48个样本,总数据库包含69个样本,音频总时长约为14分钟。数据集规模属于1K到10K样本之间,适用于白俄罗斯语的自动语音识别模型训练与评估任务。

“Песня пра хлеб” is a Belarusian automatic speech recognition (ASR) dataset, part of the Ministerskija series, which is a collection of aligned audio and transcriptions from Belarusian audiobooks. The dataset is based on the works of the writer Anatol Vyarciński. In this dataset, the original audiobook is segmented into short audio clips of approximately 15 seconds, and high-confidence (≥ 0.95) alignment with transcriptions is performed using Gemini and two independent ASR systems. Each data sample includes three fields: `audio` (audio clip), `text` (corresponding transcription), and `chunk_uid` (unique identifier for the clip). The dataset is publicly released on Hugging Face with 48 samples, while the total database contains 69 samples, with an audio duration of approximately 14 minutes. The dataset scale falls between 1K to 10K samples and is suitable for training and evaluating automatic speech recognition models for the Belarusian language.

创建时间:
2026-06-01
原始信息汇总

数据集概述:Песня пра хлеб (Anatol Vyartsinski)

  • 语言: 白俄罗斯语 (be)
  • 许可证: CC0-1.0
  • 任务类别: 自动语音识别 (ASR)
  • 数据集大小: 1,000 < n < 10,000 行
  • 音频时长: 约 14 分钟

数据集来源与内容

该数据集是 Ministerskija 收藏集的一部分,包含白俄罗斯语有声读物的对齐音频片段及其转录文本。音频和文本来源于阿纳托利·维亚尔京斯基的作品《Песня пра хлеб》。

数据结构

每行数据包含以下字段:

  • audio:音频片段(约15秒)
  • text:转录文本(通过Gemini和ASR对齐生成)
  • chunk_uid:片段的唯一标识符

数据处理方法

音频书被分割成短片段,并使用 Gemini 和两个独立的 ASR 系统进行转录对齐。对齐置信度阈值为 ≥ 0.95。

说话人信息

该数据集中的说话人被归类为 speaker_02 说话人集群。其平均相似度评分为 0.901,最接近的数据集是 eryh_maryya_remark_output(相似度 0.95)。此识别结果基于 WavLM-Base+ 模型(余弦相似度,阈值 0.82)。

搜集汇总
数据集介绍
anatol_vyartsinski_pesnya_pra_hleb_output 数据集图片
构建方式
该数据集源自白俄罗斯诗人阿纳托利·维亚尔钦斯基的诗歌朗诵录音,是“Ministerskija”有声读物语料库的一部分。构建过程涉及将原始录音切分为约15秒的短片段,并借助Gemini模型以及两套独立的自动语音识别(ASR)系统进行音文对齐,确保每一片段均配有精确的文本转录。最终仅保留对齐置信度不低于0.95的高质量片段,共计48条标注数据,音频总时长为14分钟。
使用方法
该数据集可直接用于白俄罗斯语ASR模型的训练或评估,用户通过HuggingFace Datasets库加载后,能够便捷地访问'audio'和'text'字段,构建端到端的语音识别流水线。推荐将数据集与同语料库中其他说话人的数据结合,以提升模型的泛化能力。在使用时,可依据'chunk_uid'追踪特定片段,或基于说话人聚类信息进行说话人识别实验,从而充分发挥其在多模态语音研究中的价值。
背景与挑战
背景概述
在白俄罗斯语自然语言处理领域,高质量音频-文本对齐数据的匮乏长期制约着语音识别技术的发展。该数据集由研究人员基于Анатоль Вярцінскі的诗歌作品《Песня пра хлеб》构建,作为Ministerskija集合的一部分,旨在为白俄罗斯语自动语音识别(ASR)提供经过严格对齐的语音资源。创建于近年来,数据集包含69段音频片段,总时长约14分钟,每段转录均通过Gemini模型与双ASR系统联合对齐,确保置信度不低于0.95。这一精细化的处理流程,使得该数据集成为白俄罗斯语音技术研究中稀缺的高可靠性基准资源,尤其适用于低资源语种的声学模型训练与评估。
当前挑战
该数据集面临的核心挑战首先源于白俄罗斯语作为低资源语言的地位——缺乏大规模标注语料和成熟的预训练模型,导致ASR系统在建模时需要从极有限的样本中泛化,易受方言和音韵变异影响。构建过程中,对齐精度与数据完整性之间存在张力:虽然使用了双ASR系统与置信度阈值筛选,但仅保留48行高置信度片段,舍弃了约30%的数据,这意味着在追求可靠性的同时牺牲了覆盖率。此外,单一讲述者(speaker_02)的声学特征限制了模型的说话人泛化能力,而短片段(约15秒)的切分方式虽便于处理,却可能破坏语句的韵律连贯性,为上下文建模带来额外困难。
常用场景
经典使用场景
在白俄罗斯语语音处理领域,该数据集主要服务于自动语音识别(ASR)系统的训练与评估。其精细的对齐处理——通过Gemini与双独立ASR系统将音频片段与转录文本严格匹配,并设置不低于0.95的对齐置信度阈值——为构建高精度的语音识别模型提供了坚实的数据基础。研究者可依托这些短时音频片段(约15秒)及其精确转录,开展端到端语音识别、语音文本对齐优化以及多说话人场景下的ASR鲁棒性研究。
解决学术问题
该数据集着重解决低资源语言——白俄罗斯语在语音识别领域的数据匮乏与标注不精确问题。传统上,小语种的语音数据集往往规模有限且对齐质量参差不齐,限制了ASR模型的泛化能力。通过提供经过严格对齐验证的48条高质量语音-文本对,它使得学术社区能够针对白俄罗斯语的音韵特性、发音变体及口语化表达进行针对性建模,从而推动低资源语音识别技术从理论验证走向可靠应用,显著提升了小语种在语音技术领域的可见度与研究深度。
实际应用
在实际应用层面,该数据集可被直接用于开发白俄罗斯语的语音转文字工具,服务于有声读物自动生成字幕、语音搜索及数字图书馆建设等场景。例如,结合speaker_02的声纹特征,可构建特定朗诵者的个性化语音合成系统,或为文化遗产数字化项目提供辅助——将白俄罗斯文学作品的音频档案转化为可检索、可索引的文本资源。此外,其与邻近数据集(如eryh_maryya_remark_output)的相似性评估功能,还可助力跨数据集说话人识别系统的集成与验证。
数据集最近研究
最新研究方向
在白俄罗斯语自动语音识别(ASR)领域,该数据集聚焦于低资源语言的语音-文本对齐技术,通过结合Gemini与双ASR系统的高置信度对齐策略,为少数民族语言的数字化保存提供了创新范式。其研究前沿指向基于说话人聚类(如speaker_02)的跨数据集相似性分析,利用WavLM模型开展细粒度声纹特征提取,以推动多说话人场景下的鲁棒性语音识别。关联热点事件包括东欧语言在HuggingFace上的开源运动,以及文化遗产权威数字化倡议(如Ministerskija项目),突显了语音技术对抗语言消亡的实践价值。该数据集通过95%置信度阈值与15秒片段切割,显著提升了与下游任务如语音合成及翻译的兼容性,成为连接民俗文学与人工智能的桥梁,对白俄罗斯语教育及NLP公平性具有关键意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务