遇见数据集

genadz_pashkou_output

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

该数据集名为“Зборнік”(作者:Генадзь Пашкоў),是Ministerskija收藏的一部分,专注于提供白俄罗斯语有声读物的音频与转录文本的对齐数据。数据集旨在支持自动语音识别(ASR)任务,特别适用于白俄罗斯语语音处理。数据内容包含约15秒的短音频片段及其对应的转录文本,所有对齐均经过严格处理,置信度阈值不低于0.95。具体数据规模包括:在HuggingFace平台发布101个样本行,数据库总计134行,音频总时长为0小时28分钟。每个数据样本由三个字段构成:audio(音频片段)、text(转录文本,通过Gemini和ASR对齐生成)和chunk_uid(唯一片段标识符)。数据处理流程涉及将原始有声读物分割成短片段,并利用Gemini和两个独立的ASR系统实现音频与文本的精确对齐,确保数据质量。该数据集适用于白俄罗斯语语音识别、有声读物分析及相关研究。

The dataset is named Зборнік (author: Генадзь Пашкоў) and is part of the Ministerskija collection, focusing on providing aligned audio and transcription text for Belarusian audiobooks. It aims to support automatic speech recognition (ASR) tasks, particularly for Belarusian language speech processing. The data consists of short audio segments approximately 15 seconds long along with their corresponding transcriptions, with all alignments processed rigorously and a confidence threshold of no less than 0.95. The specific scale includes: 101 sample rows published on the HuggingFace platform, a total of 134 rows in the database, and an audio total duration of 0 hours 28 minutes. Each data sample comprises three fields: audio (audio segment), text (transcription text, generated via Gemini and ASR alignment), and chunk_uid (unique segment identifier). The data processing involves splitting original audiobooks into short segments and using Gemini and two independent ASR systems for precise audio-text alignment to ensure data quality. This dataset is suitable for Belarusian speech recognition, audiobook analysis, and related research.

创建时间:
2026-06-01
原始信息汇总

数据集概述:Зборнік — Генадзь Пашкоў

语言

  • 白俄罗斯语 (Belarusian)

许可证

  • CC0-1.0 (公共领域)

任务类别

  • 自动语音识别 (Automatic Speech Recognition, ASR)

标签

  • 有声书 / 白俄罗斯语 / 语音 / ASR / 对齐 / speaker_01

数据集规模

  • 样本数:1,000 ~ 10,000 条

基本信息

  • 来源:来自 Ministerskija 合集,为白俄罗斯语有声书的对齐音频及转录文本。
  • 作者:Генадзь Пашкоў
  • 当前发布行数 (HF):101 行
  • 数据库总行数:134 行
  • 音频总时长:0 小时 28 分钟
  • 对齐置信度阈值:≥ 0.95

数据结构

每条数据包含以下字段:

  • audio:音频片段(时长约 15 秒)
  • text:转录文本(通过 Gemini 和 ASR 对齐生成)
  • chunk_uid:片段唯一标识符

数据处理方式

  • 有声书被切分为短片段,并利用 Gemini 和两套独立 ASR 系统与转录文本对齐。
  • 对齐置信度 ≥ 0.95。

说话人信息

属性
说话人聚类 speaker_01
平均相似度评分 0.92
最近似数据集 dzhozef_redzyard_kipling_output (相似度 0.96)
  • 说话人识别模型:WavLM-Base+(余弦相似度,阈值=0.82)
搜集汇总
数据集介绍
genadz_pashkou_output 数据集图片
构建方式
该数据集源自白俄罗斯语有声读物《Зборнік》的音频材料,由作者Генадзь Пашкоў创作,作为Ministerskija收藏集的一部分。构建过程中,原始长音频被分割成约15秒的短片段,并利用Gemini模型与两套独立自动语音识别系统进行联合转录对齐,仅保留对齐置信度不低于0.95的高质量片段,最终形成包含101条对齐样本的精细化语音-文本配对数据集。
使用方法
该数据集适用于自动语音识别任务中的白俄罗斯语声学模型训练与评估。使用者可通过HuggingFace Datasets库直接加载数据,其中'audio'字段包含约15秒的音频片段,'text'字段为对齐后的转录文本。由于朗读者唯一且声纹一致性高,该数据尤为适合说话人自适应或低资源语言场景下的基线系统搭建。此外,数据集采用CC0许可证,可用于学术研究或商业应用而无版权顾虑。
背景与挑战
背景概述
该数据集名为“genadz_pashkou_output”,是Ministerskija收藏系列的一部分,专注于白俄罗斯语自动语音识别(ASR)领域。创建于2024年,由研究人员fosters主导整理,旨在解决白俄罗斯语资源匮乏的问题。数据集包含约101条已发布的音频片段,总时长28分钟,来源于作家Генадзь Пашкоў的有声书录音,通过Gemini模型和双ASR系统进行精细化对齐,确保转录置信度不低于0.95。其影响力在于为低资源语言ASR研究提供了高质量、对齐的语料,促进了白俄罗斯语语音技术的进步,并为同类语料库建设树立了范例。
当前挑战
该数据集面临的挑战主要体现在两个方面。在领域问题层面,它需要应对白俄罗斯语作为低资源语言在语音识别中的稀疏数据难题,如有限的声音样本、方言多样性及缺乏标准化转录工具,导致模型泛化困难。在构建过程中,挑战包括手动处理和自动对齐的复杂性:需从有声书中精准切割约15秒的短片段,并利用Gemini与两独立ASR系统交叉验证,以克服噪声、语速变化及说话人差异,确保时间戳与文本的精确同步,同时维持高置信度阈值(≥0.95)以保证质量,但这也限制了数据规模扩展。
常用场景
经典使用场景
该数据集源于白俄罗斯语有声读物的精细加工,将长约28分钟的音频切分为约15秒的短片段,并通过Gemini模型与两套独立ASR系统完成高置信度(≥0.95)的文本-音频对齐。其经典使用场景聚焦于低资源语言的自动语音识别(ASR)模型训练与评估,尤其适用于构建小语种语音识别基线系统。研究人员可借助这些对齐良好的语音-文本对,微调预训练模型或从头训练端到端ASR架构,从而攻克数据匮乏场景下的语音转写难题。
解决学术问题
该数据集直面白俄罗斯语等小语种在语音识别研究中遭遇的数据稀缺困境,为学术社区提供了一份经过严格对齐验证的高质量音频-文本资源。它解决了两个关键问题:一是缺乏公开可用的精细对齐语音语料,导致模型难以学习准确的音素-字素映射;二是数据量过小限制了端到端模型的泛化能力。该数据集的意义在于,它证明即使是百余条样本的小规模数据集,通过高精度对齐也能有效支撑ASR模型的初步训练与评测,从而拓宽了低资源语音技术的研究边界。
实际应用
在实际应用层面,该数据集可被部署于白俄罗斯语的语音助手、有声读物自动标注系统以及语言教育平台的发音评估模块中。例如,开发者能够利用其训练的ASR模型,对白俄罗斯语播客、新闻或课堂录音进行实时语音转写,降低人工转录成本。此外,该数据集还嵌入到Ministerskija集合中,作为多说话人语音识别流水线的一环,助力构建跨说话人的鲁棒语音处理系统,服务于语言保护与数字化传承的现实需求。
数据集最近研究
最新研究方向
在白俄罗斯语资源稀缺的背景下,genadz_pashkou_output数据集为低资源语言的自动语音识别(ASR)研究提供了高精度对齐的语音-文本语料。该数据集结合Gemini模型与双ASR系统进行片段对准,置信度阈值设定为0.95,确保了转录可靠性。其单说话人(speaker_01)高相似度(0.92)特性,使其在说话人验证与语音聚类研究中具有独特价值,尤其适用于声学模型微调与低资源语种的跨语言迁移学习。此外,该数据集作为Ministerskija集合的一部分,推动了白俄罗斯语音基准的构建,为语音助手、方言识别等前沿应用提供了基础资源,助力数字语言保护与多模态研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务