遇见数据集

yakub_kolas_novaya_zyamlya_output

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

“Новая зямля”数据集是“Ministerskija”集合的一部分,该集合专注于提供对齐的白俄罗斯语有声读物录音及其文本转录。本数据集基于白俄罗斯作家雅库布·科拉斯的著名诗作《Новая зямля》(新土地)构建,是一个用于自动语音识别(ASR)任务的专业语料库,特别适用于白俄罗斯语的语音模型训练与评估。数据集包含精细处理的音频-文本对齐对,每个样本由三个核心字段组成:`audio`字段为时长约15秒的音频片段;`text`字段为对应的白俄罗斯语文本转录;`chunk_uid`字段是该片段的唯一标识符。构建过程严谨,原始有声读物被分割成短片段后,利用Gemini工具并结合两个独立的自动语音识别系统进行文本对齐,确保对齐质量,所有样本的对齐置信度均不低于0.95。数据集在HuggingFace平台上公开发布了1,434条样本,完整后端数据库共包含2,882条样本,对应的音频总时长约为9小时49分钟。数据集以CC0 1.0通用公共领域奉献许可协议发布,适用于学术研究和商业开发。

The “Новая зямля” dataset is part of the “Ministerskija” collection, which focuses on providing aligned Belarusian audiobook recordings and their text transcriptions. This dataset is built upon the famous poem “Новая зямля” (New Land) by the Belarusian writer Yakub Kolas. It is a specialized corpus for automatic speech recognition (ASR) tasks, particularly suitable for training and evaluating speech models for the Belarusian language. The dataset contains finely processed audio-text alignment pairs. Each sample consists of three core fields: the `audio` field is an audio segment approximately 15 seconds long; the `text` field is the corresponding Belarusian text transcription; and the `chunk_uid` field is a unique identifier for the segment. The construction process is rigorous: the original audiobook is split into short segments, and then text alignment is performed using the Gemini tool combined with two independent automatic speech recognition systems to ensure alignment quality, with all samples having an alignment confidence of at least 0.95. The dataset is publicly released on the HuggingFace platform with 1,434 samples, while the complete backend database contains 2,882 samples, corresponding to a total audio duration of approximately 9 hours and 49 minutes. It is released under the CC0 1.0 Universal Public Domain Dedication license, making it suitable for academic research and commercial development.

创建时间:
2026-06-01
原始信息汇总

数据集概述

数据集名称: Новая зямля — Якуб Колас
语言: 白俄罗斯语 (Belarusian)
许可证: CC0-1.0
任务类型: 自动语音识别 (ASR)
标签: 有声书、白俄罗斯语、语音、ASR、对齐、speaker_02
规模: 1,000 < 样本数 < 10,000

所属集合: Ministerskija — 对齐的白俄罗斯语有声书音频片段及其转录文本。


数据统计

指标 数值
已发布行数 (HF) 1,434
数据库总行数 2,882
音频总时长 9小时49分钟
对齐置信度阈值 ≥ 0.95

数据结构

每条数据包含三个字段:

  • audio — 音频片段(约15秒)
  • text — 转录文本(通过Gemini和ASR对齐生成)
  • chunk_uid — 片段的唯一标识符

数据处理

有声书被切分为短片段,并借助 Gemini 和两个独立的 ASR系统 完成与转录文本的对齐,对齐置信度不低于 0.95。


说话人信息

指标 数值
说话人聚类 speaker_02
相似度评分(平均) 0.898
最近邻数据集 ivan_navumenka_sasna_pry_daroze_output(相似度 0.95)

说话人识别基于 WavLM-Base+ 模型(余弦相似度,阈值 0.82)。

搜集汇总
数据集介绍
yakub_kolas_novaya_zyamlya_output 数据集图片
构建方式
该数据集源自白俄罗斯著名诗人雅库布·科拉斯的长诗《新土地》的朗读录音,隶属于Ministerskija语料库。构建过程中,原始音频被分割为时长约15秒的短片段,并借助Gemini模型与两套独立的自动语音识别系统进行转录对齐。所有对齐结果均经过置信度筛选,仅保留阈值不低于0.95的高质量片段,最终整理得到1,434条公开发布的数据条目。
特点
数据集具有多个显著特点。首先,其音频总长度约9小时49分钟,涵盖2,882条原始记录,公开发布部分精选自信任度极高的对齐结果。其次,每条数据包含音频、文本转录及唯一片段标识符,便于索引与检索。此外,数据集明确标注朗读者身份为speaker_02,经WavLM-Base+模型验证其与其他说话者的平均相似度达0.898,进一步保障了声纹一致性。
使用方法
该数据集专为白俄罗斯语的自动语音识别任务设计,可直接用于训练和评估语音识别模型。用户可通过HuggingFace Datasets库加载数据,其中每条样本的'audio'字段提供音频张量及采样率信息,'text'字段提供对应的文本转录。建议在使用时结合数据集的置信度阈值进行进一步筛选,以适配不同精度要求的实验场景。
背景与挑战
背景概述
在白俄罗斯语自然语言处理与语音技术领域,高质量对齐的语音-文本数据资源极为匮乏,制约了该语言自动语音识别(ASR)系统的研发。yakub_kolas_novaya_zyamlya_output数据集由研究机构或开发者fosters创建并收录于Ministerskija合集,聚焦白俄罗斯语经典文学作品《Новая зямля》(雅库布·科拉斯著)的语音转录对齐。该数据集包含约1,434条公开发布的对齐片段,音频总时长近10小时,旨在为白俄罗斯语ASR模型训练提供精准的语音-文本配对数据。其发布填补了白俄罗斯语文学语音资源的空白,对低资源语言的语音技术研究具有重要推动意义,尤其为白俄罗斯语公众演讲与朗读风格的语音识别任务奠定了数据基础。
当前挑战
该数据集面临的核心挑战首先源于白俄罗斯语作为低资源语言的领域困境:语言学标注与语音语料库的稀缺,导致传统ASR模型难以获得足够多模态训练样本,尤其是长时语音的对齐精度与语义连贯性难以权衡。在构建过程中,数据集采用Gemini模型与两套独立ASR系统协同完成语音-文本对齐,但面对诗歌或散文类文本的韵律变化、语速差异及背景噪声干扰,对齐置信度(阈值设定为≥0.95)的严格把控可能引入数据稀疏风险。此外,录音源自单一朗读者(speaker_02),导致发音风格与声学特征的泛化能力受限,跨说话人场景下的模型迁移成为后续应用的核心瓶颈。
常用场景
经典使用场景
白俄罗斯语作为东斯拉夫语支中相对低资源的语言,其语音数据的稀缺一直制约着该语种语音技术的进步。yakub_kolas_novaya_zyamlya_output数据集正是为突破这一瓶颈而生,其经典使用场景聚焦于自动语音识别(ASR)系统的构建与优化。该数据集收录了白俄罗斯文学巨匠雅库布·科拉斯的长诗《新土地》的有声书录音,经过精细的语音-文本对齐处理,提供了近十小时的高质量语音片段及对应转录。研究者可将其作为核心训练或评估语料,用于搭建白俄罗斯语的端到端或混合ASR模型,进而填补该语种在智能语音交互领域的基础数据空白。
实际应用
在工业界与公共事业领域,该数据集具备广阔的实际应用前景。最直接的应用场景是打造面向白俄罗斯语用户的智能语音助手,使其能够准确理解该语种的语音指令,应用于车载系统、智能家居或移动端应用。此外,数据集还能赋能教育科技,支撑白俄罗斯语的语音学习与发音评测工具开发,帮助语言学习者矫正发音。在文化传承方面,该数据集可助力构建有声图书馆或数字人文项目,让珍贵的白俄罗斯文学作品通过语音形式实现更广泛的传播与保存。
衍生相关工作
围绕该数据集已衍生出一系列值得关注的研究工作。首先,它与同一收藏集下的其他白俄罗斯语有声书数据集(如ivan_navumenka_sasna_pry_daroze_output)形成了说话人识别的研究基础,基于WavLM-Base+模型进行的说话人聚类分析(相似度达0.95)为多说话人场景下的ASR系统设计提供了参考。其次,该数据集的高置信度对齐策略启发了后续研究者探索大语言模型与ASR模型协同工作的范式,推动了“LLM辅助语音对齐”这一新兴研究方向。最后,作为Ministerskija语料库的组成部分,它促使学界开始系统性地构建东斯拉夫语支低资源语言的语音资源体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务