遇见数据集

uilyam_folkner_pah_verbeny_output

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

该数据集名为“Пах вербены — Уільям Фолкнер”(威廉·福克纳的《Verbena的香味》),是Ministerskija集合的一部分,该集合专注于提供对齐的、带有转录的Belarusian(白俄罗斯语)有声读物音频数据。数据集旨在支持Belarusian语言的自动语音识别(ASR)任务。数据内容来源于Belarusian有声读物,经过处理被分割成约15秒的短音频片段,并与转录文本进行高精度对齐(对齐置信度≥0.95)。每条数据记录包含三个字段:音频片段(audio)、对应的转录文本(text,通过Gemini和ASR系统对齐生成)以及片段的唯一标识符(chunk_uid)。数据规模方面,在HuggingFace平台上发布了366条记录,总数据库包含531条记录,音频总时长约为1小时22分钟。该数据集适用于训练或评估Belarusian语音识别模型,尤其适用于处理有声读物风格的语音数据。

The dataset is named "Пах вербены — Уільям Фолкнер" (Scent of Verbena by William Faulkner), and it is part of the Ministerskija Collection, which focuses on providing aligned, transcribed Belarusian audiobook audio data. This dataset is designed to support automatic speech recognition (ASR) tasks for the Belarusian language. The dataset's content is sourced from Belarusian audiobooks, processed into short audio clips of approximately 15 seconds in length, and aligned with their corresponding transcriptions with high accuracy (alignment confidence ≥ 0.95). Each data record includes three fields: the audio clip (audio), the corresponding transcription text (text, generated via alignment using Gemini and ASR systems), and the unique identifier of the clip (chunk_uid). In terms of scale, 366 records have been released on the HuggingFace platform, while the full database contains 531 records with a total audio duration of approximately 1 hour and 22 minutes. This dataset is suitable for training or evaluating Belarusian speech recognition models, particularly for processing audiobook-style speech data.

创建时间:
2026-05-30
原始信息汇总

数据集概述

名称: Пах вербены (Pach verbeny)
作者: Уільям Фолкнер (William Faulkner)
语言: 白俄罗斯语 (Belarusian)
许可证: CC0-1.0
任务类型: 自动语音识别 (Automatic Speech Recognition, ASR)
标签: 有声书、白俄罗斯语、语音、ASR、对齐数据、speaker_03
数据规模: 1,000 到 10,000 行 (1K < n < 10K)

数据集详情

  • 发布行数 (Hugging Face): 366
  • 数据库总行数: 531
  • 音频总时长: 1小时22分钟
  • 对齐置信度阈值: ≥ 0.95

数据内容结构

每行包含三个字段:

  • audio: 音频片段,时长约15秒
  • text: 文本转录(由 Gemini 模型与 ASR 系统对齐生成)
  • chunk_uid: 片段唯一标识符

数据处理说明

该有声书内容被分割为短片段,并利用 Gemini 模型及两套独立的 ASR 系统进行文本与音频的对齐,对齐置信度不低于 0.95。

说话人/朗读者信息

属性
说话人聚类编号 speaker_03
平均相似度评分 0.898
最相近的已有数据集 dzintra_shultse_robertsik_output (相似度 0.94)

说话人识别基于 WavLM-Base+ 模型(余弦相似度,阈值=0.82)

所属合集

该数据集是 Ministerskija 合集的一部分,该合集包含对齐的白俄罗斯语有声书音频及其转录。

搜集汇总
数据集介绍
uilyam_folkner_pah_verbeny_output 数据集图片
构建方式
该数据集源自白俄罗斯语有声读物《Пах вербены》(威廉·福克纳原著),隶属于Ministerskija语料库集合。构建过程中,原始音频被切割为约15秒的短片段,并借助Gemini模型与两套独立的自动语音识别(ASR)系统进行转录对齐,最终筛选出置信度不低于0.95的高质量对齐片段,共计366条公开发布条目,音频总时长为1小时22分钟。
特点
数据集特点显著,每个条目包含音频片段、转录文本及唯一标识符,确保数据可追溯性。语音由单一说话者(speaker_03)录制,其声纹相似度平均达0.898,与邻近数据集具有高度一致性。音频时长适中,转录文本经多系统交叉验证,对齐精度高,适合用于白俄罗斯语自动语音识别(ASR)模型的训练与评估,尤其适用于中低资源语言的语音技术研究。
使用方法
使用者可通过HuggingFace数据集API直接加载该数据集,获取'audio'字段中的音频对象与'text'字段中的对应转录文本。推荐将其应用于白俄罗斯语ASR模型的微调或评估,亦可配合说话人识别任务使用,因其声纹特征已通过WavLM-Base+模型进行了聚类分析。数据许可采用CC0-1.0,完全开放无限制,便于学术与商业场景的复现与二次开发。
背景与挑战
背景概述
该数据集为白俄罗斯语语音识别研究提供了珍贵的资源,其核心是对威廉·福克纳作品《Пах вербены》的有声书录音进行片段化与文本对齐处理。由机构Ministerskija创建于近期,依托HuggingFace平台公开发布,旨在推动低资源语言(如白俄罗斯语)的自动语音识别(ASR)系统发展。数据集中包含531条对齐片段,时长总计约1小时22分钟,每条片段时长约15秒,并附有通过Gemini模型与两套独立ASR系统联合校准的高置信度(≥0.95)文本转录。数据集还提供了说话人聚类信息,明确标注了speaker_03的身份以及与其他数据集的相似度指标,为说话人识别与多任务学习奠定基础。该数据集填补了白俄罗斯语有声书领域高质量、对齐语料的空白,有望促进小语种语音技术的进步。
当前挑战
当前面临的主要挑战包括:1)领域问题层面,白俄罗斯语作为低资源语言,缺乏大规模、多样化的语音训练数据,现有模型常因语料匮乏导致识别准确率低下,尤其在方言、不同语速和噪声环境下鲁棒性不足。2)数据集构建过程中,需处理有声书录音的自然分割与文本精确对齐,依赖Gemini和双重ASR系统的自动校验机制虽可提升效率,但置信度阈值(≥0.95)的设定可能导致部分边缘样本被剔除,影响数据覆盖面。此外,单一说话人(speaker_03)的局限性使得模型泛化到其他说话者时面临挑战,而音频时长仅1.3小时,对于深度学习模型训练而言规模仍显不足,需结合其他数据集或采用预训练-微调策略加以弥补。
常用场景
经典使用场景
该数据集名为“Пах вербены — Уільям Фолкнер”,是为白俄罗斯语自动语音识别(ASR)任务精心构建的语音-文本对齐资源。其经典使用场景在于,它提供了来自白俄罗斯语音频书的高质量、低错误率的片段级语音与转录文本对,每个音频片段时长约15秒,且对齐置信度不低于0.95。研究者可借助此数据集训练端到端或混合式ASR模型,尤其针对低资源语言白俄罗斯语的声学建模,显著缓解数据稀缺问题。同时,由于数据源自文学朗读,该数据集也适合研究朗读风格语音的特征提取与解码策略。
实际应用
在实际应用层面,该数据集直接服务于白俄罗斯语的语音交互系统开发。例如,智能语音助手、语音转写工具以及有声书自动标注平台均可基于此数据训练白俄罗斯语识别引擎,提升对文学性朗读内容的转录准确率。此外,该数据集中说话人聚类信息(speaker_03)可用于多说话人场景下的语音分离与说话人识别,促进语音助手在个性化服务中的应用。由于采用了CC0-1.0许可证,该数据也便于企业或开发者自由集成,加速白俄罗斯语语音产品的落地。
衍生相关工作
该数据集作为Ministerskija集合的一部分,衍生出了一系列相关研究工作。例如,邻近数据集dzintra_shultse_robertsik_output与当前数据具有较高的说话人相似度(0.94),可联合用于构建多说话人、多文本来源的白俄罗斯语语音识别系统,提升模型的泛化能力。此外,该数据所使用的基于WavLM-Base+的说话人聚类方法和Gemini驱动的对齐流程,为其他低资源语言的语音数据集构建提供了技术范式,催生了更多关于跨语言语音对齐和零样本说话人验证的研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务