遇见数据集

ernest_heminguei_stary_chalavek_i_mora_output

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

该数据集名为Стары чалавек і мора(《老人与海》),是欧内斯特·海明威经典小说的白俄罗斯语译本有声读物。它属于Ministerskija集合,专门提供经过对齐处理的白俄罗斯语有声读物音频及其对应转录文本。数据集将完整有声读物分割成约15秒时长的音频片段,每个片段都配有通过Gemini和两个独立自动语音识别(ASR)系统进行高置信度(≥0.95)对齐后生成的准确转录文本。数据集共包含1,274条样本(其中在HuggingFace平台公开发布995条),音频总时长约为4小时30分钟。每个数据样本由三个字段构成:audio字段存储音频片段,text字段存储对应的转录文本,chunk_uid字段则是该片段的唯一标识符。该数据集主要用于白俄罗斯语的自动语音识别任务,为模型训练和评估提供了高质量的音频-文本对齐数据。

The dataset is named Стары чалавек і мора (The Old Man and the Sea), which is an audiobook of the Belarusian translation of Ernest Hemingways classic novel. It belongs to the Ministerskija collection, specifically providing aligned Belarusian audiobook audio and corresponding transcriptions. The dataset contains audio segments of approximately 15 seconds each, split from the complete audiobook, with each segment accompanied by accurate transcriptions generated through high-confidence (≥0.95) alignment using Gemini and two independent automatic speech recognition (ASR) systems. It includes a total of 1,274 samples (with 995 publicly released on HuggingFace), with an overall audio duration of about 4 hours and 30 minutes. Each data sample consists of three fields: audio for storing the audio segment, text for the corresponding transcription, and chunk_uid as the unique identifier for the segment. This dataset is primarily used for Belarusian automatic speech recognition tasks, providing high-quality audio-text aligned data for model training and evaluation.

创建时间:
2026-05-30
原始信息汇总

数据集概述:Стары чалавек і мора

  • 数据集名称:Стары чалавек і мора (The Old Man and the Sea)
  • 作者:Эрнэст Хемінгуэй (Ernest Hemingway)
  • 语言:白俄罗斯语 (Belarusian)
  • 许可证:CC0-1.0(公共领域)
  • 任务类别:自动语音识别 (Automatic Speech Recognition, ASR)
  • 标签:audiobook, belarusian, speech, asr, aligned, speaker_02
  • 数据规模:1,000 到 10,000 条样本 (1K<n<10K)
  • 数据集大小
    • 已发布行数 (Hugging Face):995
    • 数据库总行数:1,274
    • 音频总时长:4小时30分钟
    • 对齐置信度阈值:≥ 0.95

数据结构

每行数据包含三个字段:

  • audio:音频片段,时长约15秒
  • text:转录文本(通过 Gemini 和 ASR 对齐生成)
  • chunk_uid:片段唯一标识符

数据处理说明

该数据集来自 Ministerskija 集合,是白俄罗斯有声书的对齐音频和转录文本。有声书被分割成短片段,并利用 Gemini 和两个独立的 ASR 系统进行转录对齐,对齐置信度不低于 0.95。

朗读者 (Speaker) 信息

说话人身份通过 WavLM-Base+ 模型(余弦相似度,阈值=0.82)确定。

搜集汇总
数据集介绍
ernest_heminguei_stary_chalavek_i_mora_output 数据集图片
构建方式
该数据集以白俄罗斯语有声书《Стары чалавек і мора》(《老人与海》)为原始素材,通过将音频切割为约15秒的短片段,并结合Gemini模型与两套独立ASR系统进行转录对齐构建而成。对齐置信度阈值设定为不低于0.95,以确保数据质量。每个数据条目包含音频片段、对应文本转录及唯一标识符,最终收录995条经过严格筛选的样本,总音频时长约4小时30分钟。
特点
数据集隶属于Ministerskija合集,专为白俄罗斯语自动语音识别(ASR)任务设计。音频由编号为speaker_02的单一朗读者录制,经WavLM-Base+模型检测,其语音相似度平均得分为0.933,与相近数据集kuzma_chorny_poshuki_buduchyni_output相似度高达0.97,体现了稳定的说话人特征。数据采用CC0-1.0许可证发布,具有开放性和可复现性。
使用方法
数据集可直接用于训练或评测白俄罗斯语ASR模型。使用时需加载JSON格式的条目,每个条目提供'audio'字段存储音频片段路径或二进制数据,'text'字段提供对齐后的文本转录。建议按照典型语音识别流程划分训练集和测试集,并利用chunk_uid追踪片段来源。由于数据已处理为短片段且置信度高,适合直接输入端到端声学模型或语言模型进行微调。
背景与挑战
背景概述
该数据集创建于近年来,由名为fosters的研究者或机构发布,专注于白俄罗斯语的低资源自动语音识别(ASR)领域。其核心研究问题在于如何利用有限的语音数据,通过精确的对齐技术构建高质量的ASR数据集,以推动白俄罗斯语等小语种的语音技术发展。数据集基于海明威经典著作《老人与海》的白俄罗斯语有声书音频,经过切割和对齐处理,包含995条有效数据,总时长约4.5小时。该工作为白俄罗斯语ASR研究提供了对齐精度极高(置信度≥0.95)的基准资源,弥补了该语种在语音识别领域的数据缺口,对推动低资源语言的语音技术研究具有重要参考价值。
当前挑战
该数据集试图解决的领域核心挑战在于白俄罗斯语作为低资源语言,缺乏大规模、高质量且经过精准对齐的语音-文本配对数据,制约了ASR模型的训练与性能提升。在构建过程中,主要面临两大技术挑战:一是如何将长时间的有声书音频(4.5小时)自动分割为短片段并确保与对应文本的精确对齐,二是依赖单一ASR系统可能引入偏差,因此该工作采用双独立ASR系统(Gemini及另一系统)联合对齐策略,并以≥0.95的高置信度阈值筛选数据,以保障对齐质量。此外,说话人一致性验证(通过WavLM-Base+模型确认speaker_02簇)也是确保数据纯净度的关键步骤。
常用场景
经典使用场景
在白俄罗斯语自然语言处理研究中,该数据集主要服务于自动语音识别(ASR)系统的训练与评估。通过提供约4.5小时的高质量双语阅读音频与对应文本转录,其中每段音频被精准切分为约15秒的片段,并以≥0.95的高置信度完成语音与文本的对齐,为白俄罗斯语ASR模型提供了可靠的监督学习数据。研究者可借助这些经过精细对齐的语音-文本配对,对端到端语音识别模型进行微调或评估白俄罗斯语语音识别系统的表现,尤其适用于低频语言资源环境下的声学模型训练。
解决学术问题
该数据集有效缓解了白俄罗斯语在语音识别领域面临的数据稀缺问题。白俄罗斯语作为小众语言,其标注语音数据集极为匮乏,限制了相关学术研究的发展。此数据集通过从有声书资源出发,利用Gemini及双ASR系统进行自动对齐与置信度筛选,构建出高精度的语音-文本配对资源,为低资源语言的ASR研究提供了一条可复现的技术路径。其意义在于推动了白俄罗斯语数字语言资源的建设,为后续多语言语音处理、跨语种迁移学习及低资源ASR基准测试奠定了数据基础。
衍生相关工作
该数据集的构建方法启发了后续多项相关研究。例如,其所属的Ministerskija有声书集合提供了多说话人、多文本的白俄罗斯语语音-文本对齐资源,为研究跨说话人ASR泛化能力提供了基础。有研究者基于类似的对齐流水线,扩展至其他波罗的语系语言或斯拉夫语支的低资源方言。此外,数据集中使用的WavLM-Base+说话人嵌入模型验证了基于自监督预训练的声纹特征在低资源语言中的有效性,推动了对说话人聚类与ASR联合优化的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务