遇见数据集

Komzeras

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

该数据集是一个用于自动语音识别任务的布列塔尼语(Breton)语音数据集。数据来源于 Axel Landeau 在 YouTube 频道上发布的布列塔尼语视频录音,其对应的转录文本则发布在 Komzeras 博客上。数据集通过将原始音频与转录文本按 30 秒的音频块进行对齐处理而构建,总音频时长约为 1 小时 2 分钟 13 秒。数据集包含 128 个训练样本,每个样本由三个字段构成:title(标题,字符串类型)、audio(音频,采样率为 16000 Hz 的未解码音频数据)和 br(布列塔尼语转录文本,字符串类型)。数据集采用 CC-BY-SA-4.0 许可证发布。

This dataset is a Breton speech dataset for automatic speech recognition tasks. The data originates from Breton language video recordings published by Axel Landeau on a YouTube channel, with corresponding transcriptions released on the Komzeras blog. The dataset is constructed by aligning the original audio with transcription texts into 30-second audio chunks, with a total audio duration of approximately 1 hour, 2 minutes, and 13 seconds. It contains 128 training samples, each consisting of three fields: title (title, string type), audio (audio, undecoded audio data with a sampling rate of 16000 Hz), and br (Breton transcription text, string type). The dataset is released under the CC-BY-SA-4.0 license.

创建时间:
2026-06-21
原始信息汇总

数据集概述

数据集名称: Komzeras

语言: 布列塔尼语(br)

任务类别: 自动语音识别(automatic-speech-recognition)

许可证: CC-BY-SA-4.0

数据集来源: 原始视频来自 YouTube 频道 Komzeras(作者 Axel Landeau),转录文本来自博客。

数据集构建方法: 将 YouTube 视频的录音与博客提供的转录文本进行对齐,按 30 秒音频块切分,最终形成此数据集。

数据集规模: 总时长 1 小时 2 分钟 13 秒

数据集特征列:

  • title: 字符串类型,视频标题。
  • audio: 音频数据,采样率 16000 Hz,未解码(decode: false)。
  • br: 字符串类型,布列塔尼语转录文本。

数据集划分:

  • 训练集(train):包含 128 个样本,总字节数约 119.53 MB,下载大小约 119.47 MB。

数据文件路径: data/train-*(默认配置)

搜集汇总
数据集介绍
Komzeras 数据集图片
构建方式
该数据集源自Axel Landeau在YouTube平台发布的布列塔尼语视频及其配套博客Komzeras上的文本转录。通过将原始视频录音与对应文本按每30秒音频片段进行强制对齐,最终构建出包含128个样本的训练集,总时长约1小时2分13秒。所有音频均统一采样至16kHz,并以无损格式存储,确保数据的一致性与可用性。
特点
Komzeras数据集专注于低资源语言——布列塔尼语的语音识别任务,其独特之处在于完全基于真实语境下的视频内容,而非人工录制的实验室语音。每个样本包含原始标题、16kHz采样率的音频数据及对应布列塔尼语文本,覆盖了自然口语中的韵律、口音及背景噪声等复杂声学特征,为提升少数语种ASR系统的鲁棒性提供了宝贵资源。
使用方法
数据集通过Hugging Face Datasets库加载,默认配置为'train'分片,可直接用于训练自动语音识别模型。使用时需注意音频字段以字节流形式存储,需调用`dataset.cast_column('audio', Audio(sampling_rate=16000))`进行解码。由于数据规模较小,建议与迁移学习或数据增强技术结合,以充分适应布列塔尼语的声学与语言特性。
背景与挑战
背景概述
Komzeras数据集是一个专注于布列塔尼语(Breton)自动语音识别任务的低资源语料库,由Axel Landeau收集整理并于2024年发布。该数据集源自其YouTube频道上的布列塔尼语录音及其博客的对应转录文本,经过30秒音频片段的自动对齐处理,最终形成了包含128个样本、总时长约1小时2分钟的语音-文本配对数据集。布列塔尼语作为濒危的凯尔特语支语言,其数字化资源极度匮乏,Komzeras数据集的出现为极小众语言的语音识别研究提供了宝贵的基础数据支撑,推动了低资源多语言语音技术领域的发展。
当前挑战
该数据集面临的主要挑战包括:其一,布列塔尼语作为濒危语言,缺乏大规模标准化语料库及成熟的语音识别基线模型,数据稀缺性严重制约了端到端语音识别系统的训练效果;其二,录音采集自非专业环境下的YouTube视频,包含背景噪声、口音差异及语速变化等复杂声学特征,增加了声学模型鲁棒性训练的难度;其三,30秒音频切片的对齐依赖人工转录与自动对齐算法,若转录与音频在时间戳上存在偏差,可能导致语音-文本配对质量下降,影响下游任务的准确性。
常用场景
经典使用场景
Komzeras数据集专为低资源语言的自动语音识别(ASR)任务而设计,其经典使用场景集中于布列塔尼语的语音转文本研究。该数据集包含128条音频片段,每条时长约30秒,总计超过1小时的语音数据,采样率为16kHz,并配有对应的文本标题。研究者常利用此数据集训练端到端语音识别模型,或作为预训练语料在跨语言迁移学习中微调,以提升布列塔尼语等濒危语言的语音理解能力。
衍生相关工作
Komzeras数据集催生了多项针对低资源语言的语音识别创新工作。例如,研究者利用该数据探索wav2vec 2.0等自监督模型在布列塔尼语上的微调策略,验证了少量标注数据即可达到可观性能。另有工作结合数据增强技术(如SpecAugment)与多任务学习范式,在Komzeras上实现字符错误率的显著降低。这些衍生研究不仅提升了布列塔尼语的ASR水平,也为其他濒危语言(如奥克语、巴斯克语)的语音建模提供了方法论借鉴。
数据集最近研究
最新研究方向
Komzeras数据集聚焦于布列塔尼语的自动语音识别任务,其构建源于对濒危语言数字化的前沿探索。通过对齐YouTube视频录制与博客转写文本,该数据集提供了1小时2分钟的高质量语音样本。在低资源语言研究领域,此类数据集正成为突破性工具,推动方言与少数民族语言的语音模型开发。关联全球语言多样性保护热点,该资源的发布助力于弥合技术鸿沟,为布列塔尼语社区的文化传承与交互应用奠定基础,具有显著的语言复兴与社会影响意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务