遇见数据集

Jaspernl/The_Spoken_Wikipedia_Corpora_Dutch_ASR_Hiidden

收藏
Hugging Face2024-07-06 更新2024-07-06 收录
官方服务:

资源简介:

Spoken Wikipedia Corpora(SWC)是一个包含荷兰语维基百科文章的对齐语音语料库。该语料库包含大约210小时的音频、转录和元数据,适用于语音识别、韵律和语言研究。数据集的结构包括每个实例的音频文件和对应的转录文本。数据集的创建过程包括从维基百科项目中收集数据、对齐音频和文本、清理和处理音频片段等步骤。数据集不包含个人或敏感信息,主要用于开发无障碍技术,但也可能存在维基百科内容和志愿者读者人口特征带来的偏见。

The Spoken Wikipedia Corpora (SWC) is a collection of aligned spoken Wikipedia articles including articles in Dutch. It includes approximately 210 hours of audio, transcriptions, and metadata. The corpus is licensed under CC BY-NC-SA 4.0 and includes valuable resources for research in speech recognition, prosody, and language studies. The dataset structure includes audio files and their corresponding transcriptions for each instance. The creation process involves collecting data from the Spoken Wikipedia project, aligning audio with text, and cleaning and processing audio fragments. The dataset does not contain personal or sensitive information and is primarily used for developing accessible technologies, though it may reflect biases present in Wikipedia content and the demographic characteristics of its volunteer readers.

提供机构:
Jaspernl
原始信息汇总

数据集概述

数据集简介

The Spoken Wikipedia Corpora (SWC) 是一个包含荷兰语的口述维基百科文章的对齐集合。该数据集包含约210小时的音频、转录文本和元数据,适用于语音识别、韵律和语言研究。

支持的任务和排行榜

  • 自动语音识别 (ASR)

语言

  • 荷兰语

数据集结构

数据实例

每个实例代表一个口述维基百科文章片段,包含音频文件及其转录文本。

示例实例

json { "file_name": "data/audio_1_0.mp3", "transcription": "ziek is een buurtschap in de nederlandse gemeente montferland" }

数据字段

  • file_name: 音频文件的路径
  • transcription: 音频的对应转录文本

数据分割

数据集未明确划分为训练、验证和测试集,用户可以根据特定需求自行创建分割。

数据集创建

数据收集和规范化

数据来源于口述维基百科项目,志愿者朗读维基百科文章,音频与文本在句子级别对齐。

数据处理

  • 使用Whisper v3-large提取带时间戳的句子。
  • 与原始(规范化)转录文本匹配,基于相似度评分保留原始文本。
  • 裁剪音频文件并添加对应转录文本。

注释

注释过程

注释包括句子级别的对齐,将音频与对应文本链接。注释由SWC项目开发者使用自动化工具创建,并手动验证以确保准确性。

个人信息和敏感信息

数据集不包含个人信息或敏感信息,由公开的维基百科文章和志愿者朗读组成。

使用数据的注意事项

数据集的社会影响

该数据集有助于开发对音频内容有需求的个人使用的可访问技术,如视障人士或有阅读困难的人。

数据集的偏见

数据集可能反映维基百科内容和志愿者读者群体的特征,影响语音模式和话题的多样性。

其他已知限制

数据集可能存在不完整的转录文本和偶尔的对齐错误。部分介绍性和免责声明文本未包含在原始转录中,需要手动处理。

附加信息

数据集许可证

数据集采用CC BY-NC-SA 4.0许可证。

引用信息

如使用该数据集,请引用以下论文: bibtex @inproceedings{schweitzer2016spwc, title={The Spoken Wikipedia Corpora}, author={Schweitzer, Arne and Lewin, Florian and Lensch, Armin and Mandera, Paweł and Matuschek, Michael and Schiel, Florian}, booktitle={Proceedings of the Tenth International Conference on Language Resources and Evaluation (LREC 2016)}, year={2016}, organization={European Language Resources Association (ELRA)}, note={Dataset available at Hugging Face: @JasperNL https://huggingface.co/datasets/Jaspernl/The_Spoken_Wikipedia_Corpora_Dutch_ASR_Hiidden)} }

搜集汇总
数据集介绍
Jaspernl/The_Spoken_Wikipedia_Corpora_Dutch_ASR_Hiidden 数据集图片
构建方式
该数据集源自Spoken Wikipedia项目,由志愿者朗读荷兰语维基百科文章,原始音频与文本在句子级别对齐。由于原始转录与音频片段存在不匹配(如包含免责声明等额外文本),@JasperNL采用Whisper v3-large模型提取带时间戳的句子,并与原始(标准化)转录基于相似度评分进行自动匹配,仅保留原始转录内容。随后对音频文件进行裁剪,并添加对应的精确转录,最终形成约210小时、54334个样本的高质量荷兰语语音识别数据集。
特点
数据集以音频-文本对形式呈现,每个样本包含音频文件路径及其对应转录,覆盖维基百科的广泛主题和多样朗读风格。其独特之处在于经过精细的自动对齐与清洗处理,剔除了原始音频中与文章内容无关的免责声明等干扰片段,显著提升了语音与文本的一致性。数据集未预设训练/验证/测试划分,赋予使用者高度灵活性,可依据具体研究需求自定义分割方案。
使用方法
该数据集专为自动语音识别(ASR)任务设计,可直接用于训练、评估荷兰语语音识别模型。使用时,用户需加载音频文件及其对应的转录文本,根据实际需要自行划分训练集、验证集和测试集。数据集以HuggingFace Datasets格式提供,支持通过`load_dataset`函数便捷加载。推荐结合现有ASR框架(如Whisper、Wav2Vec2等)进行模型微调与性能评测。
背景与挑战
背景概述
《The Spoken Wikipedia Corpora Dutch ASR Hiidden》数据集诞生于自然语言处理与语音技术交叉融合的浪潮之中,由Schweitzer等研究者在2016年LREC会议上正式发布,其核心研究机构涵盖欧洲多所知名大学与语言资源协会。该数据集以维基百科社区志愿者朗读的荷兰语文章为基石,构建了约210小时的高质量语音-文本对齐语料,旨在推动自动语音识别(ASR)系统在多样化主题与口语风格下的鲁棒性研究。作为Spoken Wikipedia Corpora系列的重要分支,它填补了低资源语言荷兰语在语音识别领域大规模、开放许可数据集的空白,为后续的跨语言语音建模、韵律分析及人机交互技术奠定了坚实基础,其对学术界与工业界的影响力在Interspeech 2018等顶级会议中持续显现。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:荷兰语ASR系统需应对维基百科内容带来的词汇多样性、口语化表达及长尾术语,这要求模型具备强大的泛化能力,以克服传统语音识别在开放域场景下的性能瓶颈。其次,构建过程中遭遇多重技术难题:原始音频与文本存在不对齐现象,如片头片尾的免责声明(如“Deze opname en alle tekst vallen onder de Creative Commons gelijkdelen licentie”)未被收录于原始转录中,需借助Whisper v3-large等先进模型进行句子级时间戳提取与相似度匹配,再通过自动裁剪与人工验证完成精准对齐。此外,志愿者朗读者的口音、语速差异及背景噪声的不可控性,进一步增加了数据清洗与标准化处理的复杂性,而这些努力均由@JasperNL等开发者通过定制化脚本细致完成。
常用场景
经典使用场景
作为荷兰语自动语音识别(ASR)领域的经典基准数据集,The_Spoken_Wikipedia_Corpora_Dutch_ASR_Hiidden广泛用于训练和评估端到端语音识别模型。该数据集包含约210小时的高质量朗读语音,源自维基百科志愿者朗读的荷兰语文章,并经过Whisper模型辅助的句子级精确对齐与清洗。研究者通常将其划分为训练集、验证集和测试集,用以衡量模型在荷兰语多主题、多风格语音上的词错误率(WER)表现,是荷兰语ASR研究不可或缺的标准化评估资源。
实际应用
在实际应用中,该数据集支撑了荷兰语智能语音助手、有声内容自动生成以及教育辅助工具的开发。例如,基于该数据训练的ASR模型可被集成到荷兰语维基百科的语音播报功能中,为视障用户提供无障碍的百科知识获取体验。此外,该数据集还服务于荷兰语媒体内容的自动字幕生成、会议记录转写以及语言学习软件的发音评测模块,显著提升了荷兰语语音交互系统在真实场景中的可用性与覆盖度。
衍生相关工作
该数据集衍生了一系列具有影响力的研究工作。原始SWC论文(LREC 2016)提出了多语种口语维基语料库的构建框架,而后续Interspeech 2018的论文则基于此数据集设立了荷兰语ASR排行榜,催生了多种声学模型架构的比较研究。JasperNL等人进一步采用Whisper进行对齐优化的工作,为低质量语音-文本对齐问题提供了可复用的技术路线。此外,该数据还常与Common Voice等荷兰语语音库联合使用,用于探究多源数据融合对ASR性能的提升效果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务