nl-asr-cv
收藏资源简介:
该数据集是一个用于荷兰语自动语音识别(ASR)任务的数据集,名为“Dutch ASR (Common Voice, speaker-disjoint splits)”。它基于 Mozilla Common Voice 项目(CC0 许可证)的荷兰语部分构建,并通过特定的开源镜像获取。数据集专门设计用于微调小型 ASR 模型,例如 OpenAI 的 Whisper-tiny 模型。数据内容主要包括荷兰语的语音录音及其对应的转录文本。数据集包含三个标准分割:训练集(train)、开发集(dev)和测试集(test)。关键特点是开发集和测试集在说话人(client_id)和句子(text)两个维度上都与训练集完全不相交,确保了评估的独立性。官方 Common Voice 的开发集和测试集是通过按整个说话人进行限制(capped)来构建的。数据规模方面,训练集包含 98,355 个样本,约 74.4 小时音频;开发集包含 565 个样本,约 0.8 小时;测试集包含 1,494 个样本,约 2.0 小时。总数据集大小约为 16 GB。每个数据样本包含音频、时长、文本、语言代码、说话人标识符、分割标识、来源和质量评分等字段。适用于荷兰语语音识别模型的训练、验证和测试,尤其适合需要严格说话人和句子独立分割的研究或应用场景。
数据集概述:Dutch ASR (Common Voice, speaker-disjoint splits)
数据集名称:Dutch ASR (Common Voice, speaker-disjoint splits)
许可证:CC0-1.0
语言:荷兰语(nl)
任务类别:自动语音识别(Automatic Speech Recognition)
标签:nl、common-voice、speech
数据集来源
基于 Mozilla Common Voice(CC0 许可)构建,使用开源镜像 fsicoli/common_voice_17_0 处理,专为微调小型 ASR 模型(如 openai/whisper-tiny)而设计。
数据集划分
数据集包含三个划分,且开发集(dev)和测试集(test)在 说话人 和 句子 两个维度上与训练集完全不相交:
| 划分 | 时长(小时) | 样本数 |
|---|---|---|
| train | 74.4 | 98,355 |
| dev | 0.8 | 565 |
| test | 2.0 | 1,494 |
数据集中说话人被完整划分:Common Voice 官方 dev/test 中的说话人被完整保留(dev 约 0.75 小时,test 约 2.0 小时),剩余数据移入训练集。
数据字段
每条样本包含以下字段:
audio:音频数据,16 kHz 单声道duration:音频时长(float64)text:转录文本(string)lang:语言标签,固定为nl(string)client_id:匿名化说话人标识(string)split:所属划分(string)source:数据来源(string)quality_score:质量评分(float64)
数据规模
- 下载大小:22,277,861,010 字节
- 数据集总大小:16,020,142,038.184 字节




