it-mcv-pseudo-labeled-whisper-large-v3
收藏资源简介:
该数据集是一个面向语音识别任务的音频-文本对数据集,包含约3.46万个训练样本,总大小约26.8GB。每条样本包含16kHz采样率的音频、对应的文本转录、由Whisper模型生成的转录、是否基于前文条件(condition_on_prev)、前文文本(prev_text)、前文Whisper转录(prev_whisper_transcript)、说话人ID、音频时长(秒)、词错误率(WER)、唯一ID以及数据来源。数据集可用于训练和评估语音识别模型,也可用于说话人识别、语音转写质量分析等任务。
This dataset is an audio-text pair dataset for speech recognition tasks, containing approximately 34,600 training samples with a total size of about 26.8GB. Each sample includes audio sampled at 16kHz, corresponding text transcription, transcription generated by the Whisper model, whether it is conditioned on previous context (condition_on_prev), previous text (prev_text), previous Whisper transcription (prev_whisper_transcript), speaker ID, audio duration (in seconds), word error rate (WER), unique ID, and data source. The dataset can be used for training and evaluating speech recognition models, as well as for speaker identification, speech transcription quality analysis, and other tasks.
根据您提供的数据集详情页面信息,以下是关于该数据集的总结:
数据集概述
数据集名称:it-mcv-pseudo-labeled-whisper-large-v3
数据集地址:https://huggingface.co/datasets/lopozz/it-mcv-pseudo-labeled-whisper-large-v3
该数据集是一个意大利语语音识别相关的数据集,包含音频文件和对应的文本标注。
数据集配置与结构
- 配置名称:
default - 数据文件:
data/train-*(用于训练) - 分割(Split):仅包含
train分割
数据特征(Features)
数据集包含以下字段:
| 字段名称 | 数据类型 | 说明 |
|---|---|---|
audio |
Audio(采样率16000 Hz) | 音频数据 |
text |
字符串 | 原始文本标注 |
whisper_transcript |
字符串 | Whisper模型生成的转录文本 |
condition_on_prev |
布尔值 | 是否基于前文条件 |
prev_text |
字符串 | 前一个文本标注 |
prev_whisper_transcript |
字符串 | 前一个Whisper的转录文本 |
speaker_id |
字符串 | 说话人标识 |
duration |
浮点数 | 音频时长(秒) |
wer |
浮点数 | 词错误率 |
id |
字符串 | 数据ID |
source |
字符串 | 数据来源 |
统计信息
- 训练集样本数:34,638 个样本
- 数据集总体大小:约 26.86 GB(26,862,888,060 字节)
- 下载大小:约 26.85 GB(26,850,764,440 字节)
- 训练集存储大小:26,862,888,060 字节(与总大小一致)
训练集详情
- 训练集样本数为 34,638
- 数据以
train-*模式存储,表明可能按多个分片保存 - 使用 16 kHz 采样率的音频,适合语音识别任务
备注
该数据集本质上是基于 Common Voice(意大利语)构建的,结合了 Whisper Large V3 模型的伪标签,因此除了原始人工标注外,还提供了 Whisper 的自动转录结果,可用来对比或进行半监督学习等研究。




