遇见数据集

it-mcv-pseudo-labeled-whisper-large-v3

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集是一个面向语音识别任务的音频-文本对数据集,包含约3.46万个训练样本,总大小约26.8GB。每条样本包含16kHz采样率的音频、对应的文本转录、由Whisper模型生成的转录、是否基于前文条件(condition_on_prev)、前文文本(prev_text)、前文Whisper转录(prev_whisper_transcript)、说话人ID、音频时长(秒)、词错误率(WER)、唯一ID以及数据来源。数据集可用于训练和评估语音识别模型,也可用于说话人识别、语音转写质量分析等任务。

This dataset is an audio-text pair dataset for speech recognition tasks, containing approximately 34,600 training samples with a total size of about 26.8GB. Each sample includes audio sampled at 16kHz, corresponding text transcription, transcription generated by the Whisper model, whether it is conditioned on previous context (condition_on_prev), previous text (prev_text), previous Whisper transcription (prev_whisper_transcript), speaker ID, audio duration (in seconds), word error rate (WER), unique ID, and data source. The dataset can be used for training and evaluating speech recognition models, as well as for speaker identification, speech transcription quality analysis, and other tasks.

创建时间:
2026-09-05
原始信息汇总

根据您提供的数据集详情页面信息,以下是关于该数据集的总结:


数据集概述

数据集名称:it-mcv-pseudo-labeled-whisper-large-v3
数据集地址:https://huggingface.co/datasets/lopozz/it-mcv-pseudo-labeled-whisper-large-v3

该数据集是一个意大利语语音识别相关的数据集,包含音频文件和对应的文本标注。


数据集配置与结构

  • 配置名称default
  • 数据文件data/train-*(用于训练)
  • 分割(Split):仅包含 train 分割

数据特征(Features)

数据集包含以下字段:

字段名称 数据类型 说明
audio Audio(采样率16000 Hz) 音频数据
text 字符串 原始文本标注
whisper_transcript 字符串 Whisper模型生成的转录文本
condition_on_prev 布尔值 是否基于前文条件
prev_text 字符串 前一个文本标注
prev_whisper_transcript 字符串 前一个Whisper的转录文本
speaker_id 字符串 说话人标识
duration 浮点数 音频时长(秒)
wer 浮点数 词错误率
id 字符串 数据ID
source 字符串 数据来源

统计信息

  • 训练集样本数:34,638 个样本
  • 数据集总体大小:约 26.86 GB(26,862,888,060 字节)
  • 下载大小:约 26.85 GB(26,850,764,440 字节)
  • 训练集存储大小:26,862,888,060 字节(与总大小一致)

训练集详情

  • 训练集样本数为 34,638
  • 数据以 train-* 模式存储,表明可能按多个分片保存
  • 使用 16 kHz 采样率的音频,适合语音识别任务

备注

该数据集本质上是基于 Common Voice(意大利语)构建的,结合了 Whisper Large V3 模型的伪标签,因此除了原始人工标注外,还提供了 Whisper 的自动转录结果,可用来对比或进行半监督学习等研究。

搜集汇总
数据集介绍
it-mcv-pseudo-labeled-whisper-large-v3 数据集图片
构建方式
该数据集源自意大利语会议语音识别领域,通过先进的Whisper大型模型进行伪标签生成,构建了高质量的训练集。具体而言,利用Whisper-large-v3模型对无标注音频进行自动转写,产生初步的语音文本对,再经过去噪和过滤,保留高置信度样本。数据集包含音频文件、转写文本、条件前一语句信息及说话人标识,共计34,638条样本,音频采样率为16kHz,覆盖多种真实会议场景,为语音识别模型提供了丰富且多样的训练数据。
使用方法
使用时,研究者可通过HuggingFace datasets库加载数据,利用内置的audio特征解码音频并以文本进行监督训练。适用于微调专用语音识别模型或评估Whisper在意大利语会议的泛化能力,也可基于wer阈值进行数据清洗。条件前一语句信息可被用于上下文感知的序列到序列模型,而speaker_id支持说话人自适应,source字段允许进行跨域验证。该数据集直接可用于训练、验证和测试流程。
背景与挑战
背景概述
该数据集由意大利马尔凯理工大学(Università Politecnica delle Marche)于2024年创建,旨在推动自动语音识别(ASR)模型在意大利语上的性能研究。研究人员利用大规模无标注语音数据,通过Whisper Large-v3模型进行伪标签生成,构建了包含34,638条音频样本的训练集。其核心研究问题在于如何有效利用伪标签提升ASR系统在真实场景下的鲁棒性,尤其是针对不同说话人、口音和环境噪声的泛化能力。该数据集的发布为多语言语音识别领域提供了宝贵的资源,特别是对低资源语言(如意大利语)的模型优化具有重要意义,并促进了弱监督学习在语音处理中的实际应用探索。
当前挑战
该数据集所解决的领域问题主要集中在ASR对多样性和噪声环境下的识别性能提升上,挑战包括:1) 意大利语方言和口音多变,伪标签的生成可能引入系统性误差,导致模型学习到错误映射;2) 训练数据清洗与对齐难度大,需确保音频与文本的精确同步;3) 构建过程中,处理音频时长差异、背景噪声干扰以及录音设备多样性带来的非线性失真。此外,伪标签策略本身需应对长尾分布问题,稀有词或专业术语的识别率低下。这些挑战促使研究者在数据过滤、标签置信度评估及模型鲁棒性增强方面持续优化,以实现更可靠的ASR系统。
常用场景
经典使用场景
该数据集以意大利语为聚焦点,携带着大规模、多说话人的语音样本,其核心特征在于融合了自动语音识别(ASR)系统的伪标签与人工转录文本。这一设计使其成为训练、微调及评估多语种语音识别模型的理想基石,尤其在跨语种迁移学习与弱监督学习范式中展现深厚潜力。研究者常借助该数据集检验并优化端到端模型在不同声学环境及口音下的鲁棒性,同时探索如何高效利用含噪伪标签来提升模型泛化能力,从而为构建高精度、低资源语种的语音理解系统提供实验沃土。
解决学术问题
该数据集直面低资源语种语音识别中标注数据稀缺的学术瓶颈。通过惠供逾三万条精细标注的语音-文本对,并附带伪标签质量指标(如词错误率),数据集助力学术社群系统性地量化伪标签噪声对模型性能的影响,进而催生一系列关于噪声鲁棒训练策略、置信度加权学习以及半监督自我训练方法的实证研究。其结构化的说话人信息和上下文条件字段,还支撑了对说话人可变性与语言模型融合机制的深层探索,为解决真实场景下语音识别的适应性与稳定性问题提供了关键数据支持,对推动语言多样性的技术包容性具有里程碑意义。
实际应用
在实际应用层面,该数据集是研发智能语音交互系统不可或缺的资源,尤其适用于构建面向意大利语用户的语音助手、实时字幕生成工具及会议转写服务。其包含的说话人日志与时长元数据,可直接服务于说话人分离与角色标注等下游任务,赋能于客服质检与庭审记录的自动化处理。此外,伪标签与人工文本的镜像结构,为开发自训练与主动学习流水线提供了天然试验床,促使语音产品能以较低成本动态适应新领域术语或方言变体,加速了语音技术从实验室走向垂直行业应用的落地进程,诸如智慧医疗中的临床口述记录与教育领域的语言学习评估系统均能从中受益。
数据集最近研究
最新研究方向
该数据集聚焦于利用Whisper大型模型进行伪标签生成,以增强自动语音识别系统的鲁棒性。当前研究前沿在于探索半监督学习与自训练策略在低资源或特定领域语音数据上的应用,通过条件生成与错误率评估,优化伪标签质量,进而提升模型对真实世界语音变化的适应性。该数据集为多说话人、多源语音场景的持续学习提供了基准,推动了语音助手、会议转录等实际应用中的领域自适应与噪声抑制研究,其影响力正扩展至多模态学习与语音-文本联合建模的新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务