遇见数据集

vispeech-whisper-features

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

ViSpeech是一个面向噪声鲁棒课堂自动语音识别(ASR)的多条件越南语音数据集。本版本提供了经过Whisper-small特征提取器预处理的log-mel谱图特征(input_features)和经过Whisper-small分词器处理的标签token ID(labels),不包含原始音频。数据集总时长37.62小时,采用配对录制设计(同一说话者在安静房间和真实课堂条件下朗读相同脚本),包含36.50小时的噪声增强训练语料、1.12小时的保留验证集以及一个独立收集的221条真实噪声课堂基准测试集。具体配置包括:p1、p2、p3分别对应课程学习训练的三个阶段(训练集),ev为验证集,ev_noisy_snr10/15/20为添加不同信噪比噪声的测试集,benchmark_clean为真实噪声课堂基准测试集(经标签审计移除一条误标话语)。本数据集仅供非商业研究使用,遵循CC BY-NC-SA 4.0许可,部分内容衍生于VIVOS数据集。

ViSpeech is a multi-condition Vietnamese speech dataset for noise-robust classroom automatic speech recognition (ASR). This version provides log-mel spectrogram features (input_features) preprocessed by Whisper-small feature extractor and label token IDs (labels) processed by Whisper-small tokenizer, without original audio. The total duration is 37.62 hours, with a paired recording design (the same speaker reads the same script in a quiet room and real classroom conditions). It includes 36.50 hours of noise-augmented training data, 1.12 hours of reserved validation set, and an independently collected benchmark test set of 221 real noisy classroom utterances. Specific configurations include: p1, p2, p3 corresponding to three stages of curriculum learning (training sets), ev as the validation set, ev_noisy_snr10/15/20 as test sets with different signal-to-noise ratios, and benchmark_clean as the real noisy classroom benchmark test set (with one mislabeled utterance removed after label auditing). This dataset is for non-commercial research only, licensed under CC BY-NC-SA 4.0, with partial content derived from the VIVOS dataset.

创建时间:
2026-09-26
原始信息汇总

ViSpeech (Whisper-small preprocessed features) 数据集总结

基本信息

  • 数据集地址:https://huggingface.co/datasets/Hongthien06/vispeech-whisper-features
  • 许可证:CC BY-NC-SA 4.0(非商业性、相同方式共享)
  • 语言:越南语(vi)
  • 任务类别:自动语音识别(automatic-speech-recognition)
  • 标签:vietnamese、speech、whisper、classroom-asr、noise-robust
  • 别名:ViSpeech (Whisper-small preprocessed features)

数据集简介

本仓库包含论文《ViSpeech: A Multi-Condition Vietnamese Speech Dataset for Noise-Robust Classroom ASR》(T. D. Tran 等,FISAT 2026,Springer)所使用的预processed特征集。

ViSpeech 是一个 37.62 小时的多条件越南语语音语料库,基于配对录音设计构建——相同的说话者在安静房间和真实教室两种条件下朗读相同脚本,包含 36.50 小时的噪声增强训练语料、1.12 小时的留出验证集,以及独立采集的 221 条真实噪声教室基准。

格式说明

  • 本数据集不是原始音频文件。
  • 每个样本包含:
    • input_features:由 openai/whisper-small 特征提取器生成的 log-mel 频谱图;
    • labels:由 openai/whisper-small 分词器生成的目标 token ID。
  • 本发布版本用于使用 Whisper-small 精确复现论文的训练与评估流程。转录文本可通过 Whisper 分词器解码 labels 恢复;原始波形无法从 log-mel 特征中恢复。

配置(Configurations)

配置 划分 描述
p1 train 课程学习第 1 阶段训练语料
p2 train 课程学习第 2 阶段训练语料
p3 train 课程学习第 3 阶段训练语料
ev validation 留出验证集(1.12 小时)
ev_noisy_snr10 test 添加 10 dB SNR 噪声的验证集
ev_noisy_snr15 test 添加 15 dB SNR 噪声的验证集
ev_noisy_snr20 test 添加 20 dB SNR 噪声的验证集
benchmark_clean test 221 条真实噪声教室基准(标签审核时移除一条误标注样本)

各配置数据规模

配置 划分 样本数 数据大小(字节) 下载大小(字节)
benchmark_clean test 221 212,296,239 212,341,777
ev validation 1,036 995,111,080 995,356,312
ev_noisy_snr10 test 1,036 995,111,080 995,356,312
ev_noisy_snr15 test 1,036 995,111,080 995,356,312
ev_noisy_snr20 test 1,036 995,111,080 995,356,312
p1 train 11,660 11,199,970,288 11,202,731,687
p2 train 2,479 2,381,323,256 2,381,911,295
p3 train 28,278 27,162,587,088 27,169,281,913

特征结构

所有配置的样本特征一致:

  • input_features:嵌套的 float32 列表(log-mel 频谱图)
  • labels:int64 列表(目标 token ID)

使用方式

python from datasets import load_dataset from transformers import WhisperTokenizer

ds = load_dataset("Hongthien06/vispeech-whisper-features", "benchmark_clean", split="test")

从 labels 解码转录文本

tok = WhisperTokenizer.from_pretrained("openai/whisper-small", language="vi", task="transcribe") text = tok.decode([t for t in ds[0]["labels"] if t >= 0], skip_special_tokens=True)

数据文件路径

配置 划分 路径
benchmark_clean test benchmark_clean/test-*
ev validation ev/validation-*
ev_noisy_snr10 test ev_noisy_snr10/test-*
ev_noisy_snr15 test ev_noisy_snr15/test-*
ev_noisy_snr20 test ev_noisy_snr20/test-*
p1 train p1/train-*
p2 train p2/train-*
p3 train p3/train-*

许可与署名

  • 采用 CC BY-NC-SA 4.0 许可发布(非商业性、相同方式共享)。
  • 语料库部分源自 VIVOS(AILAB, VNUHCM — University of Science),该数据集以 CC BY-NC-SA 4.0 许可仅用于研究目的:https://huggingface.co/datasets/AILAB-VNUHCM/vivos。对 VIVOS 衍生部分应用的修改包括 DSP 预处理和加性噪声(AWGN)增强。源许可的 ShareAlike 条件通过以相同许可发布整个语料库得以保留。
  • 依据 VIVOS 使用条款,本数据集用户同意不尝试确定语料库中任何说话者的身份。

伦理与同意

  • 教室录音在获得说话者口头同意(录音、研究使用和公开发布)以及主管讲师许可的情况下采集。
  • 转录文本不包含学校名称;可能出现的个人姓名已获得相关个人同意。
  • 文件名和元数据不包含任何可识别信息。

引用

bibtex @inproceedings{tran2026vispeech, title = {ViSpeech: A Multi-Condition Vietnamese Speech Dataset for Noise-Robust Classroom ASR}, author = {Tran, Thi Dung and Pham, Thi Ngoc Oanh and Vo, Hong Thien and Nguyen, Huy Khang and Tran, Nhat Long and Tran, Duc Anh}, booktitle = {Proceedings of FISAT 2026}, publisher = {Springer}, year = {2026} }

搜集汇总
数据集介绍
vispeech-whisper-features 数据集图片
构建方式
在越南语课堂语音识别领域,噪声鲁棒性研究长期受限于缺乏配对录制的多条件语料。ViSpeech数据集采用配对录制设计,由同一批说话人在安静房间与真实教室两种声学环境下朗读相同脚本,从而严格控制说话人与文本内容变量。原始波形经openai/whisper-small特征提取器转换为对数梅尔频谱,并利用同款分词器生成目标token ID,形成端到端训练可直接消费的预计算特征。训练语料按课程学习策略划分为p1、p2、p3三个阶段,分别对应11,660、2,479与28,278条样本;验证集ev含1,036条样本,时长约1.12小时;基准测试集benchmark_clean包含221条真实噪声课堂话语,并在标签审核中剔除一条误标注样本。此外,验证集通过加性高斯白噪声在10、15、20 dB信噪比下进行增强,衍生出ev_noisy_snr10、ev_noisy_snr15与ev_noisy_snr20三个噪声测试配置,用于系统评估模型在不同噪声强度下的鲁棒性。
使用方法
使用者可通过HuggingFace datasets库以编程方式加载任意配置,例如指定benchmark_clean配置并选择test划分即可获取基准测试数据。由于样本仅含input_features与labels两个字段,模型训练时可直接将input_features作为Whisper-small编码器的输入,将labels作为解码器的监督目标,无需在线特征提取。若需恢复文本转录,可调用WhisperTokenizer.from_pretrained加载openai/whisper-small分词器,并对labels中非负值序列执行decode操作,同时设置skip_special_tokens为True以过滤特殊标记。该数据集适用于三类典型场景:在p1至p3配置上按课程学习策略训练噪声鲁棒ASR模型;在ev配置上监控验证集性能;在ev_noisy_snr10、ev_noisy_snr15、ev_noisy_snr20及benchmark_clean配置上评估模型在合成噪声与真实课堂噪声下的泛化能力。需注意,log-mel特征不可逆,原始波形无法由此恢复。
背景与挑战
背景概述
越南语课堂场景的自动语音识别长期受限于真实环境噪声与标注资源稀缺,既有语料多聚焦朗读式安静条件,难以支撑噪声鲁棒性研究。在此背景下,ViSpeech 由 Tran 等人于 2026 年发布,基于配对录音设计构建了 37.62 小时的多条件越南语语音语料,涵盖安静房间与真实教室两种声学环境,并辅以加性噪声增强。该数据集同时提供 Whisper-small 预处理后的对数梅尔频谱与目标 token 序列,旨在为课堂 ASR 的噪声鲁棒性训练与评估提供可复现基准。其配对录音结构与多信噪比验证集为领域内噪声条件语音识别研究提供了受控实验平台。
当前挑战
领域层面,课堂 ASR 的核心挑战在于真实教室中混响、多人干扰与设备差异导致的声学失配,以及越南语标注资源的稀缺性;ViSpeech 需在有限说话人与脚本条件下构建兼具安静与噪声配对样本的语料,以支撑噪声鲁棒性建模。构建过程中,配对录音要求同一说话人在两种声学环境下朗读相同脚本,采集协调与一致性控制难度较大;真实教室基准仅含 221 条独立样本,且标注审计中发现一条错误标注样本,凸显小规模真实噪声基准的标注质量风险。此外,发布形式为 Whisper 预处理特征而非原始波形,虽保证训练管线可复现,却限制了特征层面的再加工与跨模型迁移。
常用场景
经典使用场景
在越南语课堂语音识别研究中,ViSpeech数据集凭借其配对录音设计与多条件噪声增强策略,成为评估噪声鲁棒性模型性能的基准资源。该数据集以Whisper-small提取的log-mel频谱图与标记化标签作为输入输出对,支持课程学习式训练流程,经典场景涵盖干净验证集上的基线评估、不同信噪比(10、15、20 dB)下的噪声鲁棒性测试以及真实教室噪声基准的泛化验证,为模型在越南语教育场景中的降噪能力提供标准化对比平台。
解决学术问题
该数据集直面越南语课堂语音识别中噪声干扰导致识别率骤降的学术难题,通过配对录音设计构建了同一说话人、同一文本在安静与真实教室条件下的对照样本,并借助加性高斯白噪声增强生成可控信噪比的测试集,使研究者能够系统分离噪声因素对声学建模的影响。其预提取特征格式消除了特征提取差异,保证了实验可复现性,为噪声鲁棒性算法、课程学习策略以及跨条件泛化研究提供了严谨的数据基础,推动了低资源语言在教育场景下的鲁棒语音识别进展。
实际应用
在实际教学环境中,ViSpeech数据集支撑的模型可部署于越南语课堂的实时语音转写系统,辅助教师生成课堂记录、为听障学生提供字幕,或在嘈杂教室中实现语音指令交互。其课程学习配置(p1至p3)允许模型从相对简单的声学条件逐步适应复杂噪声,提升在真实教室中的识别准确率。此外,基于该数据集训练的模型可迁移至其他越南语噪声场景,如会议记录、远程教学等,具有广泛的教育技术应用前景。
数据集最近研究
最新研究方向
在越南语课堂场景的噪声鲁棒自动语音识别研究中,该数据集推动了基于Whisper-small预提取特征的可复现性基准构建,近期方向聚焦于课程学习策略下的多阶段噪声自适应训练与跨信噪比泛化评估。依托配对录音设计,研究者得以在受控条件下系统探究加性高斯白噪声对声学建模的影响,并借助真实课堂噪声基准检验模型从合成噪声向真实环境迁移的能力。这一资源契合低资源语言语音识别与教育场景语音增强的交叉热点,为越南语课堂ASR的公平比较提供了标准化特征接口,对推动东南亚语言语音技术落地及教育可及性具有积极意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务