遇见数据集

DNU-ViSpeech

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

DNU-ViSpeech 是一个越南语脚本化/朗读语音语料库,专为自动语音识别(ASR)研究设计。该数据集包含来自 26 位匿名说话人的 31,070 条录音,总时长为 75.570 小时。音频格式为 WAV,采样率 16 kHz,单声道,无压缩 PCM 16-bit。数据集采用 Hugging Face AudioFolder 布局,每个分割(train/validation/test)包含独立的 metadata.csv 文件,音频文件按说话人编号组织。数据字段包括:audio(音频路径)、file_name(相对路径)、audio_id(匿名样本标识符)、speaker_id(说话人编号)、text(人工审核的转录文本)、text_normalized(归一化后的 ASR 参考文本)、prompt_text(提示文本)、prompt_text_normalized(归一化后的提示文本)、reference_source(来源:prompt_confirmed 或 human_corrected)、verification_level(验证等级:none、reviewed、verified)、review_status(审核状态:accepted 或 corrected)、qc_status(质量控制状态)、resampled_from_raw(是否重采样)、duration(时长秒数)、sample_rate(16000 Hz)、num_channels(1)、checksum_sha256(SHA-256 校验和)、split(分割标识)。数据分割为:训练集 22,616 条录音(55.936 小时,18 位说话人)、验证集 5,109 条录音(12.545 小时,4 位说话人)、测试集 3,345 条录音(7.088 小时,4 位说话人)。分割基于说话人不相交、校验和不相交、归一化参考文本不相交。测试集存在说话人身份与录音配置的混淆(部分文件从 44.1/48 kHz 重采样)。数据集附带 DNU-ASR-v1.1 协议,包含文本归一化、评分脚本及基准结果。基准结果涵盖 Whisper-large-v3、PhoWhisper-large、PhoWhisper-small、Parakeet-CTC-0.6B 等模型在零样本和微调设置下的 WER、CER 和说话人宏平均 WER。数据集使用 CC BY-NC 4.0 许可证,禁止商业用途。

DNU-ViSpeech is a Vietnamese scripted/read speech corpus designed for Automatic Speech Recognition (ASR) research. It contains 31,070 recordings from 26 anonymous speakers, totaling 75.570 hours. Audio is in WAV format, 16 kHz, mono, uncompressed PCM 16-bit. The dataset uses Hugging Face AudioFolder layout with separate metadata.csv files for each split (train/validation/test), and audio files are organized by speaker ID. Fields include: audio, file_name, audio_id, speaker_id, text, text_normalized, prompt_text, prompt_text_normalized, reference_source, verification_level, review_status, qc_status, resampled_from_raw, duration, sample_rate (16000 Hz), num_channels (1), checksum_sha256, and split. Data splits: training set 22,616 recordings (55.936 hours, 18 speakers), validation set 5,109 recordings (12.545 hours, 4 speakers), test set 3,345 recordings (7.088 hours, 4 speakers). Splits are based on speaker-disjoint, checksum-disjoint, and normalized reference text-disjoint. The test set has speaker identity and recording configuration confounds (some files resampled from 44.1/48 kHz). The dataset includes DNU-ASR-v1.1 protocol with text normalization, scoring scripts, and baseline results. Baseline results cover models like Whisper-large-v3, PhoWhisper-large, PhoWhisper-small, Parakeet-CTC-0.6B under zero-shot and fine-tuning settings, reporting WER, CER, and speaker macro-average WER. Licensed under CC BY-NC 4.0, prohibiting commercial use.

创建时间:
2026-09-04
原始信息汇总

DNU-ViSpeech 数据集概述

基本信息

  • 语言: 越南语(vi)
  • 许可证: CC BY-NC 4.0(知识共享-非商业使用 4.0 国际版)
  • 任务类型: 自动语音识别(ASR)
  • 数据类型: 越南语朗读语音(read-speech)
  • 数据集规模: 10K < n < 100K
  • 发布状态: 描述该数据集的论文正在审稿中

数据集简介

DNU-ViSpeech 是一个越南语脚本化/朗读语音语料库,专为自动语音识别(ASR)研究设计。该版本包含 26 位匿名说话人31,070 条语音,总计 75.570 小时。音频格式为 WAV,16 kHz 采样率,单声道,无压缩 PCM 16-bit。

数据划分

划分 说话人数 话语数 时长(小时)
训练集(train) 18(speaker001–speaker018) 22,616 55.936
验证集(validation) 4(speaker019–speaker022) 5,109 12.545
测试集(test) 4(speaker023–speaker026) 3,345 7.088
总计 26 31,070 75.570

划分具有说话人、校验和以及标准化参考文本三重不重叠特性。

数据字段

字段 说明
audio 由 AudioFolder 从 file_name 创建的音频对象
file_name 划分内 WAV 文件的相对路径
audio_id 稳定的匿名化样本标识符
speaker_id 匿名说话人标识(speaker001–speaker026)
text 人工审核的口语/参考转写文本
text_normalized v1.1 标准化后的 ASR 参考文本
prompt_text 参与者被要求朗读的文本
prompt_text_normalized 标准化后的提示文本
reference_source prompt_confirmedhuman_corrected
verification_level nonereviewedverified
review_status acceptedcorrected
qc_status 语料库质量控制状态
resampled_from_raw 源录音发布前是否需要重采样
duration 音频时长(秒)
sample_rate 所有文件均为 16,000 Hz
num_channels 所有文件均为 1
checksum_sha256 发布 WAV 的 SHA-256 校验和
split trainvalidationtest

敏感的人口统计属性和内部审阅者注释已从发布数据中剔除。

主要评估协议(DNU-ASR-v1.1)

  • 测试集包含 3,345 条话语,属于复合偏移设置(不可见说话人 + 录音配置变化)
  • 测试集不应用于纯通道鲁棒性或纯不可见说话人基准
  • 参考文本和假设必须使用相同的 v1.1 标准化器
  • 仓库包含完整的标准化和评分工具、单元测试及锁定参考文件

发布基准结果(测试集 WER/CER)

| 模型 | 设置 | 参数量 | WER (%) | CER (%) | 说话人宏平均 WER (%) | |---|---|---|---:|---:|---:|---:| | Whisper large-v3 | 零样本 | 1.55B | 7.15 | 3.84 | 5.83 | | PhoWhisper-large | 零样本 | 1.55B | 4.83 | 2.74 | 3.86 | | PhoWhisper-small | 零样本 | 244M | 6.60 | 3.60 | 5.25 | | PhoWhisper-small | 微调 | 244M | 4.89 | 2.77 | 4.10 | | Parakeet-CTC-0.6B 越南语 | 零样本 | 609M | 6.69 | 3.66 | 5.41 | | Parakeet-CTC-0.6B 越南语 | 微调 | 609M | 4.93 | 2.53 | 4.11 |

数据采集与转写

  • 采集方式: 参与者自行录音,按句子列表录制越南语朗读语音,通常分多次进行;每个句子保存为独立 WAV 文件
  • 转写流程: 转写文本源自已有提示文本,通过质量检查确认音频与提示是否匹配;采用 ASR 辅助筛选以优先安排人工审核
  • 质量审计: 全部 31,070 个文件经过 ASR 再审计,修正了 60 行转写文本并重新锁定协议
  • 验证覆盖: 测试集行标记为 verifiedreviewed;许多训练行仅通过自动检查,未进行逐句聆听

使用说明

  • 预期用途: 越南语朗读语音 ASR 训练和评估、小型模型适配研究、在文档化的复合偏移下进行可复现比较
  • 非预期用途: 自然/自发对话评估、将 26 位说话人泛化为越南语整体、跨人口群体的公平性结论、纯通道鲁棒性或纯不可见说话人声明、参与者的身份识别/监控/验证、商业用途

已知局限

  • 仅 26 位说话人,人口统计和地区多样性有限
  • 为朗读语音而非自发语音
  • 测试集小于训练集,且说话人间时长分布不均衡
  • 录音配置与划分边界存在混淆
  • 说话人间脚本难度差异显著
  • 逐句提示文本来源未记录,无法追溯
  • 各句子的验证深度不一
  • 存在一个遗留样本 ID 包含 .orig 后缀,不符合常规 ID 模式

伦理与隐私

  • 26 位参与者均提供了书面同意书,同意公开发布其音频和转写文本
  • 语音录音属于生物识别数据,匿名化 ID 不能完全消除重新识别风险
  • 参与者退出机制:在下一版本中移除对应说话人并记录变更
  • 发布数据已排除性别、出生年份、地区、录音设备、推断的录音环境和内部审阅者注释等敏感信息
搜集汇总
数据集介绍
DNU-ViSpeech 数据集图片
构建方式
DNU-ViSpeech乃越南语朗读语音语料库,专为自动语音识别(ASR)研究而构建。语料库汇集了26位匿名发音人的31,070条语音样本,总时长75.570小时,音频采用16kHz单声道PCM格式。录制过程中,发音人依提示句进行多场次自录,每句独立存储为WAV文件。数据集划分为训练、验证与测试三个子集,分别涵盖18、4、4位发音人,且子集间在发音人、文件校验和及规范化参考文本层面均无重叠,保障了评估的严谨性。转录文本源于预置提示,经人工校验与ASR辅助筛查双重把关,并对60条记录进行了修正,最终锁定v1.1协议规范。
使用方法
用户可通过Hugging Face的datasets库便捷加载数据,示例代码为`load_dataset("TrangLe2108/DNU-ViSpeech")`。数据集遵循AudioFolder布局,各划分内含metadata.csv文件。加载后,研究者除使用原始的音频与文本字段外,亦可利用预先规范化后的文本进行模型训练与评估。官方提供标准化脚本(lib_text_normalize.py)及评分程序(17_score_asr_v11.py),确保预测文本与参考文本经同一规范化流程处理。用户依指示安装依赖并运行测试后,可针对自定义模型输出计算WER、CER等指标,并与公布的基准结果进行严谨对照,鉴于测试集特殊性,研究者应避免将结果解释为纯信道鲁棒性或纯说话人适应性的评估。
背景与挑战
背景概述
DNU-ViSpeech是由Dai Nam University的Lê Thị Thùy Trang等人于2026年构建并公开发布的越南语朗读语音语料库,旨在推动自动语音识别(ASR)技术在越南语领域的适配研究。该数据集包含26位匿名说话人的31,070条话语,总时长约75.57小时,音频格式为16kHz单声道PCM WAV。其核心研究问题在于探索紧凑型ASR模型在领域微调后能否接近大规模零样本系统的性能,通过提供统一的评估协议DNU-ASR-v1.1,该语料库为越南语ASR的模型适配、性能基准测试以及语音识别系统的可重复性研究提供了关键资源,对低资源语言的语音识别研究具有重要参考价值。
当前挑战
该数据集面临的挑战包括领域问题和构建过程两方面。在领域层面,越南语作为低资源语言,其ASR研究受限于数据稀缺、说话人口音和录音环境多样性不足,且多数模型基于零样本迁移,难以在特定领域达到高精度,DNU-ViSpeech需解决如何通过特定领域微调提升紧凑模型性能的问题。在构建层面,语料库的构建面临多重困难:数据收集需协调26位说话人在多会话中录制并分别存储为独立WAV文件,但部分说话人时长未达目标;录音配置不统一(如部分说话人需重采样),导致说话人身份、数据集划分和录音配置相互混淆,测试集无法区分信道鲁棒性和说话人泛化效果;此外,转录文本的校对依赖于人工审核和ASR辅助筛查,尽管进行了全面复核并修正60条转录,但各数据集部分的验证深度不均,且提示文本的来源记录缺失,增加了数据质量控制的复杂度。
常用场景
经典使用场景
DNU-ViSpeech作为越南语朗读语音语料库,其经典使用场景聚焦于自动语音识别(ASR)模型的训练与评估。该数据集包含逾三万条话语,覆盖26位发音人,总时长约75.57小时,音频格式标准统一,为越南语ASR研究提供了规模适中且质量可控的训练与测试资源。研究者可借助其声学与文本配对数据,开发鲁棒的声学模型与语言模型,亦可基于其预定义的说话人独立划分,开展跨说话人泛化能力的验证。数据集的朗读风格特性,使其特别适用于需要高一致性发音样本的语音识别基准测试,例如词汇量受限的指令识别或朗读文本转写任务。此外,其分轨的元数据与文本规范化工具,为复现实验结果和比较不同算法性能提供了标准化的评估协定,促进了实验间的可复现性与公平对比。
解决学术问题
该数据集针对越南语ASR研究中数据匮乏与领域适配难的困境,提供了一套基准资源与评估协议(DNU-ASR-v1.1),有效解决了小样本条件下模型泛化性能的系统性评估问题。它通过构建既包含未见说话人又包含录音配置变化的复合测试集,揭示了跨域迁移中声学环境与说话人特征互相纠缠的挑战,促使研究者反思现有评估指标的局限性。凭借其细致标注的文本层级(如提示文本与参考转写分离)及修正后的参考标签,该语料库支持对ASR系统错误模式的深入分析,助力于识别发音变体、同音字混淆等领域特有的难点,从而推动越南语语音识别技术的可靠进步。同时,其公开的规范化与评分脚本,消除了评估流程中的主观偏差,为后续研究树立了可量化的比较标杆,间接提升了研究成果的可信度与可复现性。
实际应用
在实际应用层面,DNU-ViSpeech的价值体现在可部署于越南语智能交互系统、语音搜索及字幕生成等场景的ASR模型研发中。基于该语料库微调的紧凑型模型(如PhoWhisper-small),在资源受限的边缘设备上实现了接近大型零样本系统的识别精度,这为实时语音助手在移动终端和嵌入式设备的本地化处理提供了可能。该数据集亦适用于开发面向越南语学习者的口语评测工具,借助其规范发音样本与文本对齐,可精准诊断学习者的发音偏误。在智慧城市和呼叫中心等实际业务中,利用该读语料进行增量训练,可显著提升系统对特定领域术语或标准口音的适应能力,从而优化用户体验与运营效率。此外,其禁止商业使用的许可限制,暗示其在科研原型向产业转化过程中需审慎处理版权,故典范应用更多体现在科研验证与技术方案可行性的预研层面。
数据集最近研究
最新研究方向
DNU-ViSpeech作为越南语朗读语音识别的新兴语料库,聚焦于紧凑模型在领域微调后能否逼近大型零样本系统的性能边界。该数据集以26位匿名说话人的31,070条话语构成75.57小时音频,其独特的说话人与录音配置复合偏移测试协议,为研究越南语ASR的域适应性与鲁棒性提供了严谨基准。当前基准评测揭示,PhonWhisper-small经微调后可显著提升词错误率表现,而Parakeet-CTC-0.6B经微调亦展现出竞争力,这彰显了模型压缩与适配策略在低资源语种上的潜力。该资源的发布不仅推动越南语语音识别技术向高效、精准方向演进,也为评估模型在真实复杂声学条件下的泛化能力提供了重要参照,对东南亚语种语音技术的普惠发展具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务