DNU-ViSpeech
收藏资源简介:
DNU-ViSpeech 是一个越南语脚本化/朗读语音语料库,专为自动语音识别(ASR)研究设计。该数据集包含来自 26 位匿名说话人的 31,070 条录音,总时长为 75.570 小时。音频格式为 WAV,采样率 16 kHz,单声道,无压缩 PCM 16-bit。数据集采用 Hugging Face AudioFolder 布局,每个分割(train/validation/test)包含独立的 metadata.csv 文件,音频文件按说话人编号组织。数据字段包括:audio(音频路径)、file_name(相对路径)、audio_id(匿名样本标识符)、speaker_id(说话人编号)、text(人工审核的转录文本)、text_normalized(归一化后的 ASR 参考文本)、prompt_text(提示文本)、prompt_text_normalized(归一化后的提示文本)、reference_source(来源:prompt_confirmed 或 human_corrected)、verification_level(验证等级:none、reviewed、verified)、review_status(审核状态:accepted 或 corrected)、qc_status(质量控制状态)、resampled_from_raw(是否重采样)、duration(时长秒数)、sample_rate(16000 Hz)、num_channels(1)、checksum_sha256(SHA-256 校验和)、split(分割标识)。数据分割为:训练集 22,616 条录音(55.936 小时,18 位说话人)、验证集 5,109 条录音(12.545 小时,4 位说话人)、测试集 3,345 条录音(7.088 小时,4 位说话人)。分割基于说话人不相交、校验和不相交、归一化参考文本不相交。测试集存在说话人身份与录音配置的混淆(部分文件从 44.1/48 kHz 重采样)。数据集附带 DNU-ASR-v1.1 协议,包含文本归一化、评分脚本及基准结果。基准结果涵盖 Whisper-large-v3、PhoWhisper-large、PhoWhisper-small、Parakeet-CTC-0.6B 等模型在零样本和微调设置下的 WER、CER 和说话人宏平均 WER。数据集使用 CC BY-NC 4.0 许可证,禁止商业用途。
DNU-ViSpeech is a Vietnamese scripted/read speech corpus designed for Automatic Speech Recognition (ASR) research. It contains 31,070 recordings from 26 anonymous speakers, totaling 75.570 hours. Audio is in WAV format, 16 kHz, mono, uncompressed PCM 16-bit. The dataset uses Hugging Face AudioFolder layout with separate metadata.csv files for each split (train/validation/test), and audio files are organized by speaker ID. Fields include: audio, file_name, audio_id, speaker_id, text, text_normalized, prompt_text, prompt_text_normalized, reference_source, verification_level, review_status, qc_status, resampled_from_raw, duration, sample_rate (16000 Hz), num_channels (1), checksum_sha256, and split. Data splits: training set 22,616 recordings (55.936 hours, 18 speakers), validation set 5,109 recordings (12.545 hours, 4 speakers), test set 3,345 recordings (7.088 hours, 4 speakers). Splits are based on speaker-disjoint, checksum-disjoint, and normalized reference text-disjoint. The test set has speaker identity and recording configuration confounds (some files resampled from 44.1/48 kHz). The dataset includes DNU-ASR-v1.1 protocol with text normalization, scoring scripts, and baseline results. Baseline results cover models like Whisper-large-v3, PhoWhisper-large, PhoWhisper-small, Parakeet-CTC-0.6B under zero-shot and fine-tuning settings, reporting WER, CER, and speaker macro-average WER. Licensed under CC BY-NC 4.0, prohibiting commercial use.
DNU-ViSpeech 数据集概述
基本信息
- 语言: 越南语(vi)
- 许可证: CC BY-NC 4.0(知识共享-非商业使用 4.0 国际版)
- 任务类型: 自动语音识别(ASR)
- 数据类型: 越南语朗读语音(read-speech)
- 数据集规模: 10K < n < 100K
- 发布状态: 描述该数据集的论文正在审稿中
数据集简介
DNU-ViSpeech 是一个越南语脚本化/朗读语音语料库,专为自动语音识别(ASR)研究设计。该版本包含 26 位匿名说话人 的 31,070 条语音,总计 75.570 小时。音频格式为 WAV,16 kHz 采样率,单声道,无压缩 PCM 16-bit。
数据划分
| 划分 | 说话人数 | 话语数 | 时长(小时) |
|---|---|---|---|
| 训练集(train) | 18(speaker001–speaker018) | 22,616 | 55.936 |
| 验证集(validation) | 4(speaker019–speaker022) | 5,109 | 12.545 |
| 测试集(test) | 4(speaker023–speaker026) | 3,345 | 7.088 |
| 总计 | 26 | 31,070 | 75.570 |
划分具有说话人、校验和以及标准化参考文本三重不重叠特性。
数据字段
| 字段 | 说明 |
|---|---|
audio |
由 AudioFolder 从 file_name 创建的音频对象 |
file_name |
划分内 WAV 文件的相对路径 |
audio_id |
稳定的匿名化样本标识符 |
speaker_id |
匿名说话人标识(speaker001–speaker026) |
text |
人工审核的口语/参考转写文本 |
text_normalized |
v1.1 标准化后的 ASR 参考文本 |
prompt_text |
参与者被要求朗读的文本 |
prompt_text_normalized |
标准化后的提示文本 |
reference_source |
prompt_confirmed 或 human_corrected |
verification_level |
none、reviewed 或 verified |
review_status |
accepted 或 corrected |
qc_status |
语料库质量控制状态 |
resampled_from_raw |
源录音发布前是否需要重采样 |
duration |
音频时长(秒) |
sample_rate |
所有文件均为 16,000 Hz |
num_channels |
所有文件均为 1 |
checksum_sha256 |
发布 WAV 的 SHA-256 校验和 |
split |
train、validation 或 test |
敏感的人口统计属性和内部审阅者注释已从发布数据中剔除。
主要评估协议(DNU-ASR-v1.1)
- 测试集包含 3,345 条话语,属于复合偏移设置(不可见说话人 + 录音配置变化)
- 测试集不应用于纯通道鲁棒性或纯不可见说话人基准
- 参考文本和假设必须使用相同的 v1.1 标准化器
- 仓库包含完整的标准化和评分工具、单元测试及锁定参考文件
发布基准结果(测试集 WER/CER)
| 模型 | 设置 | 参数量 | WER (%) | CER (%) | 说话人宏平均 WER (%) | |---|---|---|---:|---:|---:|---:| | Whisper large-v3 | 零样本 | 1.55B | 7.15 | 3.84 | 5.83 | | PhoWhisper-large | 零样本 | 1.55B | 4.83 | 2.74 | 3.86 | | PhoWhisper-small | 零样本 | 244M | 6.60 | 3.60 | 5.25 | | PhoWhisper-small | 微调 | 244M | 4.89 | 2.77 | 4.10 | | Parakeet-CTC-0.6B 越南语 | 零样本 | 609M | 6.69 | 3.66 | 5.41 | | Parakeet-CTC-0.6B 越南语 | 微调 | 609M | 4.93 | 2.53 | 4.11 |
数据采集与转写
- 采集方式: 参与者自行录音,按句子列表录制越南语朗读语音,通常分多次进行;每个句子保存为独立 WAV 文件
- 转写流程: 转写文本源自已有提示文本,通过质量检查确认音频与提示是否匹配;采用 ASR 辅助筛选以优先安排人工审核
- 质量审计: 全部 31,070 个文件经过 ASR 再审计,修正了 60 行转写文本并重新锁定协议
- 验证覆盖: 测试集行标记为
verified或reviewed;许多训练行仅通过自动检查,未进行逐句聆听
使用说明
- 预期用途: 越南语朗读语音 ASR 训练和评估、小型模型适配研究、在文档化的复合偏移下进行可复现比较
- 非预期用途: 自然/自发对话评估、将 26 位说话人泛化为越南语整体、跨人口群体的公平性结论、纯通道鲁棒性或纯不可见说话人声明、参与者的身份识别/监控/验证、商业用途
已知局限
- 仅 26 位说话人,人口统计和地区多样性有限
- 为朗读语音而非自发语音
- 测试集小于训练集,且说话人间时长分布不均衡
- 录音配置与划分边界存在混淆
- 说话人间脚本难度差异显著
- 逐句提示文本来源未记录,无法追溯
- 各句子的验证深度不一
- 存在一个遗留样本 ID 包含
.orig后缀,不符合常规 ID 模式
伦理与隐私
- 26 位参与者均提供了书面同意书,同意公开发布其音频和转写文本
- 语音录音属于生物识别数据,匿名化 ID 不能完全消除重新识别风险
- 参与者退出机制:在下一版本中移除对应说话人并记录变更
- 发布数据已排除性别、出生年份、地区、录音设备、推断的录音环境和内部审阅者注释等敏感信息




