govvox-100h-v2
收藏资源简介:
GovVox-100h-v2是一个面向说话人特征分析(speaker profiling)的越南语方言语音数据集,第二版。数据集包含100.26小时的语音,来自越南三个主要方言区(北部、中部、南部),共40,859个音频片段,3,124位说话人,637个原始录音,覆盖45个省份,源自80个YouTube频道上的省级人民议会会议直播。本版本有意侧重中部方言(占47.1%),以解决第一版中中部方言数据不足且容易混淆的问题。数据以16kHz、单声道、16位PCM格式存储,每个片段时长3.20-15.40秒,中位数8.61秒。每个说话人60-128秒,中位数120秒。
GovVox-100h-v2 is a Vietnamese dialect speech dataset for speaker profiling, second version. The dataset contains 100.26 hours of speech from three major dialect regions (Northern, Central, Southern) of Vietnam, with 40,859 audio segments, 3,124 speakers, 637 original recordings, covering 45 provinces, sourced from 80 YouTube channels of provincial Peoples Council meetings. This version intentionally focuses on the Central dialect (47.1%) to address the issue of insufficient and confusing Central dialect data in the first version. Data is stored in 16kHz, mono, 16-bit PCM format, with segment durations ranging from 3.20 to 15.40 seconds (median 8.61 seconds). Each speaker has 60-128 seconds (median 120 seconds).
GovVox-100h-v2 数据集概述
GovVox-100h-v2 是一个越南语语音数据集,专为说话人特征分析任务设计,包含越南三个地区的100小时语音数据。该数据集是 GovVox 项目的第二个版本,从项目积累的1,223小时已转写并分离说话人的数据中筛选而来。
核心统计
| 指标 | 数值 |
|---|---|
| 总时长 | 100.26小时 |
| 音频片段数 | 40,859 |
| 说话人数 | 3,124 |
| 原始录音数 | 637 |
| 覆盖省份 | 45 |
| YouTube频道数 | 80 |
方言分布
| 方言区 | 录音数 | 说话人 | 省份 | 时长(小时) | 时长占比 |
|---|---|---|---|---|---|
| 中部 | 219 | 1,475 | 9 | 47.20 | 47.1% |
| 南部 | 226 | 1,028 | 16 | 33.06 | 33.0% |
| 北部 | 192 | 621 | 18 | 20.01 | 20.0% |
该版本有意侧重于中部方言,不同于v1版本的均匀分布。中部方言进一步细分为三个子类:清化-义安-河静(Thanh–Nghệ–Tĩnh,20.18小时)、平治天(Bình–Trị–Thiên,11.21小时)和南中部(Nam Trung Bộ,15.81小时),合计占数据集的47.2小时。富安省因方言辨识度问题被完全排除。
文件结构与内容
- 音频文件:位于
audio/<accent>/<audio_id>/<audio_segment_id>.wav,共40,859个文件,16kHz单声道PCM 16位,总大小约10.8GB - 主表 (metadata.csv):包含10列,提供音频片段ID、录音ID、文件名、说话人名称、性别、口音、省份、时长、起止时间等元数据
- 详细信息表 (chi_tiet.csv):补充路径、文本转写、置信度、音量级别等信息
- 性别表 (gioi_tinh.csv):提供每位说话人的性别及跨片段共识度
- 划分文件:
split_by_recording/和split_by_province/目录提供两种不同的训练/验证/测试划分方式 - 说话人映射:
speaker_global/目录将3,124个局部说话人聚类为1,862个跨视频全局说话人 - 词对齐:
mfa/目录提供蒙特利尔强制对齐器生成的词级时间戳,覆盖99.7%的音频片段
关键注意事项
-
说话人名称不可跨录音关联:
speaker_name在每个录音内由pyannote独立标注,同一人在不同录音中可能有不同ID。划分数据集时应基于audio_id而非speaker_name。 -
口音标签基于会议地点:口音标签从会议所在省份推断,不保证每个说话人实际使用该地方言。
-
口音标签与频道混淆风险:80个YouTube频道对应45个省份,大多数省份只有一个频道。模型可能学习频道特征而非语音特征,因此在评估方言分类性能时,使用
split_by_province/划分而非随机混合测试集。 -
性别标签由模型自动生成:性别标签由ECAPA-TDNN模型预测,该模型在VoxCeleb2上训练。74.0%为男性,21.1%为女性,4.9%未知。验证表明模型存在单向偏差:男性被误判为女性的概率比反向高12倍。"未知"标签几乎全部为男性。
数据划分
提供两种预定义的划分方案,服务于不同评估目标:
split_by_recording/:按录音划分(80.5/9.9/9.9),标签分布偏差小(最大0.7个百分点),但32/45个省份的录音同时出现在训练和测试集中split_by_province/:按省份划分(78.7/7.4/14.2),确保省份不重叠,更真实地反映模型泛化能力,但标签分布偏差较大(最大9.6个百分点)
生成流程
数据筛选采用三层预算分配策略:
- 方言区层:目标比例为北/中/南 = 20/47/33
- 省份层:根据方言典型性设置优先级系数(中部典型省份系数1.2,富安系数为0排除)
- 说话人层:每人最多120秒,至少60秒,随机有种子抽样
音频切割时每端添加0.2秒填充,采用顺序解码避免opus编码的时间偏移。未做音量标准化或降噪处理。
补充资源
- 情感说话人嵌入:256维说话人嵌入矩阵(
speaker_embeddings.npy) - 防说话人泄漏划分:
split_by_global_speaker/按全局说话人划分,确保同一人不跨划分出现 - 预览样本:
sample_preview/提供800个分层抽样音频片段,可直接在数据集查看器中试听 - 词级时间戳:
mfa/目录包含40,745个片段的词对齐结果,共1,367,975个词




