遇见数据集

govvox-100h-v2

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

GovVox-100h-v2是一个面向说话人特征分析(speaker profiling)的越南语方言语音数据集,第二版。数据集包含100.26小时的语音,来自越南三个主要方言区(北部、中部、南部),共40,859个音频片段,3,124位说话人,637个原始录音,覆盖45个省份,源自80个YouTube频道上的省级人民议会会议直播。本版本有意侧重中部方言(占47.1%),以解决第一版中中部方言数据不足且容易混淆的问题。数据以16kHz、单声道、16位PCM格式存储,每个片段时长3.20-15.40秒,中位数8.61秒。每个说话人60-128秒,中位数120秒。

GovVox-100h-v2 is a Vietnamese dialect speech dataset for speaker profiling, second version. The dataset contains 100.26 hours of speech from three major dialect regions (Northern, Central, Southern) of Vietnam, with 40,859 audio segments, 3,124 speakers, 637 original recordings, covering 45 provinces, sourced from 80 YouTube channels of provincial Peoples Council meetings. This version intentionally focuses on the Central dialect (47.1%) to address the issue of insufficient and confusing Central dialect data in the first version. Data is stored in 16kHz, mono, 16-bit PCM format, with segment durations ranging from 3.20 to 15.40 seconds (median 8.61 seconds). Each speaker has 60-128 seconds (median 120 seconds).

创建时间:
2026-08-20
原始信息汇总

GovVox-100h-v2 数据集概述

GovVox-100h-v2 是一个越南语语音数据集,专为说话人特征分析任务设计,包含越南三个地区的100小时语音数据。该数据集是 GovVox 项目的第二个版本,从项目积累的1,223小时已转写并分离说话人的数据中筛选而来。

核心统计

指标 数值
总时长 100.26小时
音频片段数 40,859
说话人数 3,124
原始录音数 637
覆盖省份 45
YouTube频道数 80

方言分布

方言区 录音数 说话人 省份 时长(小时) 时长占比
中部 219 1,475 9 47.20 47.1%
南部 226 1,028 16 33.06 33.0%
北部 192 621 18 20.01 20.0%

该版本有意侧重于中部方言,不同于v1版本的均匀分布。中部方言进一步细分为三个子类:清化-义安-河静(Thanh–Nghệ–Tĩnh,20.18小时)、平治天(Bình–Trị–Thiên,11.21小时)和南中部(Nam Trung Bộ,15.81小时),合计占数据集的47.2小时。富安省因方言辨识度问题被完全排除。

文件结构与内容

  • 音频文件:位于 audio/<accent>/<audio_id>/<audio_segment_id>.wav,共40,859个文件,16kHz单声道PCM 16位,总大小约10.8GB
  • 主表 (metadata.csv):包含10列,提供音频片段ID、录音ID、文件名、说话人名称、性别、口音、省份、时长、起止时间等元数据
  • 详细信息表 (chi_tiet.csv):补充路径、文本转写、置信度、音量级别等信息
  • 性别表 (gioi_tinh.csv):提供每位说话人的性别及跨片段共识度
  • 划分文件split_by_recording/split_by_province/ 目录提供两种不同的训练/验证/测试划分方式
  • 说话人映射speaker_global/ 目录将3,124个局部说话人聚类为1,862个跨视频全局说话人
  • 词对齐mfa/ 目录提供蒙特利尔强制对齐器生成的词级时间戳,覆盖99.7%的音频片段

关键注意事项

  1. 说话人名称不可跨录音关联speaker_name 在每个录音内由pyannote独立标注,同一人在不同录音中可能有不同ID。划分数据集时应基于 audio_id 而非 speaker_name

  2. 口音标签基于会议地点:口音标签从会议所在省份推断,不保证每个说话人实际使用该地方言。

  3. 口音标签与频道混淆风险:80个YouTube频道对应45个省份,大多数省份只有一个频道。模型可能学习频道特征而非语音特征,因此在评估方言分类性能时,使用 split_by_province/ 划分而非随机混合测试集。

  4. 性别标签由模型自动生成:性别标签由ECAPA-TDNN模型预测,该模型在VoxCeleb2上训练。74.0%为男性,21.1%为女性,4.9%未知。验证表明模型存在单向偏差:男性被误判为女性的概率比反向高12倍。"未知"标签几乎全部为男性。

数据划分

提供两种预定义的划分方案,服务于不同评估目标:

  • split_by_recording/:按录音划分(80.5/9.9/9.9),标签分布偏差小(最大0.7个百分点),但32/45个省份的录音同时出现在训练和测试集中
  • split_by_province/:按省份划分(78.7/7.4/14.2),确保省份不重叠,更真实地反映模型泛化能力,但标签分布偏差较大(最大9.6个百分点)

生成流程

数据筛选采用三层预算分配策略:

  • 方言区层:目标比例为北/中/南 = 20/47/33
  • 省份层:根据方言典型性设置优先级系数(中部典型省份系数1.2,富安系数为0排除)
  • 说话人层:每人最多120秒,至少60秒,随机有种子抽样

音频切割时每端添加0.2秒填充,采用顺序解码避免opus编码的时间偏移。未做音量标准化或降噪处理。

补充资源

  • 情感说话人嵌入:256维说话人嵌入矩阵(speaker_embeddings.npy
  • 防说话人泄漏划分split_by_global_speaker/ 按全局说话人划分,确保同一人不跨划分出现
  • 预览样本sample_preview/ 提供800个分层抽样音频片段,可直接在数据集查看器中试听
  • 词级时间戳mfa/ 目录包含40,745个片段的词对齐结果,共1,367,975个词
搜集汇总
数据集介绍
govvox-100h-v2 数据集图片
构建方式
GovVox-100h-v2数据集源自越南省级人民议会会议直播的YouTube视频,经语音识别、说话人分离等流程,从1223小时原始录音中精选100.26小时构建而成。构建策略上,本版本刻意偏重中部方言,按47%中部、33%南部、20%北部的预算分配时长,并针对易混淆的中部次方言(清化-义安-静安、平治天、南中部)进行加权,同时剔除易被误判为南部口音的富安省数据。数据切分采用0.2秒边界填充,并基于词级强制对齐以保留辅音韵尾的发音细节。
特点
该数据集包含40,859个音频片段,覆盖45个省市、3,124位说话人,音频为16kHz单声道PCM格式。其独特之处在于提供五级方言标签(北、南、清化-义安-静安、平治天、南中部),并附带说话人全局身份映射(将跨视频的3,124个局部说话人聚类为1,862个全局身份)、性别标注(基于ECAPA-TDNN模型,男性标签准确率达99.90%)、以及99.7%片段的自定义词级时间戳。数据集设计了两套划分方案(按录音和按省份),以区分模型在真实泛化与记忆渠道特征上的表现差异。
使用方法
使用该数据集时,建议依据具体任务选择划分方案:评估跨说话人泛化能力应使用按全局说话人划分的split_by_global_speaker;评估跨域鲁棒性则采用按省份划分的split_by_province,避免渠道泄漏。为提高性别分类性能,需对类别不平衡进行调整,不宜将'unknown'视为独立类别。此外,可利用提供的speaker_global/和mfa/子目录进行说话人识别、方言识别及语音合成等研究,通过sample_preview/子目录可直接检测数据质量。
背景与挑战
背景概述
GovVox-100h-v2是由越南邮政AI团队于2024年发布的大规模越南语语音数据集,包含100.26小时来自45个省份的议会辩论音频,覆盖北部、中部和南部三大方言区。该数据集针对说话人画像(speaker profiling)任务,特别强化了中部方言的样本比例(47%),因中部方言在现有系统中识别率最低且最易混淆。数据源自YouTube直播的省级人民议会会议,经过自动语音识别、说话人分离和字幕对齐等流程构建。该数据集为越南语方言识别、性别分类和说话人验证研究提供了宝贵的真实场景资源,其独特的标签策略和构建方法对低资源方言研究具有重要参考价值。
当前挑战
该数据集的构建面临多重挑战。第一,方言标签基于会议举行省份推断,但演讲者不一定使用当地口音,且省份与YouTube频道高度相关,导致模型可能学习到频道特征而非声学特征,造成评估结果的虚高。第二,说话人身份仅在单次会议内有效,跨会议无法追踪,容易导致数据泄漏。第三,自动生成的性别标签存在系统性偏差,男性被误标为女性的概率是反向的12倍,且处理流程保留了大量'未知'标签,需要使用者注意并调整。此外,数据构建过程中需处理多说话人重叠、语音识别置信度筛选、方言口音鉴定等一系列技术难题,以及在数据切分时平衡方言代表性和模型泛化能力之间的冲突。
常用场景
经典使用场景
GovVox-100h-v2作为大规模越南语语音语料库,其核心应用场景聚焦于说话人画像(speaker profiling)任务,涵盖方言识别、性别分类及说话人验证等多个维度。该数据集精心采集自越南省级人民议会会议直播,通过严格的数据清洗与均衡采样,构建了包含100.26小时、40,859个语音片段、3,124位说话人的丰富语音资源。尤其针对中部方言的细致划分(如清化-义安-河静、平治天、南中部),为细粒度方言建模提供了宝贵数据支撑,是训练和评估语音分类模型不可或缺的基准数据集。
实际应用
在实际应用层面,GovVox-100h-v2可广泛服务于越南智能语音系统,如方言自适应语音识别、多方言语音助手、基于语音的性别与身份推断服务等。其数据来源为公开的政务会议录播,经脱敏处理后,既保证了隐私合规性,又使模型能够适应真实场景中的环境噪声、说话人重叠及设备差异,从而提升产品在越南各地区的覆盖率和用户体验。同时,该数据集还支持构建方言地图、社会语言学调查等公共文化项目,具有重要社会应用价值。
衍生相关工作
围绕GovVox-100h-v2,衍生出了一系列影响力深远的科研工作。其开创性的数据划分策略(对比随机划分与省份隔离划分)为语音社区提供了评估方言分类模型泛化能力的新方法论,被后续研究广泛借鉴。基于该数据集,研究者开发了针对越南语的中部方言识别系统,并验证了跨领域(如ViMD)性别分类模型的迁移性能。此外,其提供的全局说话人嵌入和说话人全局划分,直接支撑了说话人验证、聚类及跨会话语音摘要等方向的研究,形成了从数据处理到模型评估的完整研究链条,推动了越南语语音技术领域的蓬勃发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务