遇见数据集

VoxBlink

收藏
arXiv2023-12-13 更新2024-07-24 收录
数据链接:
官方服务:

资源简介:

VoxBlink是由武汉大学计算机学院创建的大规模视听说话人验证数据集,包含1.45M条语音记录,涉及38K说话人。数据集内容丰富,涵盖多种场景和语言,主要来源于YouTube上的用户上传的短视频。创建过程中采用了自动化的视听数据挖掘管道,确保数据的质量和多样性。VoxBlink数据集广泛应用于说话人验证、语音分离和多模态验证等领域,旨在解决现实生活中的说话人识别问题。

VoxBlink is a large-scale audio-visual speaker verification dataset created by the School of Computer Science, Wuhan University. It contains 1.45 million audio recordings involving 38,000 speakers. The dataset boasts rich content covering diverse scenarios and languages, and is primarily sourced from user-uploaded short videos on YouTube. An automated audio-visual data mining pipeline was adopted during its development to ensure the quality and diversity of the dataset. The VoxBlink dataset is widely applied in fields such as speaker verification, speech separation and multimodal verification, with the goal of addressing real-world speaker recognition problems.

创建时间:
2023-08-14
搜集汇总
数据集介绍
VoxBlink 数据集图片
构建方式
VoxBlink数据集的构建依托于一套创新的自动化多模态数据挖掘流水线。首先,从YouTube平台收集上传短视频且头像为单人脸的普通用户,获取超过100万条视频。随后,利用Retina Face模型进行人脸与唇部检测追踪,确保每个轨迹仅包含单一目标。通过ResNet-IRSE50模型提取人脸嵌入,并与用户头像模板进行余弦相似度比对,筛除非目标轨迹。接着,采用Seq2Seq视听说话人日记化模型识别活跃语音片段,剔除静音或音画不同步部分。最后,基于Conformer的重叠语音检测工具过滤重叠话语,并剔除时长不足一秒的片段,最终汇聚成包含38K说话人、145万条话语的VoxBlink数据集。
特点
VoxBlink数据集的核心特点在于其大规模与高多样性。它涵盖来自YouTube普通用户的短视频内容,场景囊括播客、音乐现场、演讲、直播等,语种以英语为主但覆盖全球130多个地区,性别比例在纯净版中相对均衡。与VoxCeleb等现有数据集相比,VoxBlink的短视频来源更贴近真实生活场景,且通过多模态验证生成了纯净版VoxBlink-clean,包含18K身份与102万条话语,有效降低了自动采集引入的噪声。此外,该数据集提供丰富的元信息,如地理位置、语言标签、视频发布时间等,为多模态研究提供了坚实基础。
使用方法
VoxBlink数据集主要用于说话人验证任务的模型训练与评估。推荐采用Mix-FineTune策略,先以VoxCeleb2开发集进行预热与稳定训练,再引入VoxBlink-clean联合微调,可显著提升性能。实验表明,在ResNet34、ECAPA-TDNN、SimAM-ResNet100等不同骨干网络上,加入VoxBlink-clean后相对等错误率降低12%至29%。此外,该数据集还可拓展至语音分离、多模态验证、说话人日记化等任务。使用时,建议配合在线数据增强(如加噪、速度扰动)及后处理技术(如大边际微调、分数归一化),以进一步优化系统表现。
背景与挑战
背景概述
声纹验证技术在自然场景下的发展长期以来受限于公开数据集的规模与多样性。尽管VoxCeleb等数据集推动了该领域的进步,但其包含的说话人数量和语音段数仍远逊于计算机视觉领域的大规模人脸识别数据集。为弥合这一鸿沟,武汉大学与杜克昆山大学等机构的研究人员于2023年提出了VoxBlink数据集,该数据集通过创新的多模态自动挖掘流水线,从YouTube短视频中采集了涵盖3.8万说话人的145万条语音段,其来源为普通用户上传的短内容,场景更贴近真实生活。VoxBlink的发布为声纹验证研究提供了迄今为止最大规模的公开训练资源,并显著提升了多种骨干网络在VoxCeleb测试集上的性能,相对等错误率降低达12%至30%。
当前挑战
VoxBlink数据集在构建与应用中面临多项挑战。首先,在领域问题层面,现有数据集如VoxCeleb在说话人数量与场景多样性上仍显不足,难以支撑模型在复杂真实环境下的泛化能力,而VoxBlink虽规模庞大,但其数据源自自动采集,不可避免地引入了噪声标签与低质量样本。其次,在构建过程中,如何从海量YouTube短视频中精准提取目标说话人的音视频片段是一大技术难题,需依次克服人脸检测与跟踪、基于头像的逐帧人脸验证、唇动辅助的活跃说话人检测、以及多说话人重叠检测等多重步骤中的误差累积。此外,数据清洗阶段需平衡噪声去除与难例保留,最终通过多模态净化策略得到VoxBlink-clean子集,但过滤过程仍可能损失部分有效信息。
常用场景
经典使用场景
VoxBlink数据集作为大规模视听双模态说话人验证基准,其经典使用场景聚焦于复杂自然环境下的身份确认任务。研究者可借助该数据集中涵盖38K说话人、145万条语音片段的丰富资源,在包含背景噪声、混响、多语言及多设备录制的真实短视频场景中,系统性地训练与评估说话人验证模型。该数据集特别适用于模拟社交媒体、直播访谈等非受控环境下的说话人识别挑战,其独特的视听对齐特性允许同时利用面部特征与语音信号进行联合验证,从而显著提升系统在嘈杂环境中的鲁棒性。
衍生相关工作
VoxBlink的发布催生了一系列重要的衍生研究。其自动化多模态数据挖掘流水线为后续大规模数据集构建提供了范式参考,启发了类似VoxTube等工作的改进方向。研究者基于该数据集与VoxCeleb的联合训练策略,发展出Mix-FineTune等高效迁移学习方法,显著提升了ECAPA-TDNN、ResNet等主流架构的性能。在算法层面,该数据集推动了噪声标签检测、域自适应及质量感知分数校准等技术的发展,例如LMFT与AS-Norm后处理策略在VoxBlink辅助下实现了20.8%的相对EER降低。这些工作共同构建了从数据生产到模型优化的完整研究生态。
数据集最近研究
最新研究方向
在声纹识别领域,大规模、高质量数据集的匮乏长期制约着模型性能的跃升。VoxBlink的提出,以其超过38K说话人和145万条语音的庞大规模,为声纹验证研究注入了崭新活力。该数据集创新性地利用多模态数据挖掘管道,从YouTube短视频中自动采集音频-视觉样本,并经过多模态净化得到VoxBlink-clean子集,显著提升了数据纯净度。当前前沿研究聚焦于将VoxBlink-clean与VoxCeleb联合训练,实验表明,在不同骨干网络(如ResNet、ECAPA-TDNN)上,融合该数据集可使等错误率相对降低12%至30%,尤其在大规模模型上增益更为显著。这一突破不仅推动了声纹验证在真实复杂场景下的鲁棒性,也为多模态学习、说话人分离等关联热点任务提供了宝贵数据基础,彰显了大规模野外数据集在提升系统泛化能力与实用价值方面的深远意义。
相关研究论文
  • 1
    VoxBlink: A Large Scale Speaker Verification Dataset on Camera武汉大学计算机学院 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务