遇见数据集

ScriptsForVoxBlink2

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

VoxBlink2是一个大规模说话人识别数据集,包含超过10万个说话人,数据来源于YouTube平台。该数据集提供了构建语料库的详细指南和配套资源,用于复现相关论文中的实验结果。数据集仅包含注释数据,包括YouTube视频链接、时间戳和说话人标签,不包含音频或视频数据。该数据集适用于多种说话人识别任务,如自动说话人验证(ASV)和开放集说话人识别(OSSI)等。数据集采用CC BY-NC-SA 4.0许可证,仅限非商业用途,并需提供适当署名和以相同方式共享。

VoxBlink2 is a large-scale speaker recognition dataset containing over 100,000 speakers, with data sourced from the YouTube platform. This dataset provides detailed guidelines and supporting resources for corpus construction, allowing the reproduction of experimental results reported in relevant academic papers. The dataset only includes annotation data, namely YouTube video links, timestamps and speaker labels, and does not contain any audio or video materials. It is applicable to a variety of speaker recognition tasks, such as automatic speaker verification (ASV) and open-set speaker identification (OSSI), among others. The dataset is licensed under CC BY-NC-SA 4.0, which is restricted to non-commercial use, and requires proper attribution and share-alike sharing.

创建时间:
2026-08-03
原始信息汇总

VoxBlink2 数据集概述

基本信息

VoxBlink2 是一个大规模说话人识别数据集,包含超过 10 万个说话人,数据来源于 YouTube 平台。该数据集提供构建语料库的指南和相关资源,用于复现论文实验结果。

数据集内容

数据集仅包含标注数据,具体包括:

  • YouTube 链接:视频的访问地址
  • 时间戳:视频/音频片段的起止时间
  • 说话人标签:说话人的身份标识

注意:数据集不发布音频或视觉数据,用户需自行决定是否及如何下载视频数据,并确保其用途符合当地法律法规。

文件结构

项目包含以下核心目录和文件:

  • data:评估协议(包括开放集说话人识别、说话人验证)、说话人-视频映射
  • ckpt:评估用预训练模型(ECAPA-TDNN、ResNet34、ResNet100、ResNet293、人脸模型)
  • spk_info:说话人视频标签信息
  • asr_res:Whisper 生成的 ASR 标注
  • meta:视频/音频裁剪时间戳
  • face_id:人脸识别模块及推理代码
  • ossi:开放集说话人识别评估脚本和示例嵌入
  • 实用脚本:音频裁剪、视频裁剪、视频下载等

构建流程

  1. 安装依赖:安装 ffmpeg 和 Python 库
  2. 下载数据:支持视频和纯音频两种模式,支持多线程下载
  3. 裁剪处理:根据时间戳裁剪音频/视频片段

评估任务

  • SV 评估:自动说话人验证(ASV)模型评估
  • 开放集说话人识别(OSSI):提出的新任务的评估基准

许可证

数据集采用 CC BY-NC-SA 4.0 许可证:

  • 允许共享和改编,仅限非商业用途
  • 需提供适当署名
  • 衍生作品需采用相同许可证分发

引用

使用该数据集时,请引用论文:

  • 论文标题:VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark
  • 作者:Yuke Lin, Ming Cheng, Fulin Zhang, Yingying Gao, Shilei Zhang, Ming Li
  • 年份:2024
  • arXiv 编号:2407.11510(https://arxiv.org/abs/2407.11510)
搜集汇总
数据集介绍
ScriptsForVoxBlink2 数据集图片
构建方式
ScriptsForVoxBlink2数据集是VoxBlink2大规模说话人识别语料库的配套工具集,其构建方式依托于详尽的元数据与处理脚本。该数据集源于YouTube平台的百万级说话人资源,通过精心设计的流水线实现语料复现。首先,研究者需获取包含说话人标签、视频ID及时间戳的注释文件,随后利用多线程下载器依据链接抓取原始音视频,再通过切割脚本精准提取有效片段,最终形成可供研究的语音或音视频单元。这一过程确保了数据来源的多样性与标注的准确性,为后续实验奠定坚实基础。
特点
该数据集的核心特色在于其规模与多模态属性,涵盖超过10万个说话人,提供纯音频及音视频两种模态选项,满足不同研究需求。其注释数据独立于原始媒体,赋予用户灵活的使用权限,同时配套了包括ECAPA-TDNN、ResNet系列等预训练模型,支持说话人验证、开放集识别及人脸识别等多任务评估。尤为值得一提的是,数据集开创性地提出了开放集说话人识别(OSSI)基准,突破了传统闭集设定的局限,为真实场景下的鲁棒性研究提供了新视角,体现了前沿性与实用性的深度融合。
使用方法
使用该数据集遵循清晰的路径:首先,从指定资源库获取元数据压缩包,并解压至本地目录;其次,根据研究目标选择下载模式,通过命令行指令完成视频或纯音频的采集;随后,运行裁剪脚本,按时间戳切分长媒体为短片段;最后,利用提供的评估脚本,在说话人验证、开放集识别等任务上进行模型测试。所有代码均基于Python实现,依赖ffmpeg等工具,易于集成与扩展。数据集采用CC BY-NC-SA 4.0许可,仅允许非商业用途,并提示用户自行承担下载视频的法律责任,确保合规使用。
背景与挑战
背景概述
VoxBlink2数据集由杜克昆山大学李明教授团队于2024年创建,旨在解决大规模说话人识别中数据稀缺与标注成本高昂的难题。该数据集依托YouTube平台,汇聚了超过10万名说话人的海量音视频数据,为声纹识别领域提供了前所未有的训练资源。其核心研究问题聚焦于构建一个兼具规模与多样性的说话人识别语料库,并首次提出开放集说话人识别(OSSI)基准任务,突破了传统封闭集假设的局限。VoxBlink2的发布不仅为自动说话人验证(ASV)提供了强有力的数据支撑,更推动了说话人识别技术向更真实、更复杂的应用场景迈进,对促进该领域的学术研究与产业落地具有重要意义。
当前挑战
VoxBlink2的构建面临多重挑战。在领域层面,传统说话人识别数据集规模有限,难以支撑深度模型的泛化需求,且封闭集评估范式无法反映真实场景中未知说话人涌现的复杂情况,亟需新的基准与数据资源。在数据集构建过程中,从YouTube海量视频中自动挖掘高质量语音片段需应对环境噪声、背景音乐、语音重叠等干扰;同时,说话人身份标注的准确性依赖于人脸识别与聚类技术,跨视频、跨场景的身份关联易引入错误;此外,数据处理流程涉及视频下载、裁剪、元数据管理等多个环节,如何保证大规模语料的完整性与可复现性,亦是一大技术挑战。该数据集通过精心设计的流水线与开源工具链,有效缓解了上述难题,为后续研究者提供了可借鉴的范式。
常用场景
经典使用场景
VoxBlink2数据集作为大规模说话人识别语料库,其经典使用场景聚焦于声纹识别模型的训练与评估。该数据集包含超过10万名说话人的音视频数据,源自YouTube平台,通过精心设计的元数据(如时间戳、说话人标签)和裁剪脚本,研究者可便捷地构建音频或音视频双模态的识别任务。其规模与多样性为训练高鲁棒性说话人嵌入模型提供了坚实基础,常用于说话人验证、说话人辨认以及开集说话人识别等基准测试,是推动声纹识别技术迈向实际应用的关键资源。
实际应用
在实际应用中,VoxBlink2所支撑的模型可广泛应用于多媒体内容安全、智能语音助手、司法取证及个性化服务等场景。例如,在视频平台中实现说话人自动标注与检索,在智能设备中实现多用户声纹解锁,以及在安防监控中辅助身份确认。通过提供完整的下载、裁剪及评估工具链,该数据集帮助工业界快速构建和部署声纹识别系统,降低了数据获取与预处理成本,加速了从学术研究到产品落地的转化过程。
衍生相关工作
VoxBlink2的发布已衍生出一系列相关研究工作,涵盖基于该语料库的说话人嵌入学习、域自适应技术、多模态融合方法及开集识别算法等。例如,研究者利用其大规模数据训练更先进的ECAPA-TDNN或ResNet系列模型,并针对OSSI任务设计新颖的阈值校准与开放类别检测机制。此外,数据集提供的ASR标注(Whisper生成)也促进了语音内容分析与说话人联合建模的研究。相关基准与工具链的公开,进一步推动了全球范围内声纹识别领域的协作与创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务