ScriptsForVoxBlink2
收藏资源简介:
VoxBlink2是一个大规模说话人识别数据集,包含超过10万个说话人,数据来源于YouTube平台。该数据集提供了构建语料库的详细指南和配套资源,用于复现相关论文中的实验结果。数据集仅包含注释数据,包括YouTube视频链接、时间戳和说话人标签,不包含音频或视频数据。该数据集适用于多种说话人识别任务,如自动说话人验证(ASV)和开放集说话人识别(OSSI)等。数据集采用CC BY-NC-SA 4.0许可证,仅限非商业用途,并需提供适当署名和以相同方式共享。
VoxBlink2 is a large-scale speaker recognition dataset containing over 100,000 speakers, with data sourced from the YouTube platform. This dataset provides detailed guidelines and supporting resources for corpus construction, allowing the reproduction of experimental results reported in relevant academic papers. The dataset only includes annotation data, namely YouTube video links, timestamps and speaker labels, and does not contain any audio or video materials. It is applicable to a variety of speaker recognition tasks, such as automatic speaker verification (ASV) and open-set speaker identification (OSSI), among others. The dataset is licensed under CC BY-NC-SA 4.0, which is restricted to non-commercial use, and requires proper attribution and share-alike sharing.
VoxBlink2 数据集概述
基本信息
VoxBlink2 是一个大规模说话人识别数据集,包含超过 10 万个说话人,数据来源于 YouTube 平台。该数据集提供构建语料库的指南和相关资源,用于复现论文实验结果。
数据集内容
数据集仅包含标注数据,具体包括:
- YouTube 链接:视频的访问地址
- 时间戳:视频/音频片段的起止时间
- 说话人标签:说话人的身份标识
注意:数据集不发布音频或视觉数据,用户需自行决定是否及如何下载视频数据,并确保其用途符合当地法律法规。
文件结构
项目包含以下核心目录和文件:
- data:评估协议(包括开放集说话人识别、说话人验证)、说话人-视频映射
- ckpt:评估用预训练模型(ECAPA-TDNN、ResNet34、ResNet100、ResNet293、人脸模型)
- spk_info:说话人视频标签信息
- asr_res:Whisper 生成的 ASR 标注
- meta:视频/音频裁剪时间戳
- face_id:人脸识别模块及推理代码
- ossi:开放集说话人识别评估脚本和示例嵌入
- 实用脚本:音频裁剪、视频裁剪、视频下载等
构建流程
- 安装依赖:安装 ffmpeg 和 Python 库
- 下载数据:支持视频和纯音频两种模式,支持多线程下载
- 裁剪处理:根据时间戳裁剪音频/视频片段
评估任务
- SV 评估:自动说话人验证(ASV)模型评估
- 开放集说话人识别(OSSI):提出的新任务的评估基准
许可证
数据集采用 CC BY-NC-SA 4.0 许可证:
- 允许共享和改编,仅限非商业用途
- 需提供适当署名
- 衍生作品需采用相同许可证分发
引用
使用该数据集时,请引用论文:
- 论文标题:VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark
- 作者:Yuke Lin, Ming Cheng, Fulin Zhang, Yingying Gao, Shilei Zhang, Ming Li
- 年份:2024
- arXiv 编号:2407.11510(https://arxiv.org/abs/2407.11510)




