VoxBlink2
收藏资源简介:
VoxBlink2数据集由武汉大学等机构创建,是目前最大的公开可用音频-视觉说话人识别数据集,包含约1000万条高质量语音及其对应视频,来自111,284名YouTube用户。数据集通过优化数据收集流程,扩展了多样性和场景。创建过程中,采用了多语言关键词列表进行用户检索,并通过高帧率视频和面部检测技术提高数据质量。该数据集主要应用于开放集说话人识别任务,旨在提高系统的识别准确率和泛化能力。
VoxBlink2 dataset was developed by Wuhan University and other institutions, and it is currently the largest publicly available audio-visual speaker recognition dataset. It contains approximately 10 million high-quality speech segments and their corresponding videos, sourced from 111,284 YouTube users. The dataset optimizes the data collection workflow to enhance its diversity and application scenarios. During the development process, multilingual keyword lists were utilized for user retrieval, and high-frame-rate videos and face detection technologies were adopted to improve data quality. This dataset is primarily applied to open-set speaker recognition tasks, with the goal of improving the recognition accuracy and generalization capability of related systems.
VoxBlink2 数据集概述
数据集简介
VoxBlink2 是一个包含超过 10 万说话者的语音识别语料库和开放集说话者识别基准。该数据集仅包含标注数据,包括 YouTube 链接、时间戳和说话者标签。用户需自行决定是否以及如何下载视频数据,并确保其使用目的在其所在国家合法。
数据集特征
- 10M 条语音片段:从 YouTube 上的视频中标注了约 1000 万条音频/视频片段,涵盖播客、直播、直播亮点等多种场景。
- 110K+ 说话者:数据集跨越 15 种不同的语言家族,具有多语言特性。
- 1.6 万小时:涵盖的场景与现实生活情况相符,单个说话者的音频/视频随时间变化。
语言分布
数据集的语言分布如下:
| # | 语言 | 说话者数量 | # | 语言 | 说话者数量 | # | 语言 | 说话者数量 |
|---|---|---|---|---|---|---|---|---|
| 1 | 英语 | 40000+ | 7 | 越南语 | 1793 | 13 | 日语 | 992 |
| 2 | 葡萄牙语 | 6227 | 8 | 韩语 | 1544 | 14 | 爱沙尼亚语 | 725 |
| 3 | 西班牙语 | 6009 | 9 | 意大利语 | 1519 | 15 | 挪威语 | 574 |
| 4 | 俄语 | 3961 | 10 | 法语 | 1503 | 16 | 波兰语 | 490 |
| 5 | 阿拉伯语 | 3467 | 11 | 德语 | 1150 | 17 | 塔加洛语 | 467 |
| 6 | 印度尼西亚语 | 1864 | 12 | 土耳其语 | 1150 | 18 | 加泰罗尼亚语 | 407 |
数据集主题
数据集涵盖了多种主题,具体主题分布可通过相关图表探索。
引用信息
如使用该数据集,请引用以下文献:
- 作者:Yuke Lin, Ming Cheng, Fulin Zhang, Yingying Gao, Shilei Zhang, Ming Li
- 标题:VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark
- 会议:INTERSPEECH2024
下载与使用指南
- 资源下载:标注文件可通过 Google Drive 下载。
- 执行步骤:下载标注文件后,可参考 GitHub 仓库 中的指南构建数据库。
- 许可证:数据集和执行脚本遵循 CC BY-NC-SA 4.0 许可证。
开放集说话者识别
关于开放集说话者识别任务的评估,请参考 GitHub 仓库 中的指南。




