AwesomeDiarizationDataset
收藏官方服务:
资源简介:
该合集收集了音频和视听说话人分割数据集资源,包括CallHome、DIHARD 2、CSSD、Simu-2spk、AMI、VoxConverse、AVA-AVD、MSDWild和MISP等,覆盖英语、中文和多语言领域,提供数据小时数、说话人数、重叠率、语言、数据和标签链接及费用等信息。
This collection aggregates audio and audiovisual speaker diarization dataset resources, including CallHome, DIHARD 2, CSSD, Simu-2spk, AMI, VoxConverse, AVA-AVD, MSDWild, MISP and other datasets. It covers English, Chinese and multilingual domains, and provides comprehensive information such as total data duration in hours, number of speakers, overlap rate, language type, download links for data and labels, as well as associated costs.
创建时间:
2022-11-09
原始信息汇总
数据集概述:Awesome Speaker Diarization Dataset
该仓库汇总了说话人日志(Speaker Diarization)领域的数据集资源链接,尤其关注数据和标签分离、来源不同的情况。数据集分为纯音频数据集和音视频数据集两类。
纯音频数据集
| 数据集 | 时长(小时) | 说话人数 | 重叠率(%) | 语言 | 数据链接 | 标签链接 | 费用 |
|---|---|---|---|---|---|---|---|
| CallHome (LDC2001S97) | 17 | 2-7 | 16.52 | 英语 | 数据 | 分割 标签 | $500 |
| DIHARD 2 | 46 | 2-14 | 44.4 | 多语言 | 数据 | 标签 | $300 |
| CSSD | 180 | 2 | 0 | 中文 | 数据 | 标签 | 免费 |
| Simu-2spk | 2434 | 2 | 34.14 | 多语言 | ... | 标签 | $33,000 |
备注:
- CallHome 的标签(
fullref.rttm)可通过下载 标签 获取,其数据集有多种版本,学术界常以LDC2001S97代称。 - CallHome 的 part1 和 part2 非官方划分,划分方法见 URL。
- DIHARD 3 在 LDC 网站未找到,故未分析。
- Simu-2spk 是基于 Switchboard 和 SRE 数据集的模拟电话语音数据集,常用于 EEND 训练。模拟数据费用昂贵($33,000),包含以下子数据集:LDC98S75、LDC99S79、LDC2002S06、LDC2001S13、LDC2004S07、LDC2006S44、LDC2011S01、LDC2011S04、LDC2011S09、LDC2011S10、LDC2012S01、LDC2011S05、LDC2011S08。
音视频数据集
| 数据集 | 时长(小时) | 说话人数 | 重叠率(%) | 语言 | 数据链接 | 标签链接 | 费用 |
|---|---|---|---|---|---|---|---|
| AMI | 100 | 3-5 | 13.37 | 英语 | 数据 | 标签 | 免费 |
| VoxConverse | 64 | 1-21 | 3.28 | 多语言 | 数据 | 标签 | 免费 |
| AVA-AVD | 29 | 2-24 | 4.4 | 多语言 | 数据 | 标签 | 免费 |
| MSDWild | 80 | 2-10 | 14.01 | 多语言 | 数据 | 标签 | 免费 |
| MISP | 127 | 2-6 | 25.7 | 中文 | 数据 | 标签 | 免费 |
备注:
- VoxConverse 的视觉部分尚未发布。
- 所有数据集的统计均基于所有可用集合(如训练集、开发集、测试集)。
其他资源
搜集汇总
数据集介绍

构建方式
该数据集以开源仓库形式汇聚了说话人日记任务中广泛使用的语料资源,涵盖纯音频与音视频两种模态。纯音频部分收录了CallHome、DIHARD 2、CSSD及Simu-2spk等数据集,其中Simu-2spk基于Switchboard和SRE语料通过仿真生成,数据与标签来源分离。音视频部分则整合了AMI、VoxConverse、AVA-AVD、MSDWild及MISP等公开数据集,所有资源均提供官方数据链接与标注文件地址,便于研究者获取。
特点
本数据集具有显著的多样性与实用性特征。其覆盖语料时长跨度从17小时至2434小时,说话人数量从2至24人不等,重叠语音比例从0%至44.4%,语言涵盖英语、中文及多语种,全面反映了真实场景下的复杂声学环境。尤为突出的是,数据与标签大多分属不同来源,有效模拟了实际应用中数据分散的挑战,为模型鲁棒性评估提供了理想基准。
使用方法
研究者可直接通过仓库提供的链接获取各子数据集原始音频与对应标注文件,例如CallHome的标签需从OpenSLR下载并配合Kaldi脚本进行分割。音视频数据集如AMI和VoxConverse均提供免费数据与标注,便于直接用于模型训练与评估。此外,仓库还提供了可视化工具链接,支持对数据集进行直观分析,而多模态语音数据集汇总则进一步拓展了研究边界。
背景与挑战
背景概述
说话人日志(Speaker Diarization)旨在将音频或视频流中的语音片段按说话人身份进行分割与聚类,是语音处理领域的关键技术之一。该数据集由研究者刘涛等人整理发布,旨在系统性地汇总当前可用的说话人日志资源,尤其关注数据与标注分离的场景。数据集创建于近年,汇集了CallHome、DIHARD 2、CSSD、Simu-2spk等纯音频数据集,以及AMI、VoxConverse、AVA-AVD、MSDWild和MISP等音视频融合数据集,覆盖多种语言、说话人数、重叠率及费用结构。该数据集为说话人日志研究提供了统一的资源索引,推动了模型评估与跨数据集比较的标准化进程,对领域内学术研究与工业应用具有重要参考价值。
当前挑战
说话人日志领域面临的核心挑战包括:其一,真实场景中说话人重叠率高(如DIHARD 2达44.4%),传统聚类算法难以准确分离重叠语音;其二,多语言、多说话人数及不同录音环境导致数据异质性显著,模型泛化能力受限。构建过程中,数据集面临标注分离与获取困难,如CallHome的标注需从多个来源整合,Simu-2spk模拟数据成本高达33,000美元,且部分数据集(如VoxConverse)视觉部分尚未公开。此外,不同数据集的分割标准(如训练/开发/测试集划分)不统一,增加了跨数据集评估的复杂性。
常用场景
经典使用场景
在说话人日志研究领域,AwesomeDiarizationDataset凭借其系统化的资源整合能力,成为研究者探索说话人分割与聚类技术的核心数据枢纽。该数据集涵盖纯音频与音视频两大模态,其中CallHome和DIHARD 2等经典语料库因包含丰富的说话人重叠语音片段(重叠率分别达16.52%和44.4%),被广泛用于评估重叠说话人检测算法的鲁棒性;而AMI和VoxConverse等音视频数据集则因其多说话人交互场景(如会议对话),成为验证视听融合说话人日志方法的基准平台。研究者常基于这些数据构建端到端说话人日志系统(如EEND框架),通过模拟真实对话中的说话人切换与重叠模式,推动模型从实验室环境向复杂声学场景的迁移能力提升。
衍生相关工作
该数据集集群催生了一系列具有里程碑意义的学术工作。在方法层面,基于CallHome和Simu-2spk数据集,Hitachi团队提出了EEND(End-to-End Neural Diarization)框架,首次将说话人日志建模为序列标注问题,突破了传统聚类方法的局限性;DIHARD 2数据集则驱动了VBx(Variational Bayes x-vector)系统的改进,通过贝叶斯推理实现重叠说话人检测的精度跃升。在评估体系层面,VoxConverse和AMI数据集的标准化划分(如训练/开发/测试集)被广泛采纳为基准协议,推动了说话人日志任务评价指标(如JER、DER)的统一。此外,MSDWild和AVA-AVD数据集的出现直接促进了多模态说话人日志领域的发展,衍生出如AVSD(Audio-Visual Speaker Diarization)跨模态注意力融合网络等代表性工作,为后续研究开辟了新范式。
数据集最近研究
最新研究方向
在当前语音处理领域,说话人日志(Speaker Diarization)作为多说话人场景下语音内容结构化分析的核心技术,其研究正从单一音频模态向多模态融合方向深化。AwesomeDiarizationDataset收录的AMI、VoxConverse、AVA-AVD、MSDWild和MISP等视听数据集,为探索语音与视觉线索的互补机制提供了关键资源,尤其在高重叠率对话(如MISP的25.7%重叠率)和复杂环境(如多语言、多说话人场景)中,视觉信息有效辅助了音频模态的声纹分割与聚类。这一方向与近年来视频会议、智能监控等热点应用紧密关联,推动了端到端模型(如EEND)在模拟数据(Simu-2spk的2434小时)上的大规模训练,同时免费开源的MSDWild等数据集降低了研究门槛,促进了跨模态特征对齐与鲁棒性评估的突破,为构建更具泛化能力的说话人日志系统奠定了数据基础。
以上内容由遇见数据集搜集并总结生成



