awesome-diarization
收藏资源简介:
这是一个精选的资源合集,专注于说话人分割(Speaker Diarization)领域,收录了与说话人分割相关的数据集、论文、软件工具、会议信息和其他学习材料。合集覆盖了说话人分割数据集、说话人嵌入训练集和增强噪声源等多个类别,旨在组织和整理该领域的全球资源,使其易于访问和使用。
This is a curated resource collection focused on the field of Speaker Diarization. It collects datasets, academic papers, software tools, conference-related information and other learning materials relevant to speaker diarization. The collection covers multiple categories such as speaker diarization datasets, speaker embedding training datasets and augmented noise sources, aiming to organize and sort out global resources in this field to make them easily accessible and usable.
数据集详情总结:Awesome Speaker Diarization
该页面是一个精选的说话人日记化(Speaker Diarization)资源列表,覆盖论文、软件、数据集及其他相关资源。内容组织清晰,便于研究人员和开发者快速获取关键信息。
数据集部分
页面中将数据集分为三类,具体如下:
- Diarization datasets:专门用于说话人日记化任务的数据集。
- Speaker embedding training sets:用于训练说话人嵌入表示(如x-vector、d-vector等)的数据集。
- Augmentation noise sources:用于数据增强的噪声源数据集,可提升模型鲁棒性。
(注意:由于页面内容截断,未列出具体数据集名称和链接,仅展示了分类结构。)
软件工具
页面列出了丰富的软件工具,分为以下几类:
框架(Framework)
- FunASR:工业级语音识别工具包,内置说话人日记化功能,支持50+语言,170倍实时率。
- SpeechBrain:基于PyTorch的全能语音工具包。
- pyannote-audio:说话人日记化的神经网络构建模块,包含语音活动检测、说话人变化检测、说话人嵌入。
- EEND:端到端神经说话人日记化(End-to-End Neural Diarization)。
- VBx:基于变分贝叶斯HMM的x-vector日记化。
- DiaPer:基于感知器吸引子的端到端日记化实现。
- sherpa-onnx:跨平台语音识别、日记化、语音合成工具。
评估(Evaluation)
- pyannote-metrics:可复现的说话人日记化评估工具包。
- SimpleDER:轻量级计算日记化错误率(DER)的库。
- DiarizationLM:实现词错误率(WER)、词日记化错误率(WDER)和cpWER。
- NIST md-eval:经典PERL脚本,用于日记化评估。
聚类(Clustering)
(页面未完整显示内容,但目录中提及此分类。)
说话人嵌入(Speaker embedding)
(页面未完整显示内容,但目录中提及此分类。)
说话人变化检测(Speaker change detection)
(页面未完整显示内容,但目录中提及此分类。)
音频特征提取(Audio feature extraction)
(页面未完整显示内容,但目录中提及此分类。)
音频数据增强(Audio data augmentation)
(页面未完整显示内容,但目录中提及此分类。)
其他软件(Other software)
(页面未完整显示内容,但目录中提及此分类。)
论文资源
页面按专题和时间整理了大量论文,涵盖以下方向:
- 综述与调研论文:2021年、2012年、2010年三篇综述。
- 大语言模型(LLM):2023-2024年发表的多篇论文,如DiarizationLM、上下文波束搜索方法。
- 监督式日记化:2018-2023年间的端到端神经日记化、重叠感知日记化等方法。
- 联合日记化与ASR:2018-2022年间的联合识别与日记化方法。
- 在线说话人日记化:2020-2021年间的在线处理方法。
- 挑战赛相关:ICASSP 2022 M2MeT、DIHARD挑战赛等。
- 音视频说话人日记化:2022年发表的AVA-AVD、DyViSE、MSDWild等。
- 其他年份论文:从2006年到2022年逐年收录的经典及最新论文。
其他资源
- 会议(Conferences):列出相关学术会议信息(页面未完整显示)。
- 学习资料(Other learning materials):包括在线课程、书籍、技术博客、视频教程等(页面未完整显示)。
- 产品(Products):列出商业化产品或服务(页面未完整显示)。




