Multi-Talker-SD
收藏资源简介:
Multi-Talker-SD是一个大规模双语(英语-普通话)多说话人会议数据集,旨在支持说话人日志和会议转录研究。该数据集包含1000个模拟会议,每个会议有10-30名参与者,平均对话时长约20分钟,捕捉了真实的说话人重叠、轮流模式和跨语言交互。音频使用AIShell-1和LibriSpeech的话语合成,结合混响和噪声注入生成高保真多说话人录音。数据集还包括详细的说话人元数据,如性别、语言、会话类型和话语时间,支持受控实验和消融研究。
Multi-Talker-SD is a large-scale bilingual (English-Mandarin) multi-speaker meeting dataset designed to support research on speaker diarization and meeting transcription. This dataset comprises 1000 simulated meetings, each involving 10 to 30 participants, with an average dialogue duration of approximately 20 minutes. It captures realistic speaker overlaps, turn-taking patterns, and cross-language interactions. The audio is synthesized using utterances from AIShell-1 and LibriSpeech, combined with reverberation and noise injection to generate high-fidelity multi-speaker audio recordings. The dataset also includes detailed speaker metadata such as gender, language, conversation type, and utterance timestamps, enabling controlled experiments and ablation studies.
Multi-Talker-SD 数据集概述
数据集简介
Multi-Talker-SD 是一个大规模双语(英语-普通话)多人会议数据集,旨在支持说话人日志和会议转录研究。该数据集包含 1000 个模拟会议,每个会议有 10-30 名参与者,平均对话时长约 20 分钟,捕捉了真实的说话人重叠、轮换模式和多语言交互。音频使用 AIShell-1 和 LibriSpeech 的语音片段合成,结合混响和噪声注入,生成高保真多说话人录音。数据集还包括详细的说话人元数据,如性别、语言、会话类型和语音片段时间信息,支持受控实验和消融研究。
数据集组成
- 前端:说话人日志,包括元数据管理和支持日志的分段。
- 后端:声学模型构建,包括合成流水线、噪声/混响建模和音频生成。
数据下载与使用
下载数据
使用脚本目录中的下载脚本获取相应数据集。例如: bash bash script/download_librispeech.sh <your_save_dir>
点源和扩散场噪声数据可从以下链接下载:https://1drv.ms/u/c/969dad2e7ff5ab41/EcV68xcR9pVHsd3yNWSTzxkBkKvfLwTQsOluZJOnzf1GFA?e=OnfDv5
环境依赖
- faster_whisper==1.1.1(核心组件;建议按照 faster_whisper 安装所有相关库)
- soundfile
- tqdm
- torch
- torchaudio
使用提供的 requirements.txt 快速设置 Conda 环境: bash conda create -n diarization_env python=3.10 -y conda activate diarization_env pip install -r requirements.txt
运行脚本
运行 run.sh,关键参数包括:
exp_dir:保存生成的 WAV 文件的目录librispeech_dir:LibriSpeech 路径;确保此目录中存在 SPEAKERS.TXTaishell_1_dir:AIShell-1 路径;确保 resource_aishell 文件夹存在,包含 speaker.info 和 lexicon.txtpoint_noise_path:点源噪声数据路径diffuse_noise_path:扩散场噪声数据路径
关键配置
在 config/config.yaml 中配置:
iteration:迭代次数。程序将尝试此数量的迭代,每次迭代最多生成一个 WAV 文件。生成的 WAV 文件总数将小于或等于迭代次数。max_examples:要生成的 WAV 文件的最大数量。要生成确切数量的 WAV 文件,调整此参数。例如,设置为 100 将生成恰好 100 个 WAV 文件。它必须小于迭代次数;否则将被忽略。
资源链接




