REAL-T
收藏资源简介:
REAL-T是第一个专门为真实世界条件下的目标说话人提取(TSE)设计的对话中心数据集。它基于说话人日记语料库构建,自然包含重叠语音、可注册片段和复杂的对话行为。数据集特点包括多语言(英语和普通话录音)、多类型(涵盖多样化的对话场景)和多注册(来自对话不同部分的多个注册话语)。
REAL-T is the first dialogue-centric dataset specifically designed for target speaker extraction (TSE) under real-world conditions. It is constructed from speaker diary corpora, and naturally contains overlapping speech, registerable segments, and complex conversational behaviors. The dataset features three core attributes: multilingual support with recordings in both English and Mandarin, diverse conversational scenarios covering a wide range of real-world dialogue types, and multi-register settings including multiple registered utterances from different parts of the conversations.
REAL-T 数据集概述
数据集简介
REAL-T 是首个专为真实世界条件下目标说话人提取任务设计的、以对话为中心的数据集。该数据集旨在解决现有合成数据集(如 LibriMix、WSJMix)在声学真实性和对话动态性上的不足,这些不足包括缺乏自发性语音、重叠对话轮次和环境噪声等真实交互特征。
核心特征
- 多语言:包含英语和普通话的录音。
- 多场景:涵盖多样化的对话场景。
- 多注册话语:提供来自对话不同部分的多个注册话语片段,用于说话人注册。
数据构成
数据集目前提供一个官方的评估划分:
- DEV:作为本仓库中使用的、以对话为中心的开发基准集。
评估发现
在 REAL-T 上的评估表明,现有的目标说话人提取模型性能显著下降,突显了需要针对真实对话语音开发更鲁棒的方法。
获取方式
DEV 集需通过 Google Drive 手动下载。
- 下载地址:https://drive.google.com/file/d/1uGTcTfRjOdqPa4PJAhjrXYLzxbGVy6pY/view?usp=sharing
预训练模型
论文中评估的 BSRNN 模型检查点可通过 Google Drive 获取。
- 下载地址:https://drive.google.com/uc?export=download&id=1M4UqK2A2EeHmQ0pCevYqBgaYn3RvklgC
相关论文
- 标题:REAL-T: Real Conversational Mixtures for Target Speaker Extraction
- 作者:Shaole Li, Shuai Wang, Jiangyu Han, Ke Zhang, Wupeng Wang, Haizhou Li
- 会议:Interspeech 2025
- 页码:1923–1927
- DOI:10.21437/Interspeech.2025-2662
- 论文链接:https://www.isca-archive.org/interspeech_2025/li25da_interspeech.pdf
联系信息
如有问题,请联系:shuaiwang@nju.edu.cn




