遇见数据集

REAL-TSE Challenge Dataset

收藏
arXiv2026-07-17 更新2026-07-18 收录
数据链接:
官方服务:

资源简介:

REAL-TSE数据集是由IEEE SLT 2026挑战赛推出的首个面向真实对话场景的目标说话人提取基准数据集,由南京大学、香港中文大学(深圳)等多机构联合构建。该数据集包含总计6,991个混合语音-注册语音对,涵盖11.3小时的真实汉语和英语对话音频,数据来源于AISHELL-4、AliMeeting、AMI等真实会议录音及新采集的多环境会话。数据集通过同步录制高质量麦克风、手机及耳机设备构建,保留了自然重叠、混响、噪声及信道失配等真实声学特性。该数据集旨在评估目标说话人提取技术在低延迟流式处理和全上下文批处理场景下的性能,推动语音分离技术在实际对话系统、助听设备和会议转录等领域的应用突破。

The REAL-TSE Dataset is the first benchmark dataset for target speaker extraction in real conversational scenarios, launched by the IEEE SLT 2026 Challenge and co-constructed by multiple institutions including Nanjing University, The Chinese University of Hong Kong, Shenzhen, etc. It contains a total of 6,991 mixed speech-enrollment speech pairs, covering 11.3 hours of real conversational audio in both Chinese and English, with data sourced from real meeting recordings such as AISHELL-4, AliMeeting, AMI, and newly collected multi-environment conversations. The dataset is constructed via synchronous recording using high-quality microphones, mobile phones and headphone devices, and retains realistic acoustic characteristics including natural overlapping speech, reverberation, noise and channel mismatch. It is designed to evaluate the performance of target speaker extraction technologies in low-latency streaming processing and full-context batch processing scenarios, and promote application breakthroughs of speech separation technologies in fields such as real conversational systems, hearing aids and meeting transcription.

创建时间:
2026-07-17
搜集汇总
数据集介绍
REAL-TSE Challenge Dataset 数据集图片
构建方式
REAL-TSE Challenge数据集基于真实双语对话录音构建,融合了REAL-T语料库与独立采集的未见子集。开发集包含1991条混合-注册语音对,源自AISHELL-4、AliMeeting、AMI、DipCo及CHiME6等语料库,每个样本将自然重叠的混合语音与至少5秒的非重叠目标说话人注册片段配对。评估集包含5000对样本,其中EVAL-1来自与开发集相同的源语料库但无重叠,EVAL-2则为全新采集,涵盖会议室、咖啡馆、家庭及车载环境,通过高保真麦克风、手机及头戴式设备同步录制,并额外提供单说话人外部注册语音。所有数据均为真实录制的自然对话,包含自发交叠、混响与噪声。
特点
该数据集的核心特色在于其真实世界的生态效度与双轨评估架构。与模拟干净语音的基准测试不同,REAL-TSE直接采用真实对话录音,自然呈现音量起伏、混响、环境噪声、轮换发言、反应性交叠及非语言发声等复杂声学现象。数据集分为在线与离线两大轨道:在线轨道限制端到端算法延迟不超过100毫秒,服务于助听与实时通信场景;离线轨道允许全语境处理,适用于会议转录与后期制作。评估体系覆盖四个互补维度——词错误率衡量可懂度、说话人相似度评估身份一致性、DNSMOS感知音质及目标活动F1分数,全面刻画提取质量的多维特性。
使用方法
使用REAL-TSE数据集时,参与者需完成目标说话人提取任务:给定包含多人对话的混合语音及目标说话人的注册语音,系统须分离并恢复仅含目标说话人的语音。训练数据采用开放政策,允许使用公开语音库及预训练模型,但禁止使用开发与评估集对应语料的官方测试划分进行训练或微调。官方提供基于BSRNN架构的基线系统及WESEP工具包,支持因果与非因果提取器、嵌入与TF-Map两种条件注入方式的对比。提交的系统须通过扰动响应延迟验证在线轨道的实时性要求,并依据TER、SpkSim、DNSMOS-P808及F1四项指标进行稠密排序,最终排名取四项指标排名的平均值。
背景与挑战
背景概述
目标说话人提取(Target Speaker Extraction, TSE)旨在从多说话人混合录音中,依据注册语音等辅助线索,精准分离出指定说话人的语音信号,这一技术对远程会议、助听设备、智能助手及说话人感知的会议转录等应用具有重要支撑作用。然而,长期以来,主流的TSE评测数据集(如LibriMix、WSJ0-2Mix)均基于模拟混合语音,即对干净朗读语料以预设信噪比进行简单叠加,虽便于复现与分析,却未能真实反映实际对话场景中因自然重叠、混响、环境噪声、声道失配以及对话动态带来的复杂挑战。为弥合这一模拟与真实场景之间的鸿沟,REAL-TSE Challenge应运而生,由南京大学、香港中文大学(深圳)、布尔诺理工大学、西北工业大学、日本NTT株式会社、上海交通大学等机构的研究人员于2026年在IEEE SLT 2026会议上创办。该数据集聚焦于真实对话录音中的目标说话人提取,涵盖中文与英语两种语言,核心研究问题在于如何在在线低延迟流式处理与离线全上下文处理两种模式下,实现对目标语音的鲁棒提取。REAL-TSE的发布,为TSE领域提供了首个基于真实对话录音的标准化评测基准,对推动该技术从实验室走向真实场景具有里程碑意义。
当前挑战
REAL-TSE所应对的领域挑战首先在于,真实对话场景远非模拟混合所能涵盖。自然录音中充斥的未受控响度变化、真实混响、环境噪声、自然轮流说话、反应性重叠、语言不流畅及非言语发声等复杂因素,均对现有TSE方法的泛化能力提出了严峻考验。数据集构建本身亦充满挑战:为确保评测的真实性与多样性,需收集涵盖会议室、咖啡馆、家庭及车内等多场景的真实双人对话,并同步使用多个不同质量的麦克风(如高保真麦克风、手机、头戴麦克风)进行录制,从而引入显著的声道失配。此外,为模拟实际应用中的注册机制,需为每个目标说话人配备额外的单说话人注册语音,这进一步增加了声道与录音条件的不一致性。在评测指标上,REAL-TSE采用包括词错误率、说话人相似度、听觉质量(DNSMOS)及目标说话人活动F1分数在内的多维评价体系,这虽然提升了评估的全面性,但也暴露出无参考神经指标在竞赛条件下易被过度优化的脆弱性,部分团队通过针对性优化使得自动评分虚高而实际听觉质量并未提升,这对评测设计的公平性与可靠性构成了新挑战。
常用场景
经典使用场景
REAL-TSE Challenge Dataset最经典的使用场景在于评估和推动真实对话场景下的目标说话人提取技术。与传统的基于干净朗读语音模拟混合的基准不同,该数据集聚焦于包含自然重叠、混响、噪声、通道失配及对话动态的真实中英文会话录音。研究者通常利用该数据集构建和测试能够在复杂声学环境中精准分离目标语音的系统,尤其关注在线低延迟流式提取与离线全上下文处理两种互补的评估模式。
解决学术问题
该数据集解决了学术研究中长期存在的真实世界目标说话人提取评估缺失问题。传统基准如LibriMix和WSJ0-2Mix依赖理想的模拟混合,无法反映实际会话中的音量变化、真实混响、环境噪声、轮流说话、重叠及非语言发声等挑战。REAL-TSE通过提供多维度评价协议(包括可懂度、说话人一致性、感知质量和目标活动检测),使研究者能够全面评估系统在逼真条件下的鲁棒性与泛化能力,推动了从实验室模拟到真实场景的范式转变。
衍生相关工作
基于REAL-TSE数据集,衍生了一系列具有代表性的经典工作。参与团队开发了结合BSRNN与TF-GridNet风格提取器的系统,通过真实数据模拟、自适应训练、伪标签生成以及多目标优化策略显著提升性能。一些工作探索了基于SSL的吸引子初始化、说话人感知的状态调制、以及结合扩散模型与声码器重构的生成式后处理。此外,针对在线跟踪的因果归一化与非因果设计的对比研究,以及针对指标感知过优化的分析,都成为该基准衍生的关键研究分支。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务