遇见数据集

Boxp/ts_asr_test

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

ts_asr_test是一个目标说话人自动语音识别(Target-Speaker ASR)测试集,仅提供清单(manifest-only),不包含音频文件。数据集包含3928个音频片段,总时长约8.7小时,平均每条8.0秒,采样率为16 kHz单声道。语言包括中文(1580条)和英文(2348条),支持中英混合语音。样本分为正样本(3723条,包含目标说话人、干扰说话人和背景噪声)、负样本(115条,仅噪声/静音)和负样本(90条,仅干扰说话人),用于在给定注册音频(enrollment)的条件下,只转写目标说话人内容的任务。数据集通过确定性的重建脚本从公共源语料库(如LibriSpeech、Common Voice等)生成,支持可复现性。

ts_asr_test is a manifest-only test dataset for Target-Speaker Automatic Speech Recognition (Target-Speaker ASR), which only includes the manifest without any accompanying audio files. It comprises 3,928 audio segments, with a total duration of roughly 8.7 hours and an average length of 8.0 seconds per segment, recorded at 16 kHz mono sampling rate. The dataset covers two languages: Mandarin Chinese (1,580 segments) and English (2,348 segments), and supports mixed Chinese-English speech. Samples are categorized into three groups: positive samples (3,723 segments containing target speakers, interfering speakers, and background noise), and two types of negative samples: 115 segments with only noise or silence, and 90 segments with only interfering speakers. This dataset is developed for the task of transcribing only the target speaker's speech given a reference enrollment audio clip. It is generated from public source corpora including LibriSpeech and Common Voice via deterministic reconstruction scripts, ensuring full reproducibility.

提供机构:
Boxp
搜集汇总
数据集介绍
Boxp/ts_asr_test 数据集图片
构建方式
ts_asr_test数据集专为目标说话人自动语音识别任务设计,采用'仅清单'模式发布,不直接分发音频文件,而是提供一套完整的重建脚本与配方。该数据集通过固定配方将目标说话人语音、同说话人的注册音频、若干干扰说话人语音以及背景噪声混合生成每条样本,共包含3928条约8.7小时的语音片段。用户需自行获取LibriSpeech、Common Voice等公开源语料,并填写本地路径映射,运行`rebuild_ts_asr_test.py`脚本即可逐比特重建原始音频。配方中还固化了所有随机决策,确保在相同软件栈下重建结果完全可复现。
特点
该数据集的核心特点在于其结构化的正负样本设计,其中正样本3723条包含目标说话人与干扰源及噪声的混合,而负样本分为静音类(115条,仅噪声配任意说话人注册)和干扰类(90条,仅干扰说话人配不在混音中的注册),用于评估模型在目标说话人缺失时正确输出空的能力。数据集双语覆盖中英文及中英混说话场景,平均每条时长8.0秒,采样率为16kHz单声道。此外,数据集仅包含元数据引用,不涉及说话人身份信息,且支持`--license-tier free`选项重建仅含可商用成分的子集。
使用方法
使用该数据集时,用户首先需安装numpy、soundfile和scipy等依赖,接着按SOURCES.md获取源语料并编辑`source_map_template.json`映射模板,将各语料本地路径填入。随后运行`rebuild_ts_asr_test.py`脚本,指定配方文件、源映射及输出目录,即可生成16kHz单声道WAV文件和Lhotse兼容的`ts_asr_test_cuts_all.jsonl.gz`。每条样本的元信息包含目标说话人语言、转写文本、注册音频引用、干扰源列表及混音参数等,可直接加载为Lhotse CutSet进行模型评估。
背景与挑战
背景概述
目标说话人自动语音识别(Target-Speaker ASR)旨在从包含干扰说话人和背景噪声的混合语音中,仅转录指定目标说话人的语音内容。这一研究方向在会议记录、助听设备及人机交互等复杂声学场景中具有重要的应用价值。ts_asr_test测试集由研究团队于2026年构建,采用仅发布配方(manifest-only)的创新分发方式,通过整合LibriSpeech、Common Voice、AISHELL-1等公开语料库,创建了一个包含3928条样本、约8.7小时的英中双语目标说话人ASR测试基准。数据集涵盖中英混说话场景,并设计了正样本及两种负样本(静音负样本和干扰说话人负样本),为评估模型在目标说话人未出现时的鲁棒性提供了关键基准,推动该领域的标准化评估进程。
当前挑战
ts_asr_test所解决的核心领域挑战在于多说话人混合场景下的目标语音分离与识别问题,这要求模型在干扰说话人语音和背景噪声中准确提取并识别特定说话人的语音内容,同时具备对无目标说话人场景的正确判断能力。在数据集构建过程中,面临的主要挑战包括:源语音语料库的异构性使得需要统一处理不同采样率、编码格式和录音条件的音频数据;确定性混音配方的设计需平衡声学真实性(如信噪比、重叠比例参数)与计算复现性;跨语言(中英)混合测试样本的构建需要保证语言特征分布的合理性。此外,数据集采用仅分发元信息的方式,要求使用者自行获取源语料并运行重建脚本,这对用户的技术能力和合规意识提出了较高要求。
常用场景
经典使用场景
在语音与语言处理领域,目标说话人自动语音识别(Target-Speaker ASR)是一项极具挑战性的任务,其核心目标是在嘈杂的多人对话环境中,精准转录特定说话人的语音内容。ts_asr_test数据集聚焦于此经典使用场景,它提供了3928条混合语音片段,每条样本均由目标说话人语音、其注册音频、若干干扰说话人语音以及背景噪声按固定配方混合而成。该数据集专为评估模型在给定说话人注册信息的条件下,能否从多说话人混合语音中准确提取并转录目标说话人的内容而设计,尤其适用于研究语音分离与识别联合建模的基准测试。此外,数据集中还专门设置了负样本,用于考核模型在目标说话人未出现时能否正确输出空转录,从而全面衡量系统的鲁棒性与准确性。
实际应用
在实际应用中,目标说话人ASR技术具有广泛的落地价值,而ts_asr_test数据集为这些场景提供了可靠的评测手段。例如,在智能会议系统中,它可用于验证算法能否在多人同时发言时,准确转录指定参与者的发言内容;在智能家居领域,该数据集有助于评估语音助手在嘈杂环境中准确识别用户指令的能力,特别是当多个家庭成员同时说话时;在助听设备和听觉辅助技术中,它测试了系统能否聚焦于佩戴者意图关注的对话对象,从而提升听觉体验。此外,该数据集中英文混说的特性,使其特别适用于跨国企业、国际会议等涉及多语言混合沟通的现实场景,为构建稳健的多语言语音交互系统提供了关键测试资源。
衍生相关工作
ts_asr_test数据集作为一项专注于目标说话人ASR评测的资源,其发布直接催生和促进了多个相关研究方向的工作。基于该数据集,研究者可以系统性地比较不同的语音分离前端(如TF-GridNet、Sepformer)与ASR后端的联合调优策略。衍生工作包括开发更高效的说话人注册音频适配方法,例如基于说话人嵌入(如ECAPA-TDNN)的注意力机制,以提高模型对目标说话人声学特征的敏感性。此外,该数据集的确定性重建机制激发了关于“配方即数据集”的开源理念,推动了语音领域可复现评测集的构建范式。后续工作还探索了如何利用其负样本评估模块设计更可靠的空检测器,以防止模型在无目标说话人时产生幻听转录,这些研究共同拓展了目标说话人ASR技术的理论边界与实用效能。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务