遇见数据集

issai/KazMix-3

收藏
Hugging Face2026-07-01 更新2026-07-22 收录
官方服务:

资源简介:

--- license: cc-by-4.0 language: [kk] task_categories: [automatic-speech-recognition] tags: [target-speaker-asr, speech-separation, kazakh, overlapping-speech, enrollment] pretty_name: KazMix-3 size_categories: [10K<n<100K] --- # KazMix-3 Kazakh three-speaker overlapping-speech dataset for **target-speaker ASR (TS-ASR)**, released with the [Persona-ASR](https://github.com/IS2AI/Persona_ASR) project. Given a short **enrollment** utterance of a target speaker and a **3-speaker mixture**, the task is to transcribe only the target speaker, or reject the utterance when the target is absent. This repository ships the **mixture manifests** and **generation scripts**, not the audio. Mixtures are derived from the **Kazakh Speech Dataset (KSD, [OpenSLR 140](https://www.openslr.org/140/))**; download KSD and run the scripts to reproduce the audio locally. ## Splits | Split | Total | Positive (target present) | Negative (target absent) | |---|---|---|---| | `train_clean_100` | 62,775 | 41,850 | 20,925 | | `val` | 13,500 | 9,000 | 4,500 | | `test` | 13,500 | 9,000 | 4,500 | Positive trials contain the enrolled target speaker and carry its transcript; negative trials do not contain the target (the model should emit no target transcript). Speakers are disjoint across splits. ## Files - `train_clean_100_kazakh3mix_lufsfix_posneg.json`, `val_kazakh3mix_lufsfix_posneg.json`, `test_clean_kazakh3mix_lufsfix_posneg.json` - `scripts/` — LUFS-uniform 3-speaker mixture generation (`rerender_kazakh3mix_lufs_uniform.py`) and manifest building. ## Manifest fields | Field | Description | |---|---| | `mixture_audio` | 3-speaker mixture (16 kHz) | | `enrollment_audio` | Target-speaker enrollment utterance | | `transcript` | Target reference transcript (empty for negatives) | | `speaker_id`, `target_speaker_id`, `target_index` | Target identity and its source index in the mixture | | `sample_type`, `class`, `label`, `is_target_present` | Positive/negative trial labels | | `snr_db`, `lufs_per_source`, `clip_scale` | Mixing SNR and per-source loudness (LUFS-uniform) | | `s1_path`, `s2_path`, `s3_path`, `source_speaker_ids`, `clean_source_rel` | Source provenance for regeneration | The full field list is present in each JSON entry. ## Mixing protocol Three-speaker mixtures in the LibriMix `clean`/`max` style, loudness-normalized to a uniform LUFS across sources. Each mixture designates one target speaker; the enrollment is a *different* utterance from that speaker. ## Regenerating the audio 1. Download KSD from https://www.openslr.org/140/. 2. Run `scripts/rerender_kazakh3mix_lufs_uniform.py`, pointing it at your local KSD path (see the [Persona-ASR repo](https://github.com/IS2AI/Persona_ASR) for full setup and dependencies). ## License and citation Manifests and scripts are released under CC BY 4.0; the underlying audio (KSD, OpenSLR 140) retains its own license. Please cite Persona-ASR and KSD. ```bibtex @article{persona_asr, title = {Persona-ASR: Bilingual Target-Speaker Speech Recognition for Kazakh--English Overlapping Speech}, author = {Meiramov, Rakhat and Rakhimzhanova, Tomiris and Taibassarov, Adil and Makhataeva, Zhanat and Varol, Huseyin Atakan}, year = {2026} } ```

Kazakh three-speaker overlapping-speech dataset for target-speaker ASR (TS-ASR), released with the Persona-ASR project. Given a short enrollment utterance of a target speaker and a 3-speaker mixture, the task is to transcribe only the target speaker, or reject the utterance when the target is absent.

提供机构:
issai
搜集汇总
数据集介绍
issai/KazMix-3 数据集图片
构建方式
KazMix-3 数据集的构建基于哈萨克语语音数据集(KSD, OpenSLR 140),通过脚本自动化生成三说话人混合语音。具体而言,采用 LibriMix 的 'clean/max' 风格混合协议,将来自同一发音人的不同话语作为目标说话人的注册语音,并与另外两个干扰说话人的语音按照统一的 LUFS 响度标准进行混音。生成过程中,每个混合物指定一个目标说话人,并生成相应的正例(目标存在)与负例(目标缺失)样本,负例中不包含目标说话人的任何话语。该数据集不直接提供音频文件,而是提供混合清单和生成脚本,用户需下载 KSD 后本地运行脚本复现音频。
使用方法
使用 KazMix-3 时,用户需首先从 OpenSLR 140 下载 KSD 音频,并依据 Persona-ASR 项目仓库中的指引运行 'scripts/rerender_kazakh3mix_lufs_uniform.py' 脚本,以本地生成混合音频。随后,可直接加载提供的 JSON 格式清单文件(如 'train_clean_100_kazakh3mix_lufsfix_posneg.json'),其中包含每个样本的元数据,包括混合和注册音频的相对路径、转录标签及说话人标识。在训练 TS-ASR 模型时,可基于 'enrollment_audio' 提取目标说话人嵌入,结合 'mixture_audio' 进行分离与识别,并利用 'is_target_present' 字段实施正负例判别。所有清单与脚本均采用 CC BY 4.0 许可,便于学术研究与复现。
背景与挑战
背景概述
KazMix-3数据集由IS2AI团队于2026年创建,旨在推动目标说话人自动语音识别(TS-ASR)在重叠语音场景中的研究。该数据集聚焦哈萨克语三说话人重叠语音,基于哈萨克语音数据集(KSD,OpenSLR 140)构建,通过生成三说话人混合语音及目标说话人注册语音,模拟真实环境中多人同时发言的复杂情况。KazMix-3不仅扩展了重叠语音资源的语言覆盖范围,还为双语(哈萨克语-英语)TS-ASR模型提供了标准化评估基准,对低资源语言的语音分离与识别技术发展具有重要意义,填补了中亚语言在该领域的空白。
当前挑战
KazMix-3解决的领域挑战是多人重叠语音下的目标说话人转录问题,即从混合音频中精确提取并识别指定说话人的内容,同时拒绝无目标说话人的混合样本。构建过程中,面临核心挑战包括:从KSD中选取发音清晰、噪声可控的语音片段,并确保说话人身份在训练、验证与测试集间无重叠;设计LUFS-均匀的混合协议以控制各声源响度一致性,同时保持自然语音动态;生成大量正例与负例样本以支持模型判别目标存在与否的能力;以及处理哈萨克语音素多样性导致的转录对齐问题,确保混合脚本生成的音频标签可靠。
常用场景
经典使用场景
KazMix-3 数据集专为目标说话人自动语音识别(TS-ASR)任务而设计,弥合了多说话人重叠语音场景中精准转录的空白。它提供三说话人混合语音,每段混合语音均配有一句目标说话人的注册语音,模型需从混合信号中分离并转录出目标说话人的话语,或在目标缺失时输出拒绝信号。该数据集的经典使用方式在于构建和评估能够抵抗语音重叠干扰的说话人感知型语音识别系统,其正负样本并存的实验设计(正样本含目标说话人,负样本不含)尤其适合训练具备说话人存在检测能力的鲁棒模型。
解决学术问题
KazMix-3 重点攻克了重叠语音场景下目标说话人语音识别这一学术难题,该问题长期受限于多源音频分离与说话人身份锚定之间的协同困境。通过引入注册语音作为说话人指纹,数据集使得模型能够学习在声学混叠中维持对特定说话人的关注,解决了传统语音识别在多人对话场景中性能急剧下降的问题。该数据集的问世推动了目标说话人ASR从单语言、简单混合向多说话人、高重叠度的复杂场景演进,为衡量分离-识别联合框架的有效性提供了标准化基准,对促进语音交互系统在真实鸡尾酒会环境中的智能化具有里程碑意义。
实际应用
KazMix-3 的实际应用场景紧密围绕需要从嘈杂多人环境中提取特定说话人语音的智能系统展开。例如,智能会议记录系统可借助注册语音锁定某位发言人的话语,实现参会者定向转写;人机交互设备(如智能音箱)能在家庭多人口令重叠时精确响应注册用户的指令;在安防与司法领域,该数据集支持从多通道监听录音中分离并识别特定目标人物的话语。此外,哈萨克语覆盖下的多说话人混合场景也为中亚地区的语音技术落地——如客服中心对话分析、车载语音指令过滤——提供了宝贵的训练资源。
数据集最近研究
最新研究方向
KazMix-3聚焦于哈萨克语三讲话者重叠语音场景下的目标说话人语音识别(TS-ASR),代表了多语种复杂声学环境中语音分离与识别的前沿探索。该数据集将注册话语与三话者混合语音配对,并引入目标是否存在二分类机制,为低资源语言(如哈萨克语)在重叠语音、多人对话场景中的精准语音交互研究提供了关键支撑。其发布与Persona-ASR项目紧密相连,推动双语音频处理技术在卡英双语等现实多点混合场景的应用,尤其适应会议转录与智能音箱等热点需求。通过统一LUFS响度标准与开源生成管线,KazMix-3不仅优化了模型训练的声学一致性,还为跨语种语音系统的公平性评估开辟了标准化途径,深刻影响着区域语言智能生态的构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务