遇见数据集

Shabarigirish/codeswitch-pairs-lase-indian

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

Codeswitch Pairs LASE — 印度口音保留语料库是一个包含1369个跨脚本话语对的数据集,专为研究口音条件性现象而设计。它使用8个ElevenLabs印度英语多语言语音合成,展示了现成编码器在处理印度口音语音时的特性:无论脚本如何,这些编码器会将印度口音语音紧密聚类,而西方口音则表现出较大的脚本条件性差异。每个数据行代表一个合成的话语及其元数据,通过voice_id字段在评估时重建跨脚本对(同一语音、不同脚本)。数据集包含英语(en)、印地语(hi)、泰卢固语(te)和泰米尔语(ta)四种语言,音频为16 kHz单声道WAV格式,每段约2秒。质量门槛基于WavLM余弦相似度≥0.90。数据通过ElevenLabs Multilingual v2 API合成,语音来自公共目录,文本为短通用英语短语的翻译或转写。该数据集遵循CC-BY-4.0许可证,并支持音频分类和文本到语音等任务。

Codeswitch Pairs LASE — Indian-accent held-out corpus is a dataset containing 1369 cross-script utterance pairs, designed to study accent-conditional phenomena. It is synthesized using 8 ElevenLabs Indian-English Multilingual voices, highlighting the finding that off-the-shelf encoders cluster Indian-accent voices closely regardless of script, while Western voices exhibit large script-conditional gaps. Each row represents one synthesized utterance with metadata, and pairs are reconstructed at evaluation time by joining on voice_id (same voice, different script). The dataset includes four languages: English (en), Hindi (hi), Telugu (te), and Tamil (ta). Audio is in 16 kHz mono WAV format, approximately 2 seconds per utterance. A quality gate is applied with WavLM-cosine similarity ≥ 0.90. Data is synthesized via the ElevenLabs Multilingual v2 API, using public voice IDs and short generic English phrases translated/transliterated into target scripts. It is licensed under CC-BY-4.0 and supports tasks such as audio-classification and text-to-speech.

提供机构:
Shabarigirish
搜集汇总
数据集介绍
Shabarigirish/codeswitch-pairs-lase-indian 数据集图片
构建方式
该数据集由1369个跨脚本语音对构成,源自ElevenLabs平台上8种具有印度英语口音的多语言合成声音。借助ElevenLabs Multilingual v2 API,研究者将通用英文短句翻译并转写为印地语、泰卢固语、泰米尔语及英语四种脚本,为每种声音生成对应的合成音频片段。所有音频均为16 kHz单声道WAV格式,时长约2秒,并经过WavLM余弦相似度不低于0.90的质量筛选,确保与原始声音参考片段的高度一致性。
使用方法
数据集适用于音频分类、文本转语音及说话人编码等任务。用户可直接加载manifest.jsonl文件,依据voice_id字段对同一声音在不同脚本下的音频进行配对分析。通过比较跨脚本对间的说话人嵌入相似性,可评估模型的说话人身份保持能力。此外,数据集中的语言标签和文本提示支持跨语言及代码切换相关研究,而质量指标有助于筛选高置信度样本进行实验。
背景与挑战
背景概述
语码切换(Code-switching)现象在多语言社会中普遍存在,尤其在印度次大陆,英语与印地语、泰卢固语、泰米尔语等本地语言的混合使用极为常见。然而,现有的说话人编码模型在跨脚本场景下往往表现不佳,因为多数西方模型对语音的脚本变化极为敏感,导致同一说话人在不同语言下的身份表征出现显著偏移。在此背景下,2024年由跨语言语音研究团队构建的Codeswitch Pairs LASE—Indian-accent held-out corpus数据集应运而生。该数据集聚焦于印度口音英语与三种印度本地语言的配对话语,旨在探究说话人编码模型在跨脚本条件下的身份保持能力。通过对比西方语言与印度语言在语音嵌入上的聚类效应,该数据集揭示了现有模型对印度口音话语的脚本条件敏感性远低于西方口音这一重要发现,为跨语言说话人验证与语码切换场景下的身份识别研究提供了关键基准。
当前挑战
该数据集所解决的领域核心挑战在于:现有说话人编码器在跨脚本语码切换场景下难以维持同一说话人的身份一致性,西方模型普遍对语言脚本变化敏感,而印度口音话语却展现出反常的脚本不敏感性,这一现象背后的机制尚待解析。在构建过程中,面临的主要挑战包括:需从ElevenLabs多语言语音库中筛选出同时支持英语、印地语、泰卢固语和泰米尔语的8个高质量印度口音发音人,并确保生成的1369对跨脚本语音样本在声学质量上达标,即WavLM余弦相似度不低于0.90。此外,文本提示的跨脚本翻译与音译需兼顾语义完整性与语音自然度,同时控制每条语音时长在约2秒的短片段内,以平衡数据规模与合成成本,最终才得以构建出这一针对性极强的评测集。
常用场景
经典使用场景
在跨语言与多方言语音处理领域,codeswitch-pairs-lase-indian数据集为评估说话人身份保留能力提供了关键基准。其核心设计在于构建跨脚本语音对——同一个合成语音在英语与印度多种本土文字(如印地语、泰卢固语、泰米尔语)下生成,从而精准测量语音编码器在语言切换时对说话人特征的稳定捕捉。该数据集特别适用于对比分析不同编码器(如WavLM)对印度口音语音的聚类效果,揭示西方与印度口音在脚本条件依赖上的显著差异。通过提供168个高质量语音对的标准化测试集,它成为验证语言对抗性说话人编码方法有效性的黄金标尺,推动跨语言声纹识别技术的公平评估与性能优化。
解决学术问题
该数据集直击多语言场景下说话人编码的核心学术难题:如何在语言变换时保持说话人身份的语义一致性。传统编码器在跨语言任务中常因语言特征干扰导致身份表征漂移,尤其对印度等口音多样性显著的区域表现欠佳。通过构建跨脚本语音对,该数据集体面揭示了西方与印度口音在脚本条件依赖上的差异性行为——西方口音呈现大语言条件间隙,而印度口音紧密聚类。这一发现推动研究者重新思考语言对抗性训练策略,并催生出语言对抗性说话人编码(LASE)等创新框架,有效解耦语言与说话人信息。其意义在于为跨语言声纹识别、多语言语音合成等任务提供了消除语言偏差的实证基础,显著提升系统在真实多语言场景下的鲁棒性与公平性。
实际应用
在实际产业应用中,该数据集直接服务于多语言语音助手、印度区域性智能客服及跨语言身份验证系统。例如,银行语音认证系统可借助该数据集训练的语言对抗性编码器,确保用户无论使用英语、印地语或泰卢固语进行身份验证,都能稳定提取一致的个人声纹特征。在语音合成领域,ElevenLabs等语音克隆服务能利用该数据集评估并优化不同口音下说话人音色的保真度,避免语言迁移引发的音色漂移。此外,流媒体平台的多语言内容推荐系统也可受益,通过一致的说话人身份识别提升个性化体验,尤其针对印度多语种用户群体,实现无缝的语言切换下的声纹追踪。
数据集最近研究
最新研究方向
该数据集聚焦于跨脚本语种混合场景下的说话人身份保持研究,尤其针对印度英语口音的多语言语音编码。前沿方向包括利用对抗性训练构建语言无关的说话人表征,以解决同一声纹在不同书写系统(如拉丁、天城文、泰米尔文)间的漂移问题。当前热点涉及将来自ElevenLabs的多语言合成语音作为评估基准,揭示现成编码器在高资源西方语言与低资源印度语言间的表现差异——前者对脚本变化敏感,后者则呈现聚类一致。该数据集为多模态声纹验证、跨语言语音克隆的质量控制提供了关键测试集,推动了公平性导向的印度次大陆多语言语音处理技术落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务