遇见数据集

Trelis/CoSHE-500

收藏
Hugging Face2026-06-17 更新2026-06-21 收录
官方服务:

资源简介:

CoSHE-500是一个包含500个对话式印地语-英语语码转换(Hinglish)语音片段的评估数据集,每个片段约30秒,提供逐字混合脚本(天城文用于印地语,拉丁文用于英语)的参考转录。该数据集旨在测量真实世界语码转换自动语音识别(ASR)的质量,特别关注印地语/英语模型在此场景下的性能下降。它是从soketlabs/CoSHE-Eval数据集中精选的子集,经过重新分发,保留原始CC-BY-NC-4.0许可证(署名-非商业性使用)。数据集仅用于评估和基准测试,不建议用于训练,以确保其作为公平公共基准的有效性。

CoSHE-500 is a 500-clip evaluation set of conversational Hindi–English code-switched (Hinglish) speech, with verbatim mixed-script (Devanagari for Hindi, Latin for English) reference transcriptions. It is designed to measure real-world code-switch ASR quality, particularly in settings where Hindi/English models degrade. The dataset is a curated subset of soketlabs/CoSHE-Eval, redistributed under its original CC-BY-NC-4.0 license (attribution, non-commercial). It is intended for evaluation and benchmarking of ASR systems on conversational Hinglish, not for training, to maintain it as a fair public benchmark.

提供机构:
Trelis
搜集汇总
数据集介绍
Trelis/CoSHE-500 数据集图片
构建方式
CoSHE-500数据集源自Soket Labs发布的CoSHE-Eval语料库,经精心筛选与后处理构建而成。原始语料库包含大量印地语-英语代码混合的会话语音,研究团队从中抽取500条代表性音频片段,每条时长约30秒,并统一转换为16kHz单声道格式。转录文本保留了原始的天城文与拉丁字母混写形式,未进行任何强制音译或规范化处理,从而忠实呈现了自然对话中语言交替的真实面貌。此外,数据集仅划分评估集,不包含训练样本,确保了其作为独立基准测试的纯净性。
特点
CoSHE-500的核心特点在于其聚焦于高难度代码混合语音识别评估场景。每条音频均包含印地语与英语在句子内部的无缝切换,挑战了传统ASR系统对多语言混合输入的处理能力。转录文本采用原汁原味的混合文字系统,天城文标注印地语部分,拉丁字母标注英语部分,避免了音译带来的信息丢失。这种设计使得该数据集能够精准衡量模型在真实世界Hinglish对话中的性能退化程度,成为检验代码混合语音识别鲁棒性的理想标杆。
使用方法
研究人员可通过HuggingFace Datasets库便捷加载CoSHE-500数据集,使用load_dataset函数直接获取评估集,每条数据包含音频数组与对应转录文本。评估时需特别注意词错误率的计算方式:推荐采用支持天城文Unicode标准化的脚本安全归一化器,保留元音符号和鼻化符号,仅对拉丁字母部分进行小写化处理,并去除标点符号。禁止使用Whisper默认的文本归一化器,因其会剥离天城文元音符号导致错误率虚高。最终报告时应注明输出文字规范,避免因转录形式差异影响评估结果的可比性。
背景与挑战
背景概述
随着全球化与多语言交流的日益频繁,印地语与英语混合的代码切换语言(Hinglish)已成为南亚地区口语交流的典型形态,对自动语音识别(ASR)系统提出了严峻的挑战。在此背景下,Soket Labs团队于2024年前后构建了CoSHE-500数据集,该数据集源自其原始CoSHE-Eval语料库,精心筛选出500条约30秒长度的日常对话片段,每段均以天城文与拉丁文混合的逐字转录文本作为参考标注。作为首个专注于会话式Hinglish语音评估的基准测试集,CoSHE-500填补了现有ASR评测体系在代码切换语言场景下的空白,为衡量模型在真实世界多语态环境中的鲁棒性提供了关键标尺,对推动多语言语音识别技术的发展具有重要参考价值。
当前挑战
CoSHE-500聚焦的核心领域挑战在于,现有ASR模型在处理语内代码切换时普遍性能骤降,尤其是在同一语句中混合天城文与拉丁字符的转录场景,传统基于单一语言的声学模型与语言模型难以准确捕捉语音间的切换边界与发音变异。构建过程中,数据集面临的首要挑战是确保转录文本的严格逐字一致性,避免将音译或标准化处理引入参考标注,从而保留原始口语中的脚本混用特征;此外,为避免评测偏差,需设计专用的脚本安全归一化器,以区分天城文中的元音附标与分音符(如ड与ड़),并明确禁止使用默认的Whisper文本归一化方法,从而确保词错误率(WER)计算的公平性与准确性。
常用场景
经典使用场景
在自动语音识别(ASR)领域,针对印地语与英语高度混杂的代码转换语音(即Hinglish)的评估一直是一项极具挑战的任务。CoSHE-500作为一个精心构建的500条语音片段评估集,其核心经典用法在于为研究者提供标准化的测试基准,用以精确衡量各类ASR系统在真实对话场景下处理Hinglish语音的鲁棒性与准确性。该数据集保留了语音片段中自然的语码混合现象,并采用天城文与拉丁文混合的逐字转录作为参照,使得评估不仅局限于单一语言,而是深入到了词内和句间的语言切换理解层面。研究者通过在此基准上计算经过脚本安全规范化的词错误率(WER),能够客观对比不同模型在应对多脚本、多语言交织情况时的解码能力,从而推动ASR技术向更贴近实际多语交流形态的方向发展。
解决学术问题
学术研究中,大多数主流ASR评估集往往聚焦于单一语言或规整的朗读式语音,忽视了南亚地区普遍存在的口语代码转换现象所带来的独特问题。CoSHE-500针对性地解决了这一研究空白,其核心贡献在于系统性地揭示了现有ASR模型在Hinglish场景下的性能退化程度。该数据集促使研究者正视传统语音归一化流程中对天城文符号(如元音符号和鼻化音)的破坏性问题,并指明了基于词级的WER计算方式在混合语言转录中的局限性。通过设定明确的评测规范,CoSHE-500为后续关于跨语言声学建模、代码转换点检测以及多脚本解码策略的理论探索提供了可重复验证的实验平台,其发布意义在于引导学术社区将注意力从理想的单语场景转移至更具挑战性的多语混杂对话情境,从而深化对语音识别系统语言边界感知能力的本质理解。
衍生相关工作
CoSHE-500作为从更大规模CoSHE-Eval数据集中萃取出的高质评估子集,其发布直接催生了一系列围绕代码转换语音识别评价与优化的后续研究。经典的相关工作包括对多任务学习框架的改进,研究者利用该数据集验证了在编码器-解码器架构中引入语言身份嵌入(language ID embedding)对于减轻转写混淆的有效性。同时,该基准也促进了脚本鲁棒归一化工具的开发,例如专门用于Hinglish评估的Indic正常化库,其设计目标即为保留天城文字形细节的同时兼容拉丁字母处理。此外,一些前沿工作开始探索基于CoSHE-500的对比学习策略,旨在通过分布外检测机制增强模型对未见代码转换模式泛化能力。这些衍生研究不仅提升了Hinglish ASR的评测严谨性,也为其他多脚本语言(如罗马化乌尔都语、旁遮普语等)的评估基准建设提供了方法论参照,形成了以CoSHE-500为核心的学术辐射效应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务