遇见数据集

ServiceNow-AI/asr_codeswitched

收藏
Hugging Face2026-06-09 更新2026-06-14 收录
官方服务:

资源简介:

该数据集是一个多语言语音或对话数据集,包含四个配置:英语-德语(en_de)、英语-西班牙语(en_es)、英语-法语(en_fr)和英语-加拿大法语(en_fr_ca)。每个示例包括ID、多语言话语(如德语、英语、西班牙语或法语版本)、原始话语、语音信息、音频数据、单词序列、单词语言标签、问题序列和预期答案序列。数据集仅提供测试分割,用于评估多语言任务,如语音识别、机器翻译、问答或语言学习应用。

This dataset is a multilingual speech or dialogue dataset with four configurations: English-German (en_de), English-Spanish (en_es), English-French (en_fr), and English-Canadian French (en_fr_ca). Each example includes ID, multilingual utterances (e.g., German, English, Spanish, or French versions), original utterance, voice information, audio data, word sequences, word language labels, question sequences, and expected answer sequences. The dataset provides only test splits for evaluating multilingual tasks such as speech recognition, machine translation, question answering, or language learning applications.

提供机构:
ServiceNow-AI
搜集汇总
数据集介绍
ServiceNow-AI/asr_codeswitched 数据集图片
构建方式
该数据集名为asr_codeswitched,专注于语码转换场景下的自动语音识别任务。其构建过程依托于Welodata平台,通过收集英语与德语、西班牙语、法语及加拿大法语四种语言组合的混合语料,形成四个独立子集。每个样本包含双语转录文本、原始语音音频、逐词语言标签、相关问题及预期答案,确保了多模态对齐与语义完整性。数据仅划分测试集,规模从173至298条不等,为评估跨语言语音识别模型的语码转换能力提供了标准化基准。
特点
数据集的核心特点在于其精细的语码转换标注体系,每条样本均提供逐词的语言归属信息(word_languages),可精准分析混合话语中语言切换的位置与模式。同时,语音与文本的双语对应(如de_utterance与en_utterance)及问答对设计,支持从声学感知到语义理解的多层次研究。音频特征(dtype: audio)与结构化字段结合,兼顾了原始信号与高层语义的关联性。
使用方法
使用时,可通过HuggingFace Datasets库加载不同配置(如en_de、en_es),直接获取测试集数据进行模型评估。数据支持典型的语音识别流程:利用audio字段输入波形,结合utterance字段作为转录目标,并借助words与word_languages字段进行细粒度错误分析。此外,questions与expected_answers字段可用于下游任务如跨语言问答或对话系统测试,适用于评测模型在多语言混合环境下的综合表现。
背景与挑战
背景概述
asr_codeswitched数据集是针对语音识别中语码转换现象的专门评测基准,由多语言语音处理领域的研究机构构建,旨在解决双语乃至多语混用场景下的自动语音识别难题。该数据集创建于近年来,覆盖英语-德语、英语-西班牙语、英语-法语及英语-加拿大法语四种语码转换对,包含带有逐词语言标注的音频及对应文本、问题与预期答案。其核心研究问题在于评估现有语音识别系统在真实语码转换环境下的鲁棒性与准确率,为多语言交互系统、跨文化通信等前沿应用提供标准化的评估资源。该数据集的出现填补了语码转换语音识别领域缺乏统一、细粒度测试集的空白,对推动多语言语音技术的实用化发展具有重要影响。
当前挑战
语码转换带来的领域挑战在于语音识别系统需同时处理多种语言的声学、音系及语法特征,频繁的语种切换极易导致模型混淆或遗漏语音片段,从而显著降低转录准确率。构建过程中,数据采集面临双语乃至三语语音的自然性与真实性难以保证的问题,需确保语码转换行为符合真实交流模式;多语言标注的一致性要求极高,需为每个单词精确标记所属语言,涉及复杂的语言学规则与人工校验,同时配合同步录音、规范化文本与问题答案的设计,大幅增加了数据集构建的难度与成本。
常用场景
经典使用场景
在跨语言语音识别这一前沿领域,由于双语或多语使用者常在日常对话中自然地切换语言,会形成一种被称为“语码混合”的语言现象。该数据集专为此场景设计,收集了英语-德语、英语-西班牙语、英语-法语以及英语-加拿大法语四种双语对的真实人声音频,并提供了对应的转写文本、逐词语言标注以及问答对信息。典型地,研究者利用这些音频与转录数据训练和评估语音识别系统在语码混合环境下的精准度,尤其侧重模型在同一个句子内对不同语言单元的正确解码能力。
衍生相关工作
围绕该语码混合语音数据集,学术界已涌现出一系列衍生经典工作。研究者基于其提供的逐词语言标注和问答结构,探索了细粒度语言识别与语音内容解析的结合,推动了更精细的多语言语音理解模型设计。此外,该数据集催生了多项关于跨语言语音特征对齐和混合语言数据扩充的技术研究,成为评估语音解码中语言边界检测与语言模型深度融合方案的基准平台,进而启发了新一代泛化能力更强的多语言语音系统的诞生。
数据集最近研究
最新研究方向
跨语言语音识别中的语码混合现象研究正成为多模态和低资源语言处理领域的前沿热点。asr_codeswitched数据集聚焦于英语与德语、西班牙语、法语及加拿大法语等多种语言的混合语音,精准捕捉了语码转换在真实对话中的复杂韵律与词汇边界,为提升ASR系统在双语或多元文化场景下的鲁棒性提供了关键基准。随着全球化进程中移民社群与多语社区的数字化浪潮,该数据集的发布有力推动了对语码混合语音的细粒度建模,尤其是在问答任务中实现字级语言标签的精准对齐,引领了端到端模型对混合语言声学与语义特征的联合学习新方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务