HiKE
收藏资源简介:
HiKE是第一个韩英语码转换自动语音识别基准,由跨多个主题的高质量自然语码转换数据组成。该数据集使用混合错误率和兴趣点错误率来精确评估模型的语码转换语音识别能力。数据集包含单词级、短语级和句子级的语码转换标签,以及所有借词的详细标注。
HiKE is the first Korean-English code-switching automatic speech recognition benchmark, which comprises high-quality natural code-switching speech data across multiple topics. This dataset uses Mixed Error Rate (MER) and Point-of-Interest Error Rate (POIER) to accurately evaluate the code-switching speech recognition capabilities of models. The dataset includes word-level, phrase-level, and sentence-level code-switching labels, as well as detailed annotations for all loanwords.
HiKE 数据集概述
数据集基本信息
- 数据集名称:HiKE (Hierarchical Evaluation Framework for Korean-English Code-Switching Speech Recognition)
- 研究领域:韩英语码转换语音识别
- 数据获取:https://huggingface.co/datasets/thetaone-ai/HiKE
- 论文链接:https://arxiv.org/abs/2509.24613
数据集特点
数据质量
- 首个韩英语码转换自动语音识别基准数据集
- 包含高质量、自然的语码转换数据
- 涵盖多种主题内容
标注体系
分层语码转换级别标注
- 词级别语码转换:发生在单词级别的语码转换,通常为单个名词或形容词的替换
- 短语级别语码转换:句子中的多词短语以另一种语言出现
- 句子级别语码转换:按句子交替使用不同语言
外来词标注
- 对外来词进行精细标注
- 解决韩语外来词(如버스)与英语原词(如bus)在语码转换语境中的互换问题
评估指标
- 混合错误率:用于精确评估模型的语码转换语音识别能力
- 兴趣点错误率:基于PIER指标的新型评估方法
实验发现
- 所有多语言ASR模型在语码转换数据上均表现出显著更高的错误率
- 通过微调可以提升模型的语码转换语音识别能力
技术实现
依赖环境
- Python环境依赖安装
- FFmpeg音频处理工具
评估流程
- 支持Whisper等模型的评估
- 提供自定义模型集成接口
- 评估结果保存至输出目录
引用信息
bibtex @misc{paik2025hike, title={{HiKE}: Hierarchical Evaluation Framework for Korean-English Code-Switching Speech Recognition}, author={Gio Paik and Yongbeom Kim and Soungmin Lee and Sangmin Ahn and Chanwoo Kim}, year={2025}, eprint={2509.24613}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2509.24613}, }




