qwen3-asr-khmer-transcribe-pro
收藏资源简介:
该数据集是一个高棉语(Khmer)语音识别数据集,由 DDD-Cambodia 提供,专门用于训练 Qwen3-ASR-0.6B-Khmer 模型。数据集包含高棉语语音音频及其对应的文本转录,适用于自动语音识别(ASR)任务。数据集的构建旨在支持高棉语语音技术的开发,特别是基于 Qwen3-ASR 架构的模型微调。数据集的语言标签为高棉语(km),并属于语音识别、音频、高棉语相关领域。
This dataset is a Khmer speech recognition dataset, provided by DDD-Cambodia, specifically designed for training the Qwen3-ASR-0.6B-Khmer model. It contains Khmer speech audio and corresponding text transcriptions, suitable for automatic speech recognition (ASR) tasks. The dataset is constructed to support the development of Khmer speech technology, particularly fine-tuning models based on the Qwen3-ASR architecture. The language tag is Khmer (km), and it belongs to the fields of speech recognition, audio, and Khmer language.
Qwen3 ASR Khmer Transcribe Pro Colab 数据集详情
基本信息
- 语言:高棉语(km)
- 标签:语音识别、音频、高棉语、Qwen3-ASR、Kaggle、Web UI
- 许可证:Apache-2.0
内容概述
该数据集包含一个完整的全栈式 Web UI 和 API 部署包,用于在支持 GPU 的 Colab 和 Kaggle Notebook 环境中高效运行 Qwen3-ASR-0.6B-Khmer 模型,实现高棉语语音识别功能。
模型基础与致谢
本项目基于以下开源贡献构建:
-
高棉语微调模型:
- 模型:
seanghay/Qwen3-ASR-0.6B-Khmer及seanghay/wav2vec2-base-khmer-phonetisaurus - 开发者:Seanghay
- 训练数据集:
DDD-Cambodia/khmer-speech-dataset
- 模型:
-
基础架构模型:
- 模型:
Qwen/Qwen3-ASR-0.6B - 开发者:通义千问团队(阿里云)
- 代码仓库:Qwen3-ASR Repository(GitHub)
- 模型:
使用入口
- 提供 Colab Notebook 一键运行入口,可直接在 Google Colab 中打开并执行(通过链接访问
qwen3-asr-kh on Colab.ipynb文件)。
引用信息
数据集页面提供了两篇引用文献的 BibTeX 格式,分别涉及:
- 高棉语微调模型
Qwen3-ASR-0.6B-Khmer的技术报告 - Qwen3-ASR 基础模型的技术报告(arXiv 预印本)




