InfoxMed医疗ASR基础数据集v1
收藏官方服务:
资源简介:
InfoxMed医疗ASR基础数据集v1。基于医学数据库文本,经清洗、切句、打分筛选后,使用Qwen3-TTS多音色合成的医疗领域ASR训练数据集。覆盖普通外科、皮肤病学、心血管内科、呼吸内科、消化内科、内分泌科、肾脏内科、血液科、肿瘤内科、神经内科、感染科、风湿免疫科、急诊医学、重症医学、妇产科、儿科、精神科、泌尿外科、骨科、耳鼻喉科、眼科等20余个科室,每科室取Top 1000条高质量医学句子。训练集15,208条约38.3小时,验证集806条约2.0小时,测试集798条约2.0小时,总数据量16,812条约42.3小时,采样率16kHz单声道WAV,文本长度15-45字平均约30字,音频时长平均约8秒/条,5种TTS合成音色(Vivian 30%、Uncle_Fu 25%、Serena 20%、Ryan 15%、Aiden 10%)。已删除130条音频时长异常样本。已知缺陷:全部为TTS合成与真实临床录音存在差距;英文医学缩写无标准朗读规则TTS合成读法可能与临床医生实际读法不一致,英文缩写CER约30-50%而纯中文CER仅1.56%;数据来源单一;音色仅5种缺乏方言口音语速变化;训练数据量偏少。后续改进:收集真实医疗问诊录音占比不低于30%;调研英文医学缩写临床实际朗读规则;扩大数据规模至100小时以上;引入上下文感知微调;增加音色和方言多样性。模型效果:基于Qwen3-ASR-1.7B+LoRA微调(r=32,alpha=64,3epochs),CER从17.34%降至3.46%,完美匹配率57.9%。
提供机构:
maas创建时间:
2026-07-29



