遇见数据集

mediTalk-mm-rdy

收藏
arXiv2026-08-11 更新2026-08-13 收录
官方服务:

资源简介:

mediTalk-mm-rdy是一个专为缅甸语临床对话自动语音识别构建的高质量医疗语音语料库,由泰国国家电子与计算机技术中心与缅甸语言理解实验室等机构联合创建。该语料库包含21,724条语音样本,总时长约28小时,均由9名缅甸语母语者基于PLAB 2临床评估手册的翻译文本录制,并经过严格的翻译验证与音频质量筛选。创建过程中,还通过模拟房间声学环境生成多样化训练数据,以增强模型鲁棒性。该数据集旨在填补缅甸语医疗语音资源的空白,为低资源场景下的ASR模型微调与鲁棒性评估提供基准支持。

MediTalk-mm-rdy is a high-quality medical speech corpus specifically constructed for Burmese clinical dialogue automatic speech recognition (ASR), jointly created by institutions including the National Electronics and Computer Technology Center of Thailand and the Myanmar Language Understanding Laboratory. This corpus contains 21,724 speech samples with a total duration of approximately 28 hours. All recordings were made by 9 native Burmese speakers based on translated texts from the PLAB 2 Clinical Assessment Handbook, and underwent strict translation validation and audio quality screening. During the corpus development process, diverse training data were also generated by simulating room acoustic environments to enhance model robustness. This dataset aims to fill the gap in Burmese medical speech resources, providing benchmark support for ASR model fine-tuning and robustness evaluation in low-resource scenarios.

创建时间:
2026-08-11
搜集汇总
数据集介绍
mediTalk-mm-rdy 数据集图片
构建方式
mediTalk-mm-rdy 数据集旨在填补缅甸语医疗语音识别领域公开资源的空白,其构建过程严谨而系统。转录文本源自《Samson PLAB 2 与临床评估手册》的缅甸语译本,由两位母语者逐句审核,确保语义与医学表述的准确性。音频由九位缅甸语母语者(两男七女)在安静环境中以16kHz采样率录制,并逐音节校验,剔除不一致的片段,最终形成28小时6分36秒的高质量语料。训练集(52.95小时)进一步经Pyroomacoustics模拟多种房间声学效果(如L形、长短距离),以贴近真实临床环境。
使用方法
该数据集适用于微调Whisper等预训练语音模型,支持全量微调(FFT)与参数高效微调(PEFT,如rsLoRA)两种范式。用户可依据硬件条件选择合适策略:若计算资源充足,FFT可获得最佳词错误率(如Medium模型达23.44%);若受限于内存,PEFT(r=128)可激活Large-v2模型。数据集还支持评估模型对噪声(不同SNR)与房间声学的鲁棒性,并提供了音节级错误分析工具,有助于深入挖掘缅甸语音系特征(如声调、弱前缀)的识别瓶颈。
背景与挑战
背景概述
mediTalk-mm-rdy数据集由缅甸语言理解实验室联合泰国国家电子与计算机技术中心等机构于2026年构建,旨在解决缅甸语医疗语音识别资源极度匮乏的问题。该数据集包含28小时6分钟36秒由九位缅甸母语者(两男七女)录制并严格验证的高质量医疗对话语音,为临床对话自动语音识别提供了首个公开可用的缅甸语医疗语音语料。其构建基于对PLAB 2临床评估手册的缅甸语翻译,经母语者逐句验证确保语义与医学准确性。该数据集的发布填补了缅甸语医疗ASR领域公开资源的空白,为低资源语言医疗语音研究树立了重要基准,推动了Whisper等预训练模型在缅甸语医疗场景的适配与评估。
当前挑战
该数据集面临的挑战涵盖领域与构建两方面。领域层面,缅甸语作为声调语言,音节级音高与浊音差异可改变语义,而医疗术语的本地化转写及临床对话的流畅性对ASR构成严峻考验;同时,低资源环境下公开语料稀缺,模型易受噪声与混响影响。构建过程中,需确保转录文本的医学准确性,为此由两位母语者人工验证全部14,517句翻译;录音虽在安静环境进行,但需严格进行音节级质量审核,剔除不匹配语音,最终保留高质量数据;此外,训练阶段还需模拟各类房间声学以增强鲁棒性,但合成数据与真实临床动态环境仍存在差异。
常用场景
经典使用场景
mediTalk-mm-rdy作为缅甸语医疗语音识别领域的稀缺标注语料,其经典使用场景聚焦于临床对话的自动语音识别(ASR)模型训练与评估。该数据集由九位母语者录制的28小时高保真语音构成,覆盖结构化医疗场景与临床对话,为低资源语言下的医疗ASR提供了首个可公开获取的基准。研究者常以此语料为基础,对Whisper等预训练模型进行领域微调,通过全参数微调(FFT)或参数高效微调(PEFT)策略,探究在受限硬件条件下模型适应医疗术语和对话风格的效能。其典型实验范式包括在纯净数据上训练并在模拟噪声、混响环境下测试,以衡量模型的鲁棒性,从而为低资源医疗语音识别树立了标准化且可复现的评测平台。
解决学术问题
该数据集直面低资源语言医疗ASR研究的共性难题——语料稀缺与模型鲁棒性欠缺。此前缅甸语医疗语音数据未公开,制约了研究的可复现性,而通用领域模型在处理医学术语与临床对话时错误率居高不下。mediTalk-mm-rdy的发布填补了这一空白,使研究者得以系统地探索领域微调策略(如FFT与PEFT对比)以及数据增强(波形级与频谱级)对噪声和房间声学变化的抵抗能力。通过提供干净与增强两种训练版本,数据集支持量化分析增强技术带来的精度-鲁棒性权衡,为平衡模型在真实临床动态环境中的表现提供了实证依据,推动了低资源医疗ASR从理论走向实践。
实际应用
在实践层面,mediTalk-mm-rdy直接服务于临床环境的语音驱动工作流,如电子健康记录(EHR)的语音录入、临床对话的自动转写以及医疗信息的语音检索。其构建过程模拟了现实采集条件(如设备麦克风和安静环境),并引入房间声学模拟,使训练模型更贴近诊疗室、病房等真实场景。该数据集支持开发面向缅甸语医疗场景的实时语音助手,减轻医护人员文书负担,提高诊疗效率。此外,模型的鲁棒性评估(如SNR变化和混响条件)为在嘈杂或远场拾音环境下部署ASR系统提供了可靠性保障,推动了语音技术在多语言、多环境下的实际落地。
数据集最近研究
最新研究方向
mediTalk-mm-rdy作为首个公开的缅甸语医学语音语料库,其最新研究聚焦于低资源条件下临床对话自动语音识别(ASR)的鲁棒性优化与模型适配策略。通过整合28小时高质量原生录音,结合全参数微调(FFT)与基于rsLoRA的参数高效微调(PEFT),系统评测了Whisper系列模型在医疗领域的效果,并引入波形与频谱双重增强及房间声学模拟以模拟真实临床环境。研究发现,数据增强虽在纯净语音上微损精度,却显著提升噪声与混响环境下的稳健性,其中FFT Medium模型在无增强时实现23.44%的词错误率(WER),优于大规模通用模型。这一成果不仅填补了缅甸语医学语音资源的空白,也为低资源语言医疗ASR的公平性与可复现性研究奠定了重要基础,推动了语音识别技术在非高资源语言临床场景中的实际落地。
相关研究论文
  • 1
    myMediWhisper: Construction of Burmese Medical Speech Corpus and Whisper Fine-Tuning for Clinical Dialogue ASR泰国国家电子与计算机技术中心; 缅甸语言理解实验室; 泰国国王科技大学; 泰国国王理工学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务