遇见数据集

corti/med-term

收藏
Hugging Face2026-06-10 更新2026-06-14 收录
官方服务:

资源简介:

Med-Term是一个自动语音识别(ASR)评估数据集,由Corti ApS发布,伴随《Symphony for Speech Recognition》白皮书。该数据集包含完全合成的医疗笔记,使用文本转语音(TTS)技术生成,涵盖德语、法语和英语三种语言。每个语言配置(de、fr、en)均有200个测试样本,总计600个样本。数据不包含真实患者信息、受保护健康信息(PHI)或可识别的第三方内容。特征包括音频(采样率44100 Hz,单声道)、转录文本、持续时间、听写命令、性别、说话者ID、格式化转录、医学术语及其格式化版本、格式化术语等。数据集旨在用于评估和基准测试ASR及相关NLP系统、学术研究,以及复现白皮书结果,但禁止用于训练模型、声音模仿、竞争性产品开发、深度伪造、临床决策或重新识别个体。许可证基于CDLA-Permissive-2.0和Corti使用限制附录。

Med-Term is an evaluation dataset released by Corti ApS alongside the *Symphony for Speech Recognition* white-paper. It is a fully synthetic medical notes dataset dictated using TTS in German, French, and English, built for benchmarking automatic speech recognition (ASR) and related NLP systems on medical-domain audio. The dataset contains no real patient data, PHI, or identifiable third-party content. It includes three language configurations (de, fr, en), each with 200 test examples, totaling 600 samples. Features include audio (sampling rate 44100 Hz, mono), transcription, duration, dictation command, gender, speaker_id, transcription_formatted, medical_terms, medical_terms_formatted, and formatting_terms. Intended uses are evaluating ASR/NLP systems, academic research, and reproducing white-paper results, but it is restricted from training models, voice imitation, competitive product development, deepfakes, clinical decisions, or re-identification. Licensed under CDLA-Permissive-2.0 with Corti Use Restrictions Addendum.

提供机构:
corti
搜集汇总
数据集介绍
corti/med-term 数据集图片
构建方式
med-term数据集由Corti ApS发布,伴随其《Symphony for Speech Recognition》白皮书问世。该数据集完全采用文本转语音(TTS)技术,在德语、法语和英语三种语言中合成了医疗笔记的音频内容,旨在为医疗领域的自动语音识别(ASR)及相关自然语言处理系统提供标准化的评估基准。构建过程中严格排除了任何真实患者数据、受保护的健康信息(PHI)或可识别的第三方内容,确保了数据的隐私合规性与合成纯粹性。每个样本均包含原始转写文本、格式化文本、音频文件、医疗术语列表及其格式化版本,以及说话人性别、ID、持续时间和听写命令等元信息,形成了结构化的多维度评估单元。
特点
该数据集的核心特点在于其高度专业化的医疗领域聚焦与多语言覆盖能力。音频采样率为44100Hz,采用单声道格式,确保了声学质量的统一与可复现性。每个配置(德语、法语、英语)均包含200条样本,规模虽小但精炼,专为模型评估与基准测试设计,而非用于训练。特别值得注意的是,数据集中明确分离了原始转写与格式化转写,并标注了医疗术语及其格式化形式,这使得研究者能够深入分析ASR系统在医学专有名词、格式化指令处理上的表现。此外,所有音频均为合成生成,完全消除了真实录音中的背景噪声、口音变异和隐私风险,为公平对比不同ASR系统的纯声学与语言建模能力提供了理想的控制条件。
使用方法
研究者可通过HuggingFace的datasets库便捷地加载该数据集,调用load_dataset('corti/med-term')默认获取德语子集,或通过指定'fr'、'en'参数分别加载法语和英语子集。数据集仅包含test划分,适合直接用于评估流程。使用时应严格遵循其许可证限制:该数据仅可用于评估、基准测试和学术研究,严禁用于训练或微调任何机器学习模型,禁止克隆或模仿音频中的声音以构建商业TTS或语音克隆产品,也绝不可用于临床诊断或治疗决策。加载后,用户可访问audio字段进行语音识别推理,并结合transcription、medical_terms等字段与模型输出进行对比分析,从而量化ASR系统的词汇错误率与医学术语识别精度。
背景与挑战
背景概述
Med-Term数据集由丹麦人工智能医疗企业Corti ApS于2026年发布,旨在评估自动语音识别(ASR)系统在临床听写场景中的性能。该数据集是完全合成的医疗笔记语音数据,覆盖德语、法语和英语三种语言,通过对医学专业文本进行文本转语音(TTS)生成,规避了真实患者数据的使用,确保了隐私合规性。在智能医疗语音接口快速发展的背景下,Med-Term填补了专门用于医疗领域ASR基准测试的高保真、多语言评估数据集空白。其核心研究问题在于衡量ASR系统对涵盖丰富医学术语和格式化命令的长语音片段的转录准确性,为研发更为可靠、实时的医疗语音辅助工具提供了标准化的评价参照系。该数据集的推出不仅推动了医疗语音识别技术的客观比较与迭代,还通过严格的许可证管理向学术与工业界提供了可复现的研究基础。
当前挑战
Med-Term数据集主要应对两大层面的挑战。在领域问题层面,医疗听写具有高频专业术语、复杂格式化命令(如分段、标点)以及对实时性要求极高的特点。传统的通用ASR系统难以精准处理大量罕见医学词汇和句子结构,容易产生关键信息的误转录,影响临床决策安全性。数据集因此聚焦于评估模型在低错误率下对多种语言医学术语的语音识别能力。在构建过程中,为了平衡高质量合成语音的真实性与隐私保护,Corti团队需要确保生成的音频无第三方身份信息,并严格遵循TTS技术的授权限制。同时,设计能够标记医学术语、格式化指令等多层次注释特征,对标注策略与数据格式提出了精细化要求。这些努力确保了数据集的基准测试功能与法律伦理双重合规性。
常用场景
经典使用场景
med-term数据集专为评估自动语音识别系统在医疗领域的表现而设计,其核心用途聚焦于对多语种(德语、法语、英语)医学口述音频进行转录准确性测试。该数据集包含了由文本转语音技术生成的合成医学笔记音频,每条样本均附有原始转录文本、格式化后的医疗术语序列及说话人性别、时长等元信息。研究者可借此标准化评测现有ASR模型对专业医学术语的识别能力,尤其适用于检验模型在域外词汇、复杂术语组合及多语种环境下的鲁棒性。其设计初衷并非用于模型训练,而是作为公平、可重复的基准测试工具,推动医疗语音交互系统的透明化评估。
衍生相关工作
med-term数据集作为Corti ApS发布的配套资源,直接衍生于其团队提出的Symphony for Speech Recognition白皮书,该工作详细论述了面向实时医疗语音接口的端到端系统设计。该数据集的诞生激励了后续一系列围绕医疗域ASR适应性评估的研究,例如部分工作利用该基准对比不同语音分割策略对术语识别率的影响,或探究预训练模型在多语种医疗场景下的跨语言迁移能力。此外,受Med-Term启用合成数据思路启发,亦有研究者尝试构建类似的无隐私风险评估套件,覆盖放射学报告、药物交互记录等更细分的医学子领域,从而逐步编织起一个系统性的医疗语音评估体系,推动领域从封闭测试走向开放、可复现的标准化评测时代。
数据集最近研究
最新研究方向
在医疗语音识别领域,数据集的最新研究方向聚焦于构建多语种、高质量的合成医学音频基准,以推动自动语音识别(ASR)系统在临床环境中的鲁棒性评估。med-term数据集由Corti ApS发布,伴随《Symphony for Speech Recognition》白皮书,覆盖德语、法语和英语三种语言,完全通过TTS合成生成,严格避免了患者真实数据与受保护健康信息,为医学领域ASR模型的标准化评测提供了可靠的测试资源。当前热点包括利用该数据集量化前沿语音识别模型在处理专业医学术语、格式化指令及多语种发音时的准确率,同时促进临床实时语音交互接口的研发。其开放许可与明确的使用限制,进一步推动了学术界与工业界在医疗语音技术上的协同创新,确保研究成果的伦理合规性与可复现性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务