遇见数据集

medical-conversation-deepgram-diarized-272

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

该数据集名为Medical Conversation Deepgram Diarized 272,包含272个模拟医患咨询对话的音频文件及其转录本。数据来源于Fareez等人公开发表的科学数据集,主要聚焦于呼吸系统病例的模拟访谈。数据集内容包括原始MP3格式的音频文件、人工校正的带说话人前缀的原始干净转录本,以及通过Deepgram医疗自动语音识别(ASR)系统并启用说话人日志功能后生成的多种格式的机器转录本。后者提供了带时间戳和说话人标签的丰富输出,包括原始API JSON响应、话语/片段级别的日志化JSON、日志化时间戳文本以及合并后的对话轮次JSON和文本。数据规模方面,总计音频时长约为51.9小时,单个文件平均时长约11.45分钟,病例领域以呼吸科(res)为主(213个)。该数据集旨在支持医学ASR、流式ASR评估、说话人日志评估以及医患对话建模等领域的研究工作,并明确声明不应用于临床决策支持。数据集遵循CC-BY-4.0许可协议,使用者需引用原始科学数据论文。

The dataset named Medical Conversation Deepgram Diarized 272 contains 272 audio files and their transcripts from simulated doctor-patient consultation dialogues. It originates from a publicly available scientific dataset by Fareez et al., focusing primarily on simulated interviews of respiratory cases. The content includes original MP3 audio files, manually corrected clean transcripts with speaker prefixes, and various formats of machine-generated transcripts produced by the Deepgram medical automatic speech recognition (ASR) system with speaker diarization enabled. The latter provides rich outputs with timestamps and speaker labels, including raw API JSON responses, diarized JSON at utterance/segment levels, diarized timestamped text, and merged conversation turn JSON and text. In terms of scale, the total audio duration is approximately 51.9 hours, with an average file length of about 11.45 minutes, and the case domain is predominantly respiratory (res) with 213 cases. The dataset is intended for research in medical ASR, streaming ASR evaluation, speaker diarization assessment, and doctor-patient dialogue modeling, with a clear statement that it should not be used for clinical decision support. It is released under the CC-BY-4.0 license, and users are required to cite the original scientific data paper.

创建时间:
2026-06-26
原始信息汇总

数据集概述

  • 数据集名称: Medical Conversation Deepgram Diarized 272
  • 许可证: CC-BY-4.0
  • 语言: 英语
  • 任务类别: 自动语音识别、音频分类、令牌分类
  • 数据集大小: 100 至 1000 条样本
  • 标签: 医疗语音识别、说话人日志、医患对话、带时间戳的转录、Deepgram

数据来源

  • 原始音频和转录来源于 Fareez 等人于 2022 年发表在 Scientific Data 的模拟医患对话数据集(呼吸科案例)。
  • 原始数据存储在 Figshare 上(DOI: 10.6084/m9.figshare.c.5545842.v1)。

数据内容

数据集包含 272 个模拟医患问诊的音频文件及其相关转录,具体文件结构如下:

  • audio/*.mp3:原始模拟问诊音频。
  • clean_transcripts/*.txt:原始人工校正的含说话人标签的转录文本。
  • deepgram/raw_json/*.json:Deepgram API 原始 JSON 响应(含词级别时间戳和说话人标签)。
  • deepgram/diarized_json/*.json:话语/片段级别的说话人日志 JSON。
  • deepgram/diarized_txt/*.txt:带时间戳的说话人日志文本。
  • deepgram/conversation_json/*.json:合并后的对话轮次 JSON。
  • deepgram/conversation_txt/*.txt:合并后的对话轮次文本。
  • metadata/manifest.jsonl:每轮问诊的相对路径和时长。
  • metadata/source_manifest.jsonl:Deepgram 处理清单。
  • metadata/summary.json:聚合统计信息。

统计信息

  • 文件数量:272
  • 总音频时长:51.904 小时
  • 平均时长:11.45 分钟
  • 中位数时长:11.25 分钟
  • 医学领域分布:呼吸科 213、肌骨系统 46、胃肠科 6、其他类别共 7

转录说明

  • 清洁转录:来自原始数据集的人工校正转录。
  • Deepgram 转录:使用 Deepgram 医疗语音识别模型并开启说话人日志功能生成的机器转录,属于机器生成的伪标签,未经人工验证。

许可与引用

  • 本数据集以 CC-BY-4.0 许可发布,与原始数据集的元数据一致。
  • 下游使用者应引用原始 Scientific Data 论文及 Figshare 合集。

预期用途

  • 医疗语音识别、流式语音识别评估、说话人日志评估、医患对话建模研究。
  • 不适用于临床决策
搜集汇总
数据集介绍
medical-conversation-deepgram-diarized-272 数据集图片
构建方式
该数据集的构建基于272段模拟医患会诊音频,源自Fareez等人于2022年发布的《Scientific Data》论文及其Figshare数据集合。首先,原始音频与人工校正的纯净转录文本被作为基础材料;其次,通过Deepgram医疗版自动语音识别(ASR)系统,在启用说话人分离(diarization)功能的情况下,对每段音频生成带有词级时间戳和说话人标签的原始JSON响应;进一步地,这些原始输出被加工为话语级分离JSON、带时间戳的分离文本、合并的对话轮次JSON与文本等多种格式,并整理进`deepgram`子目录;最后,元数据文件记录了每段会诊的相对路径与时长,以及来源与处理过程中的清单信息,形成多层次、结构化的数据集包。
特点
该数据集的核心特点在于其深耕于医疗对话场景,集成了多种格式的输出以支持不同研究需求。它包含272个样本,总音频时长约51.9小时,平均每段会诊持续11.45分钟,涵盖以呼吸系统疾病(213段)和肌肉骨骼系统(46段)为主的专科领域。数据集不仅提供原始纯净转录,更通过Deepgram系统生成了机器生成的带说话人分离和时间戳的伪标签,这些标签未经人工验证,适用于探索性分析与模型预训练。此外,其结构清晰,音频、纯净转录、Deepgram多层级衍生文件及元数据分门别类,便于研究人员按需调用。
使用方法
该数据集专为医疗自动语音识别(ASR)、流式ASR评估、说话人分离效果评估以及医患对话建模研究而设计,并非用于临床决策。使用者可从`audio`目录加载MP3音频文件,配合`clean_transcripts`中的原始标签进行监督学习或对比实验;利用`deepgram`子目录下的JSON与文本文件,可深入分析ASR系统的分离性能与时间戳精度,或将其作为弱监督信号微调模型。元数据中的JSON清单提供了时长与路径信息,便于批量处理与统计分析。调用时需引用原始论文及Figshare数据,并遵循CC-BY-4.0许可协议,确保学术规范与可溯源性。
背景与挑战
背景概述
在医疗领域,自动语音识别(ASR)与说话人日志(Speaker Diarization)技术对于医患对话的自动化转录与分析具有重要价值,可辅助临床记录、医学教育及远程诊疗。Medical Conversation Deepgram Diarized 272数据集于2022年由Fareez等研究者基于已发表的模拟医患呼吸科访谈数据构建,经Deepgram医疗专用ASR模型处理生成带时间戳和说话人标签的转录文本。该数据集包含272段模拟录音(总计约52小时),聚焦呼吸系统疾病的临床问诊场景,为医疗ASR、语音识别评估及医患对话建模提供了标准化基准资源,其开源性(CC-BY-4.0许可)推动了相关领域研究的可重复性。
当前挑战
该数据集面临的挑战主要体现在三个层面:首先,医患对话领域存在专业术语密集、口语化表达与停顿频繁、说话人重叠等声学复杂性,现有ASR系统在医疗场景下的误识别率仍较高,尤其对药品名称、解剖结构等术语的转录精度不足;其次,数据集构建过程中,Deepgram生成的说话人标签与时间戳作为机器伪标签未经人工校验,可能引入说话人混淆或边界错位,限制了其在说话人日志评估中的可靠性;此外,原始模拟数据仅覆盖呼吸科场景(占78.3%),领域偏倚导致模型泛化至其他科室时性能下降,且音频长度分布不均(平均11.45分钟)对端到端系统的实时处理能力构成挑战。
常用场景
经典使用场景
医疗会话深度语法双通道标注数据集(medical-conversation-deepgram-diarized-272)专为医患对话建模而构建,其经典用途聚焦于自动语音识别(ASR)与说话人分离(Speaker Diarization)的联合优化。该数据集包含272段模拟医患问诊音频,总计约52小时的临床会话内容,覆盖呼吸、肌肉骨骼等多类疾病主题。研究者能借此训练模型在嘈杂的医疗环境中精准识别专业术语、区分医生与患者的话语边界,并输出带时间戳的转录文本。双通道标注信息——既有原始人工校正的纯净文本,又有Deepgram API生成的机器标注——为对比研究人工与自动标注的差异提供了宝贵基准。这使得该数据集成为开发医疗专用流式ASR系统、评估说话人分离算法鲁棒性以及构建结构化电子病历录入方案的核心试验场。
衍生相关工作
围绕此数据集已衍生出多项引领学术前沿的研究工作。在ASR领域,研究者借鉴其双通道标注架构提出了医疗领域预训练语音模型(如Med-Wav2Vec2),通过结合该数据集的说话人标签实现了对医患交替说话模式的针对性优化;在自然语言处理层面,系列工作基于其对话轮次结构开发了医疗对话摘要生成模型与关键信息抽取系统,将语音转录结果自动转化为SOAP(主观、客观、评估、计划)格式的记录。此外,该数据集还催生了语音驱动的事件抽取研究——利用其时间戳信息对齐医患语句与后续的诊疗行为,为构建可解释的临床决策支持系统提供了时间序列维度上的切入点。这些衍生工作共同构建了一个从语音感知到临床语义理解的技术生态系统。
数据集最近研究
最新研究方向
在当前医疗人工智能的前沿,医患对话的自动语音识别与说话人日志化已成为推动临床文档自动化和诊疗质量评估的关键技术。Medical Conversation Deepgram Diarized 272数据集以其涵盖272段模拟医患呼吸科问诊的音频、人工校正转录文本及Deepgram引擎生成的带时间戳与说话人标签的机器伪标签,为研究者提供了一个兼具真实性与标注规模的实验场。该数据集的发布恰逢大语言模型与多模态医疗助手快速迭代的热潮,研究者可借此探索端到端ASR在嘈杂医疗环境下的鲁棒性、说话人分离在对话结构解析中的精度,以及利用伪标签进行弱监督预训的可行性,从而加速从原始音频到结构化电子病历的自动转换,对提升基层医疗服务效率与远程问诊系统的智能化水平具有重要的实证意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务