遇见数据集

CentificAIResearch/MedSpectrogram-Reasoning

收藏
Hugging Face2026-06-17 更新2026-07-22 收录
官方服务:

资源简介:

MedSpectrogram-Reasoning是一个医疗声学问答数据集,专门用于基于梅尔频谱图(mel spectrograms)进行推理,涵盖心音、肺音和咳嗽声。每个记录包含一个临床问题、录音的梅尔频谱图像、真实答案以及录音的临床元数据。该任务为纯视觉任务:模型接收频谱图像和问题,必须通过频谱图推理生成答案,原始音频不作为模型输入,仅用于参考和可重复性。本版本为分层样本,覆盖所有声音类型和源数据集。测试集包括126个录音和504个问答对,来自多个公开医疗声音数据集,如CirCor DigiScope(心音)、ICBHI 2017(肺音)、Coswara(咳嗽)等。数据以Parquet和JSONL格式存储,包含音频文件(.wav)和频谱图图像(.png)。数据集用于研究和教育目的,采用CC-BY-4.0许可证。

MedSpectrogram-Reasoning is a medical acoustic question-answering dataset for reasoning over mel spectrograms of heart, lung, and cough sounds. Each record provides a clinical question, the mel-spectrogram image of a recording, a ground-truth answer, and the recordings clinical metadata. The task is purely visual: a model receives the spectrogram image together with the question and must reason over the spectrogram to produce the answer. The raw audio is not used as model input—the original .wav recordings are included only for reference and reproducibility. This release is a stratified sample covering all sound types and source datasets. The test split includes 126 recordings and 504 QA pairs, sourced from publicly available medical sound datasets such as CirCor DigiScope (heart), ICBHI 2017 (lung), and Coswara (cough). Data is stored in Parquet and JSONL formats, with audio files (.wav) and spectrogram images (.png). The dataset is intended for research and educational purposes, released under the CC-BY-4.0 license.

提供机构:
CentificAIResearch
搜集汇总
数据集介绍
CentificAIResearch/MedSpectrogram-Reasoning 数据集图片
构建方式
MedSpectrogram-Reasoning数据集基于七项公开的医学音频数据集构建,涵盖心音、肺音与咳嗽声等多类型临床音源。研究团队从CirCor DigiScope、ICBHI 2017、SPRSound、KAUH、ZCH、Coswara及咳嗽计数数据集中分层抽样,共选取126条音频记录,每一条记录生成四个临床问答对,总计504个样本。数据构建的核心在于将原始音频转换为梅尔频谱图,并以纯视觉推理为任务范式——模型仅依据频谱图与临床问题作答,原始波形仅用于参考与复现。问题被平衡地划分为显式与推断式两类,分别考察对频谱图中直观特征与隐含临床信息的理解能力。
特点
该数据集独具特色,将音频医学分析转化为视觉推理任务,打破了传统依赖原始波形输入的模式。其问题设计兼顾两类认知深度:显式问题直接询问频谱图中的可观察特征,而推断式问题则要求模型结合临床元数据与频谱形态进行逻辑推导。数据来源覆盖心音、肺音与咳嗽声三大医学音频类别,且每个样本均附带详细的临床元数据(如人口学信息与标注),为多模态关系建模提供了丰富语境。此外,数据集规模虽小但高度精选,通过分层采样确保各音源类型与原始数据集的代表性,适用于评估模型在跨域临床频谱图上的泛化能力。
使用方法
研究者可通过HuggingFace Datasets库直接加载测试集,调用`load_dataset`函数即可获取包含问题、频谱图路径与标准答案的字典格式数据。更灵活的使用方式可借助提供的qa.jsonl文件逐行解析JSON对象,或按需读取本地区目录下的频谱图图片与音频文件。数据集中所有媒体文件均使用相对路径引用,便于本地部署与扩展。建议模型输入时将频谱图作为视觉通道,结合问题文本进行端到端推理,输出答案与标准答案对比评估。该数据集专为研究目的设计,遵循CC-BY-4.0许可协议,适用于医学视觉问答、临床音频分析及多模态推理等场景的基准测试。
背景与挑战
背景概述
MedSpectrogram-Reasoning数据集由Centific AI Research团队构建,旨在推动医学声学信号分析与临床推理的交叉领域研究。该数据集于2024年发布,聚焦于通过梅尔频谱图进行医学音频的视觉问答任务,涵盖心音、肺音和咳嗽声等多种临床声音类型。其核心研究问题在于验证模型能否仅凭频谱图图像而非原始音频信号,完成对临床问题的推理与回答。数据集整合了CirCor DigiScope、ICBHI 2017、SPRSound等七个公开医学声音数据集,形成高度多样化的样本空间,为医学多模态理解与诊断辅助系统提供了标准化评测基准,有望促进人工智能在听诊与远程健康监测中的应用发展。
当前挑战
MedSpectrogram-Reasoning面临的挑战主要体现在领域问题与构建过程两个层面。在领域问题层面,现有模型需处理频谱图中隐含的细粒度病理特征,如心杂音、湿啰音等声学异常,这些特征常因噪声、个体差异或录音设备不同而难以准确辨识,且临床问题的回答需结合特定领域知识,对模型推理能力提出高要求。在构建过程中,挑战在于跨数据集整合时,各来源的标注标准、采样频率、音频长度与元数据格式不一致,需进行严格的数据对齐与质量控制;同时,为平衡高频词分布与避免样本泄露,采用分层抽样策略并手工设计显式与推断两种问题类型,增加了标注与验证的复杂性。
常用场景
经典使用场景
MedSpectrogram-Reasoning数据集的核心应用在于评估和提升人工智能模型在医学声学领域的视觉推理能力。该数据集将心音、肺音及咳嗽声音的梅尔频谱图作为唯一的视觉输入,配合精心设计的临床问题,要求模型仅凭频谱图像而非原始音频进行推理作答。这种设计模拟了临床医生通过观察声谱图进行诊断的思维过程,为多模态医学人工智能模型提供了一个专注于视觉-语义理解的基准测试平台。研究者通常利用该数据集来检验模型在解读频谱图像中蕴含的病理特征、时间动态和频率分布等关键信息方面的表现,从而推动医学声学分析从传统的音频处理范式向更富有解释性的视觉推理范式转变。
衍生相关工作
自发布以来,MedSpectrogram-Reasoning数据集已催生了一系列具有启发性的衍生研究工作。研究者基于该数据集开发了专门针对医学频谱图像的多模态视觉-语言模型,这些模型在预训练阶段融合了临床知识图谱,显著提升了少样本场景下的推理准确率。另有工作聚焦于频谱图像的对比学习框架,通过构造正负样本对来学习更具判别力的频谱特征表示,并将其迁移到其他低频医学信号分析任务中。此外,该数据集还启发了针对频谱图像中局部病理区域定位的注意力机制研究,以及探讨模型在频谱图像与临床文本之间对齐能力的可解释性分析工作,这些成果共同推动了医学声学人工智能领域的边界拓展。
数据集最近研究
最新研究方向
MedSpectrogram-Reasoning数据集的最新研究方向聚焦于医学音频的视觉推理,将心音、肺音和咳嗽声的梅尔频谱图作为纯视觉输入,结合临床问题驱动模型进行跨模态理解与推理。这一前沿方向打破了传统音频分类或直接波形分析的局限,推动医学听诊向可解释的视觉问答系统演进,尤其在大语言模型与医学影像交叉领域具有里程碑意义。通过构建涵盖多种声音类型与临床元数据的多源小样本数据集,该研究为评估模型在医疗场景下的高阶认知能力(如症状推断与病因判别)提供了标准化基准,与当前医疗AI追求可信赖诊断的热点紧密呼应。其影响在于为远程听诊、自动化临床推理等应用奠定数据基础,同时促进少样本学习与视觉语言模型在医疗音频领域的泛化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务