MedKG-QA
收藏官方服务:
资源简介:
MedKG-QA是一个波兰语医疗问答数据集,包含5,086个经过严格验证的医学知识控制问题。该数据集从MedKG医学知识图谱自动生成,并通过多层质量门控机制进行筛选。数据集中问题分为两种类型:事实类问题(基于1-2跳图谱关系,共1,497个)和案例类问题(整合≥3个临床特征如症状/并发症/风险因素/药物作用,聚焦于单一诊断或药物,共3,589个)。跳数分布为:1跳844个、2跳653个、3跳165个、4跳166个、5跳3,258个。每个问题都经过四步验证:答案与源证据的一致性、基于源片段的可解性、答案无文本泄露、以及由独立LLM法官评估的质量评分(平均4.94/5分)。数据集包含9个字段:唯一标识符(id)、波兰语问题(question)、标准答案(answer)、答案等效变体(answer_aliases)、跳数(hops)、问题类型(type)、质量评分(quality_score)、推理路径(reasoning)以及包含主题、谓词、对象和源引用的证据列表(evidence)。数据来源于波兰维基百科(CC BY-SA 4.0)、URPL药品说明书(CC BY 4.0)和ICD-10 PL,整体以CC BY-SA 4.0许可发布。该数据集适用于医疗问答、知识图谱推理、多跳推理等自然语言处理任务,但需注意问题由LLM生成并自动验证,可能包含错误,不构成医疗建议。
创建时间:
2026-06-26
搜集汇总
数据集介绍

构建方式
MedKG-QA数据集源自波兰医学知识图谱MedKG,通过自动化管道生成5,086个波兰语医学知识控制问题,并经过四重质量筛选。构建流程包括:基于图谱关系生成候选问题,利用开放书求解器与评分器验证答案可解性,确保答案未在问题文本中泄露,以及由独立大语言模型评判员从自然性、临床意义、唯一性等维度评分(阈值≥4/5)。生成与评判模型分属不同家族,避免自我一致性偏差。最终样本按推理跳数(hops)分为事实型(1–2跳,1497例)和病例型(3+跳,3589例),后者整合单一实体的至少三个特征(如症状、并发症、药物作用)以指向特定诊断或药物。
使用方法
MedKG-QA适用于波兰语医学问答系统的训练与评估,尤其适合多跳推理与知识增强型大语言模型。用户可通过HuggingFace加载默认配置(qa.jsonl),利用'question'和'answer'字段进行监督微调,或借助'reasoning'与'evidence'字段实现链式思考(Chain-of-Thought)及检索增强生成(RAG)范式。'answer_aliases'字段支持多答案变体匹配,提升评估鲁棒性。数据集按CC BY-SA 4.0许可发布,但需注意其自动生成性质,不可替代专业医疗建议。
背景与挑战
背景概述
MedKG-QA是一个面向波兰语的医学问答数据集,由LIAM团队于近年创建,旨在利用医学知识图谱MedKG生成高质量的多跳推理问题。该数据集包含5086个经过严格验证的医学知识问题,覆盖从简单事实(1-2跳)到复杂病例描述(3跳以上)的多种推理层次。其核心研究问题在于如何通过知识图谱自动生成兼具临床合理性与自然语言流畅性的医学问答对,以弥补低资源语言(如波兰语)在医学NLP领域的标注数据匮乏。MedKG-QA的发布为多跳推理问答、医学知识图谱应用及低资源语言处理提供了重要基准,推动了相关领域在跨语言迁移和领域适配上的研究进展。
当前挑战
MedKG-QA面临的挑战主要体现在两个层面。领域问题层面,医学问答要求模型具备多跳推理能力,能够从知识图谱中整合分散事实以回答复杂临床问题,同时避免答案泄露和虚假关联;这超出了传统单跳问答的范畴,对模型的解释性和鲁棒性提出更高要求。构建过程层面,数据集通过自动化管线生成,但面临三重困难:其一,从维基百科、药品说明书等多源非结构化文本中提取结构化知识并构建图谱的准确性;其二,设计四重质量过滤门控以减少LLM生成中的幻觉和偏误;其三,平衡问题分布,确保1-2跳事实与3跳以上病例片段的比例合理,且临床语义无跳度过大的硬转折。
常用场景
经典使用场景
在医学自然语言处理与知识推理的交汇领域,MedKG-QA数据集为多跳问答任务提供了独一无二的波兰语基准。其5086个经过严格质量校验的医学问题,涵盖从单跳事实性查询到复杂临床病例推演的多层级难度,尤其将三跳以上的'临床病例描述'式问题作为核心挑战。研究者可利用该数据集训练与评估模型在医学知识图谱上进行结构化的推理能力,衡量其能否在错综复杂的症状、并发症、风险因素与药物作用关系网络中精准定位目标诊断或治疗方案,从而推动多跳问答系统在低资源语言上的发展。
解决学术问题
MedKG-QA精准地回应当前研究中的一个关键痛点:缺乏高质量、可溯源且经过严格验证的医学问答数据集,尤其对于波兰语等非英语语言。该数据集通过创新的四重自动校验流程——包括答案与源证据一致性、基于源文本的可解性、答案泄露检测以及独立裁判员的全面质量评分——有效解决了标注成本高昂与人工标注不稳定的难题。它为多跳推理、表格与文本混合推理、以及封闭式问答中的忠实性与可解释性研究提供了结构化的实验田,使得学术社区能够系统性地探索模型在医学领域的逻辑链条完整性。
实际应用
在实际应用中,MedKG-QA所代表的范式可深度赋能临床决策支持系统与医学继续教育平台。例如,在医生诊疗过程中,基于该数据集微调的问答模型能够从患者主诉中自动提取关键线索,整合病史、临床表现与药物禁忌,辅助生成鉴别诊断建议。同时,数据集中的多跳病例描述形式天然贴合波兰医学执照考试(如USMLE/PES风格)的题型,可被用于构建智能化备考工具,帮助医学生通过案例式逆向推理巩固知识网络,提升临床思维的严谨性。
数据集最近研究
最新研究方向
在医疗问答领域,知识图谱驱动的多跳推理成为破解复杂临床难题的前沿方向。MedKG-QA作为首个波兰语医学多跳问答数据集,通过整合药品说明书、ICD-10编码及维基百科等权威来源,构建了涵盖症状、并发症与药物机制的关联网络。该数据集以5086个经过四重自动质量门控过滤的高效样本,模拟了临床病案(vignette)中融合多要素的推理过程,其平均质量评分高达4.94/5,有效规避了答案泄漏与模型自洽偏差。这一创新不仅为低资源语言医疗NLP提供了可复用的基准,更推动了基于图谱的可解释诊断支持系统发展,尤其在现代医学亟需应对多病共患与个性化决策的背景下,凸显了语义结构对提升模型临床实用性的关键价值。
以上内容由遇见数据集搜集并总结生成



