遇见数据集

lion-ai/MedKG-graph

收藏
Hugging Face2026-07-07 更新2026-07-22 收录
官方服务:

资源简介:

--- license: cc-by-4.0 language: - pl tags: - medical - knowledge-graph - polish - pharmacology task_categories: - question-answering - text-retrieval pretty_name: MedKG — Polish Medical Knowledge Graph size_categories: - 10K<n<100K --- # MedKG — Polish Medical Knowledge Graph A directed medical knowledge graph in **Polish**, extracted from Polish Wikipedia and drug leaflets (ChPL / charakterystyki produktów leczniczych), then **LLM-validated edge-by-edge**. - **36,544 directed edges**, **25,942 nodes**, **24 typed relation types** - Built for medical **question answering** and retrieval. ## How it was built 1. **Extraction** — Gemma-4-26b extracts triples from chunked Polish medical text with a schema-guided, qualifier-preserving prompt. 2. **Canonicalization + dedup** — BGE-M3 + Morfeusz lemmatization; `support` counts how many times an edge was independently extracted (corroboration). 3. **Validation & repair** — every corroborated edge (support≥2) is checked by **DeepSeek-V4** against a typed schema with domain/range + direction rules, and is either kept, **direction- fixed**, **predicate-retyped**, or dropped. Only kept/repaired edges are published. ## Quality (measured, not claimed) Evaluated with a **per-edge accuracy rubric** graded by an independent strong model (a physician- persona judge classifies each sampled edge CORRECT / QUESTIONABLE / WRONG). The rubric was validated against a negative control (a version with randomly permuted objects scored **2/10**). | Slice | Edge accuracy (physician-CORRECT) | Only ~WRONG | |---|---|---| | Full graph | **78%** | ~4% | | `support ≥ 3` | **82%** | — | | `support ≥ 5` | **88%** | — | Holistic OVERALL: **7/10** (7.3 on the highest-precision slice). Remaining imperfections are mostly *true-but-general* statements (e.g. `bakterie → powoduje → zapalenie płuc`) inherent to leaflet text, not factual errors. **Recommended use:** filter by `support` to trade recall for precision (`support>=3` is a good default; `support>=5` for the highest-precision core). ## Fields - `subject`, `predicate`, `object` — the directed relation (Polish). - `support` — corroboration count (confidence signal). - `rel_class` — `clinical` | `structural` | `taxonomic`. ## Relation schema (24 types) | predicate | edges | |---|---| | `ma działanie niepożądane` | 7920 | | `jest rodzajem` | 4413 | | `powoduje` | 3332 | | `objawia się` | 3053 | | `jest stosowany w leczeniu` | 2822 | | `jest czynnikiem ryzyka` | 1795 | | `wchodzi w interakcję z` | 1748 | | `jest przeciwwskazany przy` | 1726 | | `zawiera` | 1591 | | `zmniejsza` | 1063 | | `zwiększa stężenie` | 1004 | | `zwiększa` | 830 | | `występuje u` | 700 | | `ma powikłanie` | 673 | | `zmniejsza stężenie` | 638 | | `służy do rozpoznania` | 557 | | `jest częścią` | 542 | | `zapobiega` | 530 | | `działa na receptor` | 449 | | `zmniejsza ryzyko` | 388 | | `hamuje` | 323 | | `jest metabolizowany do` | 238 | | `jest metabolizowany przez` | 109 | | `jest preparatem zawierającym` | 100 | ## Related - QA dataset built on this graph: [`lion-ai/MedKG-QA`](https://huggingface.co/datasets/lion-ai/MedKG-QA) ## Limitations LLM-extracted from consumer/professional leaflets + Wikipedia; entities are **not** linked to a controlled vocabulary (UMLS/ATC/ICD), so near-duplicate concepts and general phrasings occur. Not a substitute for professional medical judgement.

MedKG is a directed medical knowledge graph in Polish, extracted from Polish Wikipedia and drug leaflets (ChPL), then LLM-validated edge-by-edge. It contains 36,544 directed edges, 25,942 nodes, and 24 typed relation types, built for medical question answering and retrieval.

提供机构:
lion-ai
搜集汇总
数据集介绍
lion-ai/MedKG-graph 数据集图片
构建方式
MedKG-graph是一个面向波兰语医学领域的知识图谱,其构建过程严格遵循自动化提取与多阶段验证的范式。研究团队首先从波兰语维基百科及药品说明书(ChPL)中抽取医学文本,利用Gemma-4-26b模型在模式引导下提取三元组,并保留原始修饰信息。随后通过BGE-M3嵌入与Morfeusz词形还原进行实体规范化与去重,记录每条边被独立提取的次数作为支持度(support)。最终,由DeepSeek-V4模型依据类型化模式对支持度≥2的边进行验证与修复,根据领域/范围规则与方向约束,决定保留、修正方向、重定谓词类型或剔除,仅发布通过验证的边。
特点
该知识图谱包含36,544条有向边、25,942个节点及24种关系类型,覆盖临床、结构、分类三大类别。其显著特点是内置了基于支持度的置信度信号,用户可通过筛选支持度阈值灵活调节召回率与精确度——在独立评估中,全图准确率达78%,而支持度≥5的切片准确率提升至88%。此外,图谱的每一条边均经过独立模型以医生角色进行正确性判定,并设置了随机打乱对象的负对照组验证评估准则的可靠性。整体质量分数达7.3/10,错误率仅约4%,主要局限源于药品说明书中的真实但泛化陈述。
使用方法
该数据集主要面向医学领域的问题回答与文本检索任务。推荐使用时依据支持度字段进行筛选,设定support≥3作为兼顾覆盖与精确度的默认门槛,而support≥5则用于追求最高精度的核心子集。数据以subject、predicate、object三元组形式组织,辅以rel_class类别标识,便于直接加载为图结构或嵌入检索系统。此外,研究团队基于该图谱构建了配套的问答数据集MedKG-QA(参见lion-ai/MedKG-QA),为下游任务提供更直接的训练与评估资源。
背景与挑战
背景概述
MedKG-graph是波兰首个面向医学知识图谱的专用数据集,由波兰研究团队基于LLM技术构建,并于2024年发布。该数据集旨在解决波兰语医学信息检索与问答系统中结构化知识匮乏的问题,通过从波兰语维基百科和药品说明书(ChPL)中提取三元组,并经大语言模型逐边验证,形成了包含36,544条有向边和24类关系的知识图谱。其构建过程融合了模式引导提取、形态规范化去重及多模型校验等创新方法,将边缘准确率提升至78%以上。这一工作填补了中低资源语言领域医学知识图谱的空白,为波兰语医学自然语言处理奠定了基础。
当前挑战
MedKG-graph面临的核心挑战涵盖领域问题与构建过程两个维度。在领域层面,其首要目标是克服波兰语医学知识结构化难题,现有资源缺乏统一术语标准,导致实体无法映射至UMLS、ATC或ICD等受控词表,概念近义重复与泛化表述频繁出现,影响下游任务的互操作性。在构建层面,从非结构化文本中提取高精度三元组面临诸多困难:LLM提取误差(约4%的明显错误边)、关系类型在领域范围约束下的歧义性,以及药品说明书中固有“真实但泛化”陈述(如“细菌导致肺炎”)的过滤挑战。此外,用于验证的独立模型评分仅为7/10,表明当前方法与专业医学判断之间仍存差距,需进一步优化校验机制与语义消歧策略。
常用场景
经典使用场景
MedKG-graph作为波兰语医学知识图谱,为医疗领域的知识驱动型自然语言处理任务提供了基础支撑。其最经典的使用场景当属医学问答系统,研究者可借助图谱中蕴含的丰富实体关系,将用户关于药物副作用、疾病症状或治疗方案的提问精准映射至三元组结构,从而生成基于事实的可靠答复。此外,该数据集在医学信息检索领域同样占据重要地位——由于图谱以结构化形式收录了海量药理关联和临床知识,检索模型能够利用关系路径实现语义增强,提升诸如“某种药物的适应症”或“某疾病的危险因素”等复杂查询的响应质量。边缘级别的支持度(support)分数更便于用户灵活调整精度与召回率的平衡,以适应从快速原型到高精度决策系统的多元需求。
解决学术问题
该数据集精准对焦了低资源语言医学知识建模与图谱自动构建中普遍存在的可验证性难题。传统医学知识图谱多面向英语等资源丰富语言,而MedKG-graph通过精心设计的双重验证流程——先由Gemma模型抽取候选三元组,再以DeepSeek模型逐边校验——有效减少了自动抽取引入的噪声与语义偏差。这一方案在学术上回应了两个核心痛点:其一是非英语医学文本中实体关系标注匮乏导致图谱质量难以保证;其二是知识图谱的质量评估往往依赖主观判断,缺乏可复现的量化指标。通过引入支持度计数与独立医师角色评测,该数据集为自动构建图谱的可信度评估树立了一个可参照的量化范式,推动了多语言医学知识工程的方法论进步。
衍生相关工作
围绕MedKG-graph衍生出的最具代表性的工作之一是与之配套的问答数据集MedKG-QA,该数据集充分利用了图谱的语义结构,将三元组信息转化为自然语言问句与答案对,从而为评估和训练模型在图谱上的推理能力提供了标准化基准。在此基础上,后续研究可进一步拓展至增强型检索生成(Retrieval-Augmented Generation)管线:利用图谱稠密的实体连接和多元关系类型,在检索阶段为语言模型提供精确的上下文信号,进而生成医学解释或治疗建议。此外,由于图谱中的关系类型覆盖了临床、结构与分类三大领域,相关学者还探索了基于子图嵌入的图表征学习方法,旨在学习具有医学领域感知能力的实体向量表示,为下游任务如药物重定位、疾病相似性分析及不良事件预测等提供更加丰富的特征通路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务