遇见数据集

vaibhavalakshmiravideshik/mondo-doid-12k

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

MONDO-DOID Entity Alignment 12K 是一个用于异构知识图谱的生物医学实体对齐基准数据集。它通过手动策划的精确匹配映射,对齐了Mondo疾病本体(MONDO)和人类疾病本体(DOID)中的疾病实体,这些映射以SSSOM格式由MONDO分发。该基准旨在支持现实的实体对齐研究,而非简化的字典匹配。金标准对齐嵌入在完整的MONDO和DOID本体图中,因此模型必须在存在显著模式不匹配、同义词变异、背景实体和本体特定粒度差异的情况下恢复对齐的疾病概念。数据集包含11,812个经过验证的金标准对齐对,以及来自两个本体的关系三元组和属性三元组,总数据量约为62.23 MB。KG1(MONDO)包含27,586个实体、300,671个属性三元组和44,674个关系三元组,涉及13种关系类型;KG2(DOID)包含12,127个实体、80,515个属性三元组和17,093个关系三元组,仅涉及一种关系类型。数据集具有异构性特征,如模式不匹配、密度不对称和粒度不匹配,适用于实体对齐、本体匹配和多模态对齐模型的研究与基准测试。

MONDO-DOID Entity Alignment 12K is a benchmark dataset for biomedical entity alignment across heterogeneous knowledge graphs. It aligns disease entities from the Mondo Disease Ontology (MONDO) and the Human Disease Ontology (DOID) via manually curated exact matching mappings, which are distributed by MONDO in SSSOM format. This benchmark is designed to support realistic entity alignment research rather than simplified dictionary matching. Gold-standard alignments are embedded within the full MONDO and DOID ontology graphs, so models must recover aligned disease concepts amid significant schema mismatches, synonym variations, background entities, and ontology-specific granularity discrepancies. The dataset contains 11,812 validated gold-standard alignment pairs, along with relational and attribute triples from both ontologies, with a total data volume of approximately 62.23 MB. KG1 (MONDO) consists of 27,586 entities, 300,671 attribute triples, and 44,674 relational triples, covering 13 relationship types; KG2 (DOID) includes 12,127 entities, 80,515 attribute triples, and 17,093 relational triples, with only one relationship type. The dataset exhibits heterogeneity characteristics including schema mismatches, asymmetric density, and granularity mismatches, making it suitable for research and benchmarking of entity alignment, ontology matching, and multi-modal alignment models.

搜集汇总
数据集介绍
vaibhavalakshmiravideshik/mondo-doid-12k 数据集图片
构建方式
该数据集的构建植根于生物医学本体对齐的迫切需求。其黄金标准对齐直接源自MONDO本体项目以SSSOM格式分发的策展映射文件,具体利用了‘mondo_exactmatch_doid.sssom.tsv’与‘mondo_hasdbxref_doid.sssom.tsv’两个文件。为确保映射的精确性与可靠性,构建过程经历了严格的验证与过滤:原始精确匹配对共计11,968对,在剔除因实体在各自本体中已过时而失效的167对后,最终保留11,812对经过人工策展验证的一对一疾病概念对齐,并采用skos:exactMatch作为对齐谓词,semapv:ManualMappingCuration作为映射依据。
使用方法
本数据集专为生物医学知识图谱的实体对齐、本体匹配及对模式鲁棒的实体对齐系统研发而设计。数据以UTF-8编码的纯文本制表符分隔文件提供,主要包含三类核心文件:ent_links文件存储了验证后的对齐实体URI对;rel_triples_1与rel_triples_2文件分别记录了MONDO与DOID图谱中的关系三元组;attr_triples_1与attr_triples_2文件则包含了实体属性三元组。研究人员可通过加载这些文件构建完整的图结构,并基于提供的黄金对齐对进行模型训练与评估。鉴于基准的异构特性,它特别适合用于消融实验,以探究关系类型差异、同义词偏移及图结构不对称性对对齐性能的影响。
背景与挑战
背景概述
生物医学知识图谱的异构性对实体对齐任务构成了严峻挑战,尤其是在疾病本体领域,不同来源的术语体系、关系类型和语义粒度差异显著。在此背景下,由Vaibhavalakshmi Ravideshik于2026年创建的MONDO-DOID实体对齐基准数据集,旨在为异构知识图谱中的疾病概念匹配提供真实且严格的评估框架。该数据集基于Monarch Initiative维护的Mondo疾病本体与杰克逊实验室开发的人类疾病本体,通过手动筛选的11,812对精确映射关系构建,涵盖MONDO的28,608个活跃概念与DOID的12,127个实体。作为首个专注疾病本体对齐的开源基准,其发布填补了生物医学领域针对模式异构、语义差异和背景实体干扰的实体对齐评测空白,对推动本体融合、跨源疾病知识整合及精准医学研究具有重要影响。
当前挑战
该数据集的核心领域挑战在于解决疾病本体异构图谱的实体对齐难题:MONDO包含13种关系类型,而DOID仅有单一继承关系,且两者在属性密度、同义词来源及概念粒度上高度不对称,导致传统基于字符串或结构匹配的方法失效。构建过程中面临的挑战包括:1)从11,968条原始映射中剔除167个因术语废弃而失效的对齐对,确保基准的准确性;2)保留完整本体图谱而非仅对齐实体,引入大量无关背景节点(如MONDO中约60%非对齐实体),增加检索复杂度;3)处理跨本体的模式失配,如MONDO丰富的疾病特征关系(如致病基因、解剖位置)与DOID的层次分类之间的语义鸿沟。这些特点迫使对齐模型必须同时应对结构异构、噪声干扰与细粒度语义差异,为评估鲁棒的实体对齐方法提供了严苛但现实的测试环境。
常用场景
经典使用场景
在生物医学知识图谱的异质性对齐研究中,MONDO-DOID Entity Alignment 12K 数据集被广泛视为一个极具挑战性的基准。其经典使用场景聚焦于评估和训练实体对齐模型在跨本体图谱上的表现,尤其是在MONDO与DOID这两种结构迥异、语义粒度不一的疾病本体之间。研究者利用该数据集的完整图谱结构——包括丰富的属性三元组、多样化的关系类型以及精心构建的黄金对齐标签——来模拟真实世界中知识图谱合并的复杂性,从而检验对齐算法对模式不匹配、同义词变体、背景噪音实体以及本体特有细粒度差异的鲁棒性。
解决学术问题
该数据集系统性地解决了生物医学本体对齐领域中几个长期存在的学术难题。首先,它突破了传统简化字典匹配的局限,通过嵌入完整本体图谱而非仅对齐实体,迫使模型在大量非对齐背景实体中精准检索目标,从而更真实地评估算法性能。其次,其刻意设计的异质性——如MONDO拥有13种关系类型而DOID仅含rdfs:subClassOf——为研究模式调和对齐策略提供了理想平台。此外,该数据集还揭示了同义词来源不一致导致的表面匹配失效问题,推动了基于结构和语义融合的多模态对齐方法的发展,其意义在于为跨本体知识整合奠定了更可靠的评价基础。
实际应用
在实际应用中,MONDO-DOID Entity Alignment 12K 数据集为生物医学信息系统的互联互通提供了关键支撑。通过其对齐结果,研究人员能够将MONDO中来自OMIM、Orphanet等资源整合的精细疾病概念与DOID中的人类疾病分类体系进行无缝映射,从而在电子健康记录、临床决策支持系统和药物重定位研究中实现跨本体的知识检索与推理。例如,在罕见病诊断辅助系统中,借助该数据集训练的对齐模型可自动关联不同数据库中的同义疾病条目,提升信息融合的准确性,进而加速从基础研究到临床应用的转化进程。
数据集最近研究
最新研究方向
当前,随着生物医学知识图谱的迅猛发展,跨本体实体对齐研究正成为连接异构疾病数据库的关键技术。mondo-doid-12k数据集应运而生,它聚焦于Mondo疾病本体与人类疾病本体之间的人工精校实体对齐,为应对真实世界中本体模式不匹配、同义变异、粒度差异及背景实体干扰等挑战提供了高难度基准。该数据集直接源于MONDO发布的精确匹配映射,经过严格验证后保留了11,812对高质量对齐,并完整保留了原始本体的属性和关系结构,打破了传统简化字典匹配的局限。这一前沿资源不仅推动了实体对齐模型在生物医学领域的鲁棒性评估,还与精准医学、罕见病整合研究及跨数据库知识融合的热点需求紧密相连,为构建更加可靠和可解释的医学知识系统奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务