遇见数据集

MeSH-Rel-4K

收藏
arXiv2026-07-20 更新2026-07-22 收录
官方服务:

资源简介:

MeSH-Rel-4K是由开放大学知识媒体研究所构建的医学主题词表语义关系数据集,旨在为生物医学领域本体生成任务提供基准评估资源。该数据集包含4000个精心采样的语义关系对,涵盖'上下位'、'同义'及'无关'三类核心关系,数据源来自美国国立医学图书馆维护的权威医学主题词表2025年1月版本。通过分层随机抽样和严格的数据隔离机制构建,确保训练集、验证集与测试集之间无概念泄露,为大规模语言模型的微调与评估提供了结构化基础。该数据集主要应用于生物医学本体自动化构建、语义关系分类模型训练以及资源受限环境下大型语言模型的性能优化研究,为解决医学知识体系手动维护成本高昂的难题提供数据支撑。

MeSH-Rel-4K is a semantic relation dataset for Medical Subject Headings (MeSH) developed by the Knowledge Media Institute of The Open University, designed to serve as a benchmark evaluation resource for biomedical ontology generation tasks. This dataset contains 4,000 meticulously sampled semantic relation pairs, covering three core relation types: "hierarchical (hyponym/hypernym)", "synonymous", and "irrelevant". Its data originates from the authoritative MeSH version maintained by the U.S. National Library of Medicine as of January 2025. Constructed via stratified random sampling and strict data isolation protocols, it ensures no concept leakage between the training, validation, and test sets, providing a structured foundation for the fine-tuning and evaluation of large language models (LLMs). This dataset is primarily applied to automated biomedical ontology construction, training of semantic relation classification models, and performance optimization research for LLMs in resource-constrained environments, offering data support to address the high costs of manual maintenance of medical knowledge systems.

创建时间:
2026-07-20
原始信息汇总

数据集概述

数据集名称:MeSH-Rel-4K

核心用途:用于微调并评估大语言模型(LLMs)识别生物医学研究主题对之间语义关系的能力,旨在推动生物医学领域研究主题本体的自动化构建与演化。

数据来源:源自美国国家医学图书馆的医学主题词表(Medical Subject Headings,MeSH),具体为2025年1月版本。

关系类型与规模:共包含4,000条语义关系记录。关系分为以下四个互斥类别,每类各包含1,000条:

  • broader:主题A是主题B的父级主题(例如,“植物”比“农作物”更广泛)。
  • narrower:主题A是主题B的子级主题(例如,“肺孢子菌感染”属于“真菌病”)。
  • same-as:主题A和主题B可互换使用以表示相同的研究概念(例如,“味觉功能障碍”与“味觉障碍”)。
  • other:主题A和主题B不相关,或不适用于上述任何类别,用于标记负样本。

数据集划分:数据采用7:1:2的比例划分为训练集、验证集和测试集。

数据集 训练集 验证集 测试集 总计
MeSH-Rel-4K 2,800 400 800 4,000

相关模型与实验:研究使用了五种小规模开源大语言模型(参数不超过90亿),在标准提示、思维链提示和微调三种条件下进行评估。实验表明,有针对性微调后平均F1分数提高了34.1个百分点。

数据集构建细节

  • broader 关系来源于 mesh:broaderDescriptor
  • narrower 关系来源于 mesh:broaderDescriptor
  • same-as 关系来源于 mesh:relatedConcept
  • other 类别由1,000个无关主题对构成。

许可协议:知识共享署名4.0国际许可协议(Creative Commons Attribution 4.0 International,CC BY 4.0)。

搜集汇总
数据集介绍
MeSH-Rel-4K 数据集图片
构建方式
生物医学领域知识组织系统的构建长期依赖领域专家的手动维护,成为制约知识管理效率的关键瓶颈。为系统评估小型开源大语言模型在语义关系分类任务中的表现,本研究从医学主题词表(MeSH)2025年1月版中抽取4000条语义关系,构建MeSH-Rel-4K数据集。该数据集通过利用MeSH中的mesh:broaderDescriptor属性随机采样1000条上位词与下位词关系对,基于mesh:relatedConcept属性抽取1000条同义关系对,并人工构造1000条无语义关联的主题对以填充“其他”类别。最终,数据集以7:1:2的比例划分为训练集(2800条)、验证集(400条)与测试集(800条),且在划分过程中严格隔离研究概念以防止节点泄漏。
特点
MeSH-Rel-4K数据集具有显著的结构化与代表性特征。其语义关系涵盖上位(broader)、下位(narrower)、同义(same-as)及无关联(other)四种类型,完整覆盖了本体构建所需的核心关系谱系。数据规模经精心设计,既保证了模型训练所需的样本量,又避免了冗余信息带来的噪声干扰。尤为重要的是,该数据集在划分时确保同一研究概念不会同时出现在训练与测试集合中,从而有效规避了概念泄漏对模型泛化能力评估的污染。此外,所有关系均源自经过多年专家审核的权威MeSH词表,确保了语义标注的准确性与领域权威性。
使用方法
MeSH-Rel-4K被设计为评估大语言模型语义关系分类能力的基准测试平台。研究者可采用标准提示、链式思考提示以及参数高效微调三种策略进行模型适配。使用时可参照论文提供的结构化提示模板,将待分类的主题对填入占位符后输入模型,并自动解析输出结果。该数据集还支持零样本与少样本学习场景下的对比实验,通过统一的评估指标(精确率、召回率与F1分数)实现模型性能的横向比较。完整的代码库与数据集已在GitHub上开源,研究人员可基于此复现实验并拓展至其他学科领域的本体生成任务。
背景与挑战
背景概述
在生物医学领域,知识组织系统如本体和分类体系是结构化科学知识不可或缺的基石,然而其人工构建与维护过程长期构成知识管理的瓶颈。为应对这一挑战,Tanay Aggarwal及英国开放大学知识媒体研究所等机构的研究人员于2026年提出了MeSH-Rel-4K数据集。该数据集源自美国国家医学图书馆维护的医学主题词表,精炼提取了4000对语义关系,涵盖更广、更窄、同义及无关联四种类别,旨在系统评估轻量级开源大语言模型在生物医学研究主题本体自动生成中的语义关系分类能力。MeSH-Rel-4K的发布为自动化本体构建领域提供了关键的基准资源,推动了参数高效模型在专业化、高精度生物医学知识图谱建模中的研究与应用。
当前挑战
该数据集所应对的核心挑战在于:现有本体构建严重依赖领域专家的长期手工协作,导致更新滞后且覆盖不均,难以追踪快速演进的研究前沿。尽管大语言模型提供了自动化前景,但小型开源模型在理解复杂领域语义时面临显著推理瓶颈,传统提示策略效果有限。构建过程中,从MeSH中准确筛选和平衡不同类别关系对,确保概念严格隔离以避免节点泄漏,并构造高质量的训练、验证与测试子集,亦是构建工作中的主要技术难题。此外,模型在同义与层级关系间的高频混淆,尤其是语义高度重叠概念(如药物异构体)的判别,仍为精准分类的核心障碍。
常用场景
经典使用场景
在生物医学本体工程领域,MeSH-Rel-4K数据集被广泛用于评估和微调大型语言模型在语义关系分类任务上的表现。该数据集包含4,000对从医学主题词表中提取的语义关系,涵盖更广、更窄、同义及无关四种类别。研究者常利用该数据集测试不同规模的开源LLM(参数规模不超过90亿)在标准提示、思维链提示及参数高效微调三种策略下的分类能力,尤其关注模型在区分精细语义边界时的鲁棒性,为低资源场景下的本体自动化构建提供了标准化的评估基准。
解决学术问题
该数据集核心解决了手动构建与维护生物医学本体时存在的语义关系标注瓶颈问题。传统依赖领域专家协作的本体更新方式耗时费力,且难以追踪快速演化的研究前沿。MeSH-Rel-4K使研究者能够系统量化小参数LLM在限定资源条件下推断领域概念间等级与等价关系的能力。实验表明,针对性微调可显著提升模型F1分数(平均提升34.1个百分点),从而验证了高效微调策略能够突破小模型在上下文推理中的逻辑局限,为自动化本体生成与演化提供了可靠且具成本效益的学术路径。
衍生相关工作
MeSH-Rel-4K的提出催生了一系列围绕资源高效型本体生成的后续研究。相关工作包括在工程学领域开展的语义关系分类实验(Aggarwal等人,2026),以及利用链式思维双向提示策略提升小模型推理一致性的方法论探索。此外,该数据集被用作基准来对比不同参数高效微调算法(如LoRA)在生物医学概念上的迁移效果,并启发了面向多学科本体匹配与演化的流水线框架设计,该框架融合LLM分类器与学术元数据抽取,旨在构建自演进的综合研究领域本体。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务