遇见数据集

krr-oxford/OntoLAMA

收藏
Hugging Face2024-11-20 更新2024-03-04 收录
官方服务:

资源简介:

OntoLAMA是一组用于本体子集推理的语言模型探测数据集。该工作遵循“LMs-as-KBs”文献,但专注于从形式化的知识库(如OWL本体)中提取的概念化知识。具体来说,子集推理(SI)任务以自然语言推理(NLI)风格引入和表述,其中子概念和超概念被语言化并拟合到模板中,分别形成前提和假设。采样的公理通过本体推理进行验证。SI任务进一步分为原子SI和复杂SI,前者仅涉及原子命名概念,后者涉及原子和复杂概念。OntoLAMA使用了不同规模和领域的真实世界本体进行构建,总共有四个原子SI数据集和两个复杂SI数据集。

OntoLAMA是一组用于本体子集推理的语言模型探测数据集。该工作遵循“LMs-as-KBs”文献,但专注于从形式化的知识库(如OWL本体)中提取的概念化知识。具体来说,子集推理(SI)任务以自然语言推理(NLI)风格引入和表述,其中子概念和超概念被语言化并拟合到模板中,分别形成前提和假设。采样的公理通过本体推理进行验证。SI任务进一步分为原子SI和复杂SI,前者仅涉及原子命名概念,后者涉及原子和复杂概念。OntoLAMA使用了不同规模和领域的真实世界本体进行构建,总共有四个原子SI数据集和两个复杂SI数据集。

提供机构:
krr-oxford
原始信息汇总

数据集概述

名称: OntoLAMA

任务类别: 文本分类

标签:

  • 本体论
  • 包含推理
  • 自然语言推理
  • 概念知识
  • 语言模型作为知识库

数据集大小: 1M<n<10M

语言: 英语

数据集结构

数据实例

数据字段

  • SI 数据字段:

    • v_sub_concept: 口头表达的子概念。
    • v_super_concept: 口头表达的超概念。
    • label: 二元类别标签,指示两个概念是否真的形成包含关系(1 表示是)。
    • axiom: 原始包含公理的字符串表示,有助于追溯到本体。
    • anchor_axiom: (仅限复杂SI)用于采样axiom的锚定等价公理的字符串表示。
  • biMNLI 数据字段:

    • premise: 继承自MNLI数据集。
    • hypothesis: 继承自MNLI数据集。
    • label: 二元类别标签,指示矛盾0)或蕴含1)。

数据分割

来源 #概念名称 #等价公理 #数据集 (训练/验证/测试)
Schema.org 894 - Atomic SI: 808/404/2,830
DOID 11,157 - Atomic SI: 90,500/11,312/11,314
FoodOn 30,995 2,383 Atomic SI: 768,486/96,060/96,062 <br /> Complex SI: 3,754/1,850/13,080
GO 43,303 11,456 Atomic SI: 772,870/96,608/96,610 <br /> Complex SI: 72,318/9,040/9,040
MNLI - - biMNLI: 235,622/26,180/12,906

许可证信息

Apache-2.0

搜集汇总
数据集介绍
krr-oxford/OntoLAMA 数据集图片
构建方式
OntoLAMA数据集旨在探索语言模型在形式化知识库中概念化知识的推理能力,聚焦于本体包含推理任务。该数据集将包含推理任务转化为自然语言推理形式,通过将本体公理中的子概念与超概念进行语言化表达,并嵌入预设模板以生成前提与假设。采样得到的公理均经过本体推理验证以确保其正确性。数据集进一步划分为原子包含推理与复杂包含推理,前者仅涉及原子命名概念,后者则涵盖原子与复杂概念。构建过程中,选用了来自不同领域与规模的真实本体,包括基因本体、食品本体、人类疾病本体及Schema.org,最终形成了四个原子包含推理数据集与两个复杂包含推理数据集。
特点
OntoLAMA数据集的核心特点在于其对本体包含推理任务的系统化设计与多维度覆盖。原子包含推理数据集侧重于简单概念间的层次关系,而复杂包含推理数据集则引入了包含复杂逻辑表达式的公理,并提供了锚定等价公理以追溯采样来源。数据集规模庞大,总计超过百万条样本,其中基因本体与食品本体的原子数据集分别包含超过77万与76万条训练样本。此外,数据集还包含一个源自MNLI的二分类自然语言推理子集biMNLI,用于辅助评估。所有样本均以结构化的JSON格式存储,包含语言化概念、标签、原始公理等字段,便于研究与分析。
使用方法
OntoLAMA数据集可通过HuggingFace Datasets库便捷加载,支持按配置名称分别获取不同子集,包括bimnli、doid-atomic-SI、foodon-atomic-SI、foodon-complex-SI、go-atomic-SI、go-complex-SI及schemaorg-atomic-SI。每个配置均预划分了训练、验证与测试集,用户可直接用于模型训练与评估。数据集适用于文本分类任务,标签为二分类,其中原子与复杂包含推理子集使用positive_subsumption与negative_subsumption,而biMNLI子集使用entailment与contradiction。研究者可基于语言化概念字段构建自然语言推理输入,或利用原始公理字段进行本体层面的分析。
背景与挑战
背景概述
OntoLAMA数据集由牛津大学知识表示与推理研究组(KRR)于2023年创建,核心研究人员包括Yuan He、Jiaoyan Chen等,其成果发表于ACL 2023 Findings。该数据集聚焦于将形式化本体知识(如OWL本体)中的概念包含推理任务转化为自然语言推理形式,旨在评估预训练语言模型对结构化概念知识的掌握程度。通过从Schema.org、人类疾病本体、食品本体和基因本体等不同规模与领域的真实本体中采样公理,并利用本体推理验证标签,OntoLAMA为语言模型的知识探测研究提供了首个面向本体概念包含的基准。该数据集不仅推动了语言模型作为知识库这一研究方向的发展,还为生物医学、食品科学等领域的本体工程与自然语言处理交叉研究提供了关键评估工具。
当前挑战
OntoLAMA所解决的领域问题在于验证语言模型能否准确推理本体中的概念包含关系,这比传统常识知识探测更具挑战性。在构建过程中,数据集面临三大挑战:其一,从大型本体(如基因本体含43,303个命名概念)中高效采样并平衡正负样本,需借助本体推理器验证公理逻辑一致性;其二,将OWL公理中的形式化概念表达式(如复杂类构造)转化为自然语言模板时,需确保语义保真度,避免歧义;其三,复杂SI子集的构建需通过等价公理锚定采样,这对本体中公理密度和推理复杂度提出了更高要求。此外,跨领域本体的术语差异与规模不均衡也增加了数据集泛化性的验证难度。
常用场景
经典使用场景
OntoLAMA数据集的核心应用场景在于评估和探测预训练语言模型在本体论子类推理任务上的能力。该数据集将形式化本体知识库中的子类包含公理转化为自然语言推理风格的形式,通过将子概念与超概念分别填入模板形成前提与假设,从而构建出结构化的二分类任务。研究者可借助OntoLAMA检验语言模型是否真正习得了来自真实世界本体(如基因本体、食品本体、疾病本体等)中的概念层级关系,进而探究模型对结构化、符号化的概念化知识的理解深度。
解决学术问题
OntoLAMA致力于解决语言模型作为知识库这一研究方向中长期存在的关键问题:如何系统性地评估模型对形式化本体知识的掌握程度。传统知识探测任务多聚焦于事实性知识,而忽略了概念之间的语义层级关系。OntoLAMA将子类推理这一经典的本体推理任务引入语言模型分析领域,填补了概念化知识评估的空白。该数据集通过严谨的本体推理验证采样公理,确保了标签的语义正确性,为衡量模型对逻辑性、层级性知识的理解提供了可靠基准。
衍生相关工作
OntoLAMA的提出催生了一系列后续研究工作,推动了语言模型与本体知识融合的深入探索。基于该数据集,研究者发展了多种探测和分析方法,例如通过对比不同规模语言模型在原子与复杂子类推理上的表现差异,揭示模型对逻辑组合语义的建模能力局限。该数据集还启发了将本体推理与自然语言推理相结合的新范式,衍生出基于提示学习的子类关系预测方法,以及利用本体公理增强语言模型微调策略的相关工作。此外,OntoLAMA的构建方法论被迁移至其他知识图谱领域,促进了多领域概念化知识评估基准的涌现。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务