遇见数据集

LLMOwlR

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

LLM4Proof提示学习数据集是一个用于生成和评估OWL(Web Ontology Language)本体证明的提示学习样本集合。数据集来源于LLMOwlR/LLM4Proof代码仓库中的`prompt_learning_dataset.zip`文件。每个样本包含一个推理查询、一个打乱顺序的候选公理列表,以及正确公理在列表中的索引;查询以自然语言和OWL形式化语言两种变体独立存储。数据集由三个本体子集(foodon、go-plus和snomedCT)组成,总计1969个样本,仅作为test分割提供,用户可通过`ontology`字段筛选子集。关键指标`atomic_distance`(原子距离)用于选择目标结论,基于论文中的启发式估计,衡量推理长度,定义为原子概念间最短直接包含链的长度,值越大表示推理越复杂。数据以JSONL格式存储,主要字段包括:`ontology`(本体子集标识)、`atomic_distance`(证明距离区间,foodon和go-plus使用4,6,8,10,12,14,16,snomedCT使用1和11)、`query_id`(原始查询ID)、`format`(格式类型,自然语言或owl)、`query`(提示查询文本)、`axioms`(打乱的候选公理列表)、`correct_axiom_indices`(正确公理索引)、`correct_axioms`(解析出的正确公理文本)和`source_path`(原始路径)。元数据存储在`metadata/dataset_summary.json`文件中。该数据集适用于文本生成、问答等任务,特别针对本体推理、描述逻辑和证明生成的研究与应用。

The LLM4Proof prompt learning dataset is a collection of prompt learning samples for generating and evaluating OWL (Web Ontology Language) ontology proofs. It originates from the `prompt_learning_dataset.zip` file in the LLMOwlR/LLM4Proof code repository. Each sample includes a reasoning query, a shuffled list of candidate axioms, and the indices of correct axioms within that list; queries are stored as independent rows in two variants: natural language and OWL formal language. The dataset consists of three ontology subsets (foodon, go-plus, and snomedCT), totaling 1969 samples, provided only as a test split, and users can filter subsets via the `ontology` field. A key metric, `atomic_distance` (atomic distance), is used to select target conclusions, based on a heuristic estimation from the paper to measure reasoning length, defined as the length of the shortest direct inclusion chain between atomic concepts, with larger values indicating more complex reasoning. Data is stored in JSONL format, with main fields including: `ontology` (subset identifier), `atomic_distance` (proof distance intervals, using 4,6,8,10,12,14,16 for foodon and go-plus, and 1 and 11 for snomedCT), `query_id` (original query ID), `format` (format type, natural_language or owl), `query` (prompt query text), `axioms` (shuffled candidate axiom list), `correct_axiom_indices` (indices of correct axioms), `correct_axioms` (parsed correct axiom text), and `source_path` (original path). Metadata is stored in the `metadata/dataset_summary.json` file. This dataset is suitable for tasks such as text generation and question answering, particularly for research and applications related to ontology reasoning, description logic, and proof generation.

创建时间:
2026-07-03
原始信息汇总

数据集概述:LLM4Proof Prompt Learning Dataset

  • 数据集名称:LLM4Proof Prompt Learning Dataset
  • 作者/来源:源自 LLMOwlR/LLM4Proof 仓库中的 prompt_learning_dataset.zip 工件
  • 语言:英文
  • 许可证:其他(other
  • 任务类别:文本生成、问答
  • 标签:本体论、OWL、描述逻辑、推理、证明生成、LLM4Proof

数据集内容与结构

该数据集包含用于生成和评估 OWL 本体证明的提示学习样本。每行包含:

  • 推理查询query
  • 打乱顺序的候选公理列表axioms
  • 最小支持公理索引correct_axiom_indices)及其解析文本(correct_axioms
  • 自然语言和 OWL 格式的变体作为独立行存在

核心字段

字段 说明
ontology 本体子集名称(foodongo-plussnomedCT
atomic_distance 证明距离桶(foodon/go-plus:4,6,8,10,12,14,16;snomedCT:1,11)
query_id 源查询 ID
format 格式(natural_languageowl
query 提示查询内容
axioms 打乱顺序的候选支持公理
correct_axiom_indices 黄金支持公理在 axioms 中的索引
correct_axioms 黄金支持公理文本
source_path 原始压缩包内的路径

数据划分与文件结构

  • 配置default(单一配置)
  • 拆分:仅 test 拆分,共 1,969 行
  • 数据文件data/foodon.jsonldata/go-plus.jsonldata/snomedCT.jsonl
  • 元数据metadata/dataset_summary.json(独立于数据文件,避免被 Hugging Face 数据集查看器解析)

文件树

README.md data/ ├── foodon.jsonl ├── go-plus.jsonl └── snomedCT.jsonl metadata/ └── dataset_summary.json

原子距离(Atomic Distance)

atomic_distance 用于估计推理长度:对于推断的原子包含关系 A ⊑ B,表示连接 AB 的最短直接包含链长度。直接包含的距离为 1,较大值通常表示更长或更复杂的推理。

加载与过滤示例

python from datasets import load_dataset

dataset = load_dataset("Hui97/LLMOwlR", split="test") foodon = dataset.filter(lambda row: row["ontology"] == "foodon")

引用信息

bibtex @inproceedings{yang2026large, title = {Large Language Model for OWL Proofs}, author = {Yang, Hui and Chen, Jiaoyan and Sattler, Uli}, booktitle = {Proceedings of the ACM Web Conference 2026}, pages = {3952--3963}, year = {2026}, publisher = {ACM}, doi = {10.1145/3774904.3792395}, url = {https://doi.org/10.1145/3774904.3792395} }

搜集汇总
数据集介绍
LLMOwlR 数据集图片
构建方式
LLMOwlR数据集来源于LLMOwlR/LLM4Proof仓库中的prompt_learning_dataset.zip压缩包,旨在为大语言模型生成和评估OWL本体推理证明提供提示学习样本。构建过程中,从三个生物医学本体(FoodOn、GO-Plus、SNOMED CT)中提取推理查询,将每个查询对应的候选公理集进行随机打乱,并记录其中构成最小支持集的公理索引。同时,数据以自然语言和OWL形式两种变体分别存储为独立行。此外,数据集引入原子距离(atomic_distance)指标,用于衡量推断原子包含关系的推理长度,其值基于两个概念间直接包含链的最短长度估算,从而指示推理的复杂度。
特点
该数据集整合了三个本体子集(foodon、go-plus、snomedCT),在默认配置下将所有样本合并为一个测试集,共1969条数据。每条样本包含推理查询、打乱后的候选公理列表、正确公理索引及文本,并附有本体来源、原子距离和格式(自然语言或OWL)等元信息。原子距离从1到16不等,其中SNOMED CT本体仅包含1和11两个值,而FoodOn和GO-Plus覆盖4至16的多个梯度,这有助于研究不同推理深度下的模型表现。数据集还单独提供metadata/dataset_summary.json文件存储聚合统计信息,避免干扰Hugging Face数据集查看器的解析。
使用方法
用户可通过Hugging Face的datasets库直接加载数据集,默认使用test分割,并利用“ontology”列进行子集过滤,例如filter(lambda row: row["ontology"] == "foodon")仅获取FoodOn样本。数据以JSONL格式存储,包含ontology、atomic_distance、query_id、format、query、axioms、correct_axiom_indices、correct_axioms和source_path共九个字段,便于进行推理生成、公理选择评估或提示学习实验。在使用时,建议依据原子距离和格式列进行分层采样,以平衡不同推理难度和表示形式的数据分布,从而全面评测模型性能。
背景与挑战
背景概述
LLMOwlR数据集诞生于大语言模型与符号推理交叉融合的前沿领域,由曼彻斯特大学Hui Yang、Jiaoyan Chen与Uli Sattler于2026年创建,旨在系统性地探索大语言模型在OWL本体公理证明生成中的能力。该数据集以FoodOn、GO-Plus和SNOMED CT三类真实生物医学本体为知识底座,通过prompt learning范式构造了包含自然语言与OWL形式化两种表述的推理样本。原子距离(atomic distance)指标的引入,为量化推理链长度与复杂度提供了客观标尺。该工作发表于ACM Web Conference 2026,为神经符号推理领域中利用预训练语言模型实现自动化本体推理开辟了新的研究方向,对知识图谱推理与可解释人工智能具有重要推动意义。
当前挑战
本数据集面临的核心挑战包括:1)所解决的领域问题方面,传统本体推理依赖完备的逻辑演算器,在稀疏或大规模本体的不完备场景下难以灵活扩展,而LLMOwlR试图利用大语言模型的语料先验与模式学习能力补足这一缺口,但模型在严格逻辑约束下的证明正确性保障仍是难点;2)构建过程中,从不同规模与粒度的本体中采样推理查询时,需平衡语义覆盖度与训练样本多样性,例如SNOMED CT本体仅提供了两种原子距离值,与其他本体的分布差异给跨本体迁移学习带来了挑战;此外,候选公理集的随机打乱与最小支撑集的标注需要精确的底层验证机制,以确保监督信号的无歧义性。
常用场景
经典使用场景
在知识表示与推理领域中,LLMOwlR数据集被广泛用于评估和微调大语言模型在OWL本体推理任务上的表现。该数据集包含来自FoodOn、GO-Plus和SNOMED CT三个真实世界医学与生物信息学本体的推理查询,每条样本都配备了候选公理集、最小支持公理的索引以及自然语言和OWL形式化两种表达变体。研究者通常利用该数据集训练模型从混乱的候选公理中准确筛选出支持结论的关键证据,进而生成完备的证明链。通过引入原子距离(atomic distance)这一启发式指标,数据集还能够支持对推理复杂度的分层评测,为探索大模型在结构化符号推理中的能力边界提供了标准化基准。
解决学术问题
LLMOwlR数据集系统性地回应了当前大语言模型在形式化推理领域面临的核心挑战——如何将符号逻辑推理与现代神经语言模型有效融合。在学术研究中,传统的OWL推理依赖于基于描述逻辑的专用推理器,其可扩展性受限于公理数量的增长,而基于大模型的方法则缺乏标准化的评测平台。该数据集通过构建包含自然语言与OWL语法双模态的推理样本,为研究者提供了量化评估大模型在公理选择、证明生成及推理质量方面能力的统一工具。它的发布解决了本体推理领域中缺少大规模、多领域、带标注的提示学习数据的困境,推动了连接主义与符号主义在知识推理层面的交叉研究。
衍生相关工作
LLMOwlR数据集的提出催生了一系列衍生研究,其中最经典的工作即其来源论文《Large Language Model for OWL Proofs》,该工作首次系统性地提出了LLM4Proof框架,探索了基于提示学习的大模型本体证明生成范式。在此基础上,后续研究者进一步开发了面向多本体迁移学习的元学习方法,利用LLMOwlR中不同领域本体的分布差异训练模型泛化能力;也有工作借鉴该数据集的原子距离指标,设计了分阶段推理策略以处理长距离证明链。此外,该数据集还启发了若干关于大模型与符号推理器协同工作(neuro-symbolic integration)的研究,推动了可解释人工智能在知识工程领域的实用化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务