遇见数据集

ontology-ontomathpro

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

该数据集是一个生物医学本体数据集,包含四个子配置:properties(属性)、relationships(关系)、synonyms(同义词)和terms(术语)。properties配置记录了本体中属性的详细信息,包括属性ID、名称、定义、命名空间、定义域(domain)、值域(range)、传递性、对称性、自反性、反自反性、函数性、逆函数性、逆属性、父属性ID、交叉引用以及所属本体,共8个样本。relationships配置描述了本体中实体之间的三元组关系(主语、谓语、宾语),共4584个样本。synonyms配置记录了术语的同义词及其作用域(scope)和所属本体,共3729个样本。terms配置包含了本体的术语信息,包括术语ID、名称、定义、命名空间、所属本体、是否过时以及父术语ID,共3449个样本。所有配置均包含ontology字段以标识本体来源。该数据集适用于本体构建、知识图谱推理、语义关系分析、术语标准化等任务。

This dataset is a biomedical ontology dataset, containing four sub-configurations: properties, relationships, synonyms, and terms. The properties configuration records detailed information about ontology attributes, including attribute ID, name, definition, namespace, domain, range, transitivity, symmetry, reflexivity, irreflexivity, functionality, inverse functionality, inverse attribute, parent attribute ID, cross-references, and source ontology, with 8 samples. The relationships configuration describes triple relationships (subject, predicate, object) between entities in the ontology, with 4584 samples. The synonyms configuration records term synonyms along with their scope and source ontology, with 3729 samples. The terms configuration contains term information including term ID, name, definition, namespace, source ontology, whether obsolete, and parent term ID, with 3449 samples. All configurations include an ontology field to identify the source ontology. The dataset is suitable for tasks such as ontology construction, knowledge graph reasoning, semantic relationship analysis, and term standardization.

创建时间:
2026-08-22
原始信息汇总

数据集概述:ontology-ontomathpro

该数据集来自 scidata-hub,旨在以结构化的形式呈现 OntoMathPro 数学本体论的内容,共包含四种配置,每种配置对应一个数据子集,覆盖本体论中的术语、属性、关系及同义词信息。

数据集结构

数据集包含以下四个配置(config):

配置名称 样本数量 数据大小(字节) 下载大小(字节) 功能描述
properties 8 1,569 7,654 本体论中的属性信息
relationships 4,584 255,361 33,849 本体论中实体间的关系
synonyms 3,729 353,264 94,297 本体论中术语的同义词
terms 3,449 668,117 169,044 本体论中的核心术语

所有配置均仅包含一个 train 拆分,总共约 11,770 条样本。

各配置字段说明

properties(属性)

该配置描述了本体论中定义的属性,包含以下字段:

  • property_id:属性的唯一标识符
  • name:属性名称
  • definition:属性的定义
  • namespace:属性所属的命名空间
  • domain:属性的定义域
  • range:属性的值域
  • is_transitive:是否为传递属性(布尔值)
  • is_symmetric:是否为对称属性(布尔值)
  • is_reflexive:是否为自反属性(布尔值)
  • is_antisymmetric:是否为反对称属性(布尔值)
  • is_functional:是否为函数属性(布尔值)
  • is_inverse_functional:是否为反函数属性(布尔值)
  • inverse_of:该属性的逆属性
  • parent_property_ids:父属性 ID 列表
  • xrefs:交叉引用信息
  • ontology:所属本体论标识

relationships(关系)

该配置描述了本体论中实体间的关系,包含以下字段:

  • subject_id:主体实体 ID
  • predicate:谓词(关系类型)
  • object_id:客体实体 ID
  • ontology:所属本体论标识

synonyms(同义词)

该配置提供了本体论中术语的同义词信息,包含以下字段:

  • term_id:术语 ID
  • synonym:同义词文本
  • scope:同义词使用范围
  • ontology:所属本体论标识

terms(术语)

该配置包含本体论中的核心术语定义,包含以下字段:

  • term_id:术语唯一标识符
  • name:术语名称
  • definition:术语定义
  • namespace:术语所属命名空间
  • ontology:所属本体论标识
  • is_obsolete:术语是否已废弃(布尔值)
  • parent_ids:父术语 ID 列表

数据文件

所有配置的数据文件均存放于各自的子目录中,文件名以 train-* 形式命名,分别位于 properties/relationships/synonyms/terms/ 目录下。

搜集汇总
数据集介绍
ontology-ontomathpro 数据集图片
构建方式
ontology-ontomathpro数据集源于OntoMathPro本体论,该本体论致力于数学知识的结构化表示。数据集被精心划分为四个配置子集:terms(术语)、properties(属性)、relationships(关系)和synonyms(同义词),每个子集均以表格形式呈现,包含丰富的字段如术语ID、定义、命名空间、父类ID等。构建过程遵循本体论工程原则,对数学概念进行系统化梳理,通过捕捉术语间的层级关系、属性特征及同义表述,形成了一套严谨的知识图谱。数据以train分割提供,各子集规模从8到3449个示例不等,确保了知识覆盖的深度与广度。
特点
该数据集的核心特色在于其多维度、结构化的数学知识表征。terms子集收录了3449个数学术语,涵盖定义、命名空间及废弃状态,为数学实体提供了详尽注解。relationships子集包含4584条关系记录,通过主语-谓语-宾语三元组形式,清晰描绘了数学概念间的逻辑关联。properties子集虽然仅有8个属性,却定义了关系的关键特征,如传递性、对称性等,为知识推理提供了基础。synonyms子集则汇集了3729条同义词,增强了术语检索的灵活性。整体设计兼顾了形式化表达与实用检索需求。
使用方法
使用者可根据需求选择相应配置加载数据,例如通过HuggingFace的datasets库按config_name获取特定子集。该数据集适用于多种自然语言处理任务,如数学文本挖掘、术语抽取、关系抽取以及知识图谱补全。研究人员可基于relationships子集进行链接预测,或利用terms子集构建数学领域的预训练语言模型词汇表。同时,properties和synonyms子集为深度学习模型的输入特征丰富化提供了支撑,促进了数学知识在智能教育、信息检索等领域的应用。
背景与挑战
背景概述
ontology-ontomathpro数据集诞生于数学本体论与人工智能交叉领域蓬勃发展的时期,由致力于数学知识形式化的研究团队构建,旨在捕捉数学概念、术语及其逻辑关系的复杂网络。该数据集基于OntoMathPro本体,涵盖了数学领域的核心术语、属性、同义词及关系三元组,为数学知识图谱的构建与推理提供了结构化基石。其创建紧密围绕数学信息检索、语义增强的数学搜索及自动定理证明辅助等核心问题,通过整合数学文本中的概念层级与逻辑约束,推动了数学知识的机器可读化进程。该数据集发布后,为自然语言处理在数学领域的应用提供了宝贵资源,促进了数学教育与科研中知识管理与智能问答系统的发展,成为链接数学符号世界与计算语义理解的桥梁。
当前挑战
该数据集面临的挑战多维且深刻。在领域问题层面,数学本体构建需应对概念定义的高度抽象性与符号歧义性,确保术语精确映射至逻辑结构,同时需处理数学中特有的跨域关系(如函数、定理与证明间的动态依赖),这对数据集的完备性与一致性构成严峻考验。在构建过程中,挑战尤为显著:从海量数学文献中自动抽取语义关系需依赖复杂的文本挖掘与专家知识协同,而本体演化与版本兼容性要求严格的维护机制;此外,数据规模相对有限(示例数数千级)可能限制深度学习模型的泛化能力,且不同数学子领域(如代数、几何)的术语差异加剧了本体对齐的难度。数据集的稀疏性、属性逻辑约束的复杂度以及多语言数学术语的整合,亦为后续扩展与跨学科应用埋下伏笔。
常用场景
经典使用场景
OntoMathPro本体是面向数学知识组织的领域本体,其数据集以结构化形式呈现了数学概念、关系、属性和同义词等核心组件。在自然语言处理与知识工程研究中,该数据集常被用作数学文本语义标注的基准资源,支持数学命名实体识别、术语关系抽取以及数学知识图谱构建等任务。研究人员可基于其术语与关系配置,开展本体对齐、知识融合和推理验证等经典研究,从而推动数学领域语义理解的深化。
解决学术问题
该数据集有效应对了数学知识表示缺乏统一形式化、数学文本语义歧义性高以及跨语言术语映射困难等学术挑战。通过提供规范化术语定义、层次化父类关系及属性约束,它支撑了数学本体学习、术语标准化和知识推理等方向的研究,为数学信息检索、自动问答系统及智能教育平台提供了可靠的知识底座,促进了数学文献的语义互操作性和计算可及性。
衍生相关工作
围绕该数据集,学界已衍生出数学本体自动构建与扩展研究,利用机器学习方法从数学文献中挖掘新术语关系以丰富本体。亦催生了基于该本体的数学问答系统评测任务,以及将本体与大型语言模型结合以增强数学推理能力的工作。此外,数学知识图谱的构建与嵌入研究、本体驱动的数学文档语义标注工具开发等,均以该数据集为重要起点,推动了数学信息学交叉领域的蓬勃发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务