LinkedHypernymsDataset
收藏资源简介:
LinkedHypernymsDataset提取框架生成RDF数据集,包含DBpedia资源(作为主体)及其类型(作为对象)。该框架返回多个数据集:Core - 资源类型为DBpedia本体类,基于扩展数据集和超类模式匹配(最准确,最具体);Inference - 资源类型为DBpedia本体类,基于扩展数据集和统计类型推断算法(准确性较低,具体性较低);Extension - 资源类型为其他资源,基于原始数据集和维基百科API的第一个超类词命中(类型具体性最高);Raw - 所有超类为从维基百科资源摘要的第一句话中提取的字符串文字。
The LinkedHypernymsDataset extraction framework generates RDF datasets containing DBpedia resources (as subjects) and their types (as objects). This framework returns multiple datasets: Core - resource types are DBpedia ontology classes, based on extended datasets and superclass pattern matching (most accurate and specific); Inference - resource types are DBpedia ontology classes, based on extended datasets and statistical type inference algorithms (less accurate, less specific); Extension - resource types are other resources, based on the original dataset and the first hypernym hit from the Wikipedia API (highest type specificity); Raw - all hypernyms are string literals extracted from the first sentence of Wikipedia resource summaries.
数据集概述
数据集名称: LinkedHypernymsDataset
数据集描述: LinkedHypernymsDataset 是一个 RDF 数据集,由 DBpedia 资源(作为主体)及其类型(作为对象)组成。该数据集通过提取框架生成,该框架返回以下几个子数据集:
- Core - 资源类型为 DBpedia 本体类,基于扩展数据集和超类模式匹配构建(最准确,最具体)。
- Inference - 资源类型为 DBpedia 本体类,基于扩展数据集和统计类型推断算法构建(准确性较低,具体性较低)。
- Extension - 资源类型为其他资源,基于原始数据集和维基百科 API 的第一个超类词命中构建(类型具体性最高)。
- Raw - 所有超类为从维基百科资源摘要的第一句话中提取的字符串文字。
数据集生成过程: 提取过程尝试为每个 DBpedia 资源找到超类(通过 HypernymExtractor 模块),将其转换为另一个 DBpedia 资源,然后映射到 DBpedia 本体类(通过 OntologyCleanup 模块和 TypeInferrer 模块)。支持的语言包括英语、德语和荷兰语。
数据集结构
数据集结构包括以下主要部分:
- Core - 包含最准确和最具体的 DBpedia 本体类型。
- Inference - 通过统计类型推断算法分配的 DBpedia 本体类型。
- Extension - 资源分配的超类,从 HypernymExtractor 模块提取并映射到 DBpedia 资源。
- Raw - 包含纯文本形式的超类。
数据集结果
数据集最终生成的结果包括四个基本数据集:
- Core - 包含最准确和最具体的 DBpedia 本体类型。
- Inference - 通过统计类型推断算法分配的 DBpedia 本体类型。
- Extension - 资源分配的超类,从 HypernymExtractor 模块提取并映射到 DBpedia 资源。
- Raw - 包含纯文本形式的超类。
每个数据集都提供了不同层次的类型信息,从最具体的本体类型到原始的超类文本。




