遇见数据集

Genesis-knowledge

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

Genesis Knowledge 是一个结构化符号知识数据集,属于 Genesis 项目。该数据集旨在为推理引擎、知识图谱项目、教育工具以及符号知识表示研究提供可扩展的、结构化的知识库。数据以简单、可读的 .kc(Knowledge Concept)格式存储,包含概念、属性、关系、类别和元数据。知识按领域组织,当前涵盖动物、历史、杂项、人物、科学、技术等六大领域,每个领域下包含多个 .kc 文件。每个概念记录包括:概念名称、类型、属性、关系、别名、描述、类别、标签、元数据以及置信度值。数据集强调显式事实和关系,而非自然语言回答。设计目标为人类可读、易于扩展、结构化而非自由文本、概念间显式关系、适合编译为优化的知识图谱,并可扩展到非常大的概念集合。当前数据集中包含的知识涉及动物、地理、人物、物理、Linux、操作系统、软件、技术、公司以及 Genesis 相关概念。该数据集处于活跃开发中,预计未来将显著扩展。

Genesis Knowledge is a structured symbolic knowledge dataset that is part of the Genesis project. It aims to provide a scalable, structured knowledge base for reasoning engines, knowledge graph projects, educational tools, and symbolic knowledge representation research. The data is stored in a simple, readable .kc (Knowledge Concept) format, containing concepts, attributes, relations, categories, and metadata. Knowledge is organized by domains, currently covering six major domains: Animals, History, Miscellaneous, People, Science, and Technology, each containing multiple .kc files. Each concept record includes: concept name, type, attributes, relations, aliases, description, category, tags, metadata, and confidence value. The dataset emphasizes explicit facts and relationships rather than natural language answers. Design goals are human-readable, easy to extend, structured rather than free text, explicit relationships between concepts, suitable for compilation into optimized knowledge graphs, and scalable to very large concept collections. The current dataset includes knowledge about animals, geography, people, physics, Linux, operating systems, software, technology, companies, and Genesis-related concepts. The dataset is under active development and is expected to expand significantly in the future.

创建时间:
2026-08-01
原始信息汇总

Genesis Knowledge 数据集总结

数据集概述

Genesis Knowledge 是一个为 Genesis 项目设计的结构化符号知识数据集,旨在以人类可读的 .kc 格式存储概念、属性、关系、类别和元数据,供推理引擎、知识图谱项目、教育工具及符号知识表示研究使用。其核心目标是存储显式的事实和关系,而非自然语言回答。

数据结构

知识按领域组织,根目录为 knowledge/,当前包含以下子目录:

  • animals/
  • history/
  • misc/
  • people/
  • science/
  • technology/

每个目录下包含一个或多个 .kc(Knowledge Concept)文件。例如,technology/ 目录下包含:

  • companies.kc
  • distributions.kc
  • genesis_projects.kc
  • linux.kc
  • proprietary.kc
  • software.kc
  • supporting.kc

知识格式

每个概念包含结构化信息,具体包括:

  • 概念名称(Concept name)
  • 类型(Types)
  • 属性(Properties)
  • 关系(Relationships)
  • 别名(Aliases)
  • 描述(Descriptions)
  • 类别(Categories)
  • 标签(Tags)
  • 元数据(Metadata)
  • 置信度值(Confidence values)

示例格式如下: text CONCEPT Linux TYPE Kernel PROPERTY Open Source PROPERTY Unix Like RELATION Creator Linus Torvalds RELATION UsedBy Ubuntu CATEGORY technology

设计目标

  • 人类可读性强
  • 易于扩展
  • 使用结构化而非自由文本
  • 概念间关系明确
  • 适合编译为优化的知识图谱
  • 可扩展至大规模概念集合

当前领域

数据集目前涵盖以下知识领域:

  • 动物(Animals)
  • 地理(Geography)
  • 人物(People)
  • 物理学(Physics)
  • Linux
  • 操作系统(Operating systems)
  • 软件(Software)
  • 技术(Technology)
  • 公司(Companies)
  • Genesis 相关概念(Genesis-related concepts)

数据集预计将随时间不断扩展。

贡献指南

欢迎贡献。贡献时需遵循以下原则:

  • 使用 .kc 格式添加新概念
  • 保持信息事实准确、结构良好
  • 避免重复概念
  • 尽可能使用已有关系类型
  • 将概念组织到合适的文件夹中

状态

该数据集处于积极开发阶段,预计随着更多领域和概念的添加,其规模将显著增长。

二维码
社区交流群
二维码
科研交流群
商业服务