遇见数据集

atlas-of-knowledge

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

Atlas of Knowledge 是一个结构化的大学级概念数据集,旨在支持检索、教育工具开发、知识图谱分析以及经过评估的模型训练实验。该数据集包含 20,417 条记录,涵盖 17 门课程和 15 个学科。每条记录包含唯一标识符、学科、课程、主题、定义、解释字段、先决条件、类型化关系、应用、误解、假设、推理、问题、答案以及可选的领域属性。数据集包含多个子集:concepts(主要概念)、courses、prerequisites、relationships、questions、reasoning、misconceptions 和 cross_domain,并提供了确定性训练/验证/测试划分以及独立图结构。此外,该数据集还附带三个基于 PEFT/LoRA 的因果语言模型适配器(Small、Medium、Large),作为研究基线。数据收集使用声明的课程目录允许列表,并自动批准高置信度条目,来源与生成记录分离。数据集经过模式、关系、重复、许可、一致性和置信度检查,但可能遗漏细微的事实错误、文化框架、有争议的解释、来源偏见或语义重复,且初始覆盖较稀疏,以英语为主,不应用于评估广泛的教育能力。

Atlas of Knowledge is a structured university-level concept dataset designed to support retrieval, educational tool development, knowledge graph analysis, and evaluated model training experiments. The dataset contains 20,417 records covering 17 courses and 15 disciplines. Each record includes a unique identifier, discipline, course, topic, definition, explanation field, prerequisites, typed relationships, applications, misconceptions, assumptions, reasoning, questions, answers, and optional domain attributes. The dataset includes multiple subsets: concepts, courses, prerequisites, relationships, questions, reasoning, misconceptions, and cross_domain, and provides deterministic train/validation/test splits and independent graph structures. Additionally, the dataset comes with three PEFT/LoRA-based causal language model adapters (Small, Medium, Large) as research baselines. Data collection uses a declared course catalog allow list and automatically approves high-confidence entries, with sources separated from generated records. The dataset has undergone schema, relationship, duplication, licensing, consistency, and confidence checks, but may miss subtle factual errors, cultural frameworks, controversial interpretations, source biases, or semantic duplicates, and the initial coverage is sparse, primarily in English, and should not be used to evaluate broad educational capabilities.

创建时间:
2026-08-20
原始信息汇总

数据集概述

  • 名称: Atlas of Knowledge
  • 版本: 1.1.0
  • 记录数: 20,417
  • 语言: 英语
  • 许可证: CC-BY-4.0
  • 标签: 教育、知识图谱、大学、检索、结构化数据、生成式AI

内容与用途

  • 该数据集提供大学级概念的原始、结构化表示,支持检索、教育工具开发、知识图谱分析以及模型训练实验。
  • 不替代专家指导、领域参考或专业建议。

数据结构

  • 主要子集 concepts 包含:ID、学科、课程、主题、定义、解释字段、先决条件、类型化关系、应用、误解、假设、推理、问题、答案及可选领域属性。
  • 覆盖范围:17门课程、15个学科。
  • 学习单元:每个经过验证的学习面向通过12个不同的学习单元开发,包括诊断检查、案例分析与检索练习等。
  • 导出内容coursesprerequisitesrelationshipsquestionsreasoningmisconceptionscross_domain,以及确定的训练/验证/测试划分和独立图结构。

生成式模型系列

变体 基础模型 基础参数量 LoRA参数量 训练步数 验证损失
Small distilgpt2 82,723,584 811,008 2,000 0.117829
Medium gpt2-medium 354,823,168 4,325,376 1,200 0.102025
Large gpt2-large 774,030,080 8,110,080 600 0.097541
  • 模型为PEFT/LoRA因果语言模型适配器,仅基于Atlas训练记录训练,需配合指定基础模型使用。
  • 数据集包内包含两个任务特定分类器(models/目录),附指标、依赖清单和局限性说明卡片。

收集与来源

  • 采用声明的课程目录白名单,检查来源身份与兼容许可,评分课程元数据,自动批准高置信度条目。
  • 模糊来源会被隔离,来源出处与生成记录分离存储。
  • 不抓取任意网站,也不将源文本作为数据发布。

验证与局限性

  • 记录经过模式、关系、重复、许可、一致性和置信度检查。
  • 自动验证可能遗漏微妙事实错误、文化框架、争议解释、来源偏差或语义重复。
  • 分数不证明正确性。初始覆盖稀疏且仅限英语,不应用于衡量广泛教育能力。

版本与引用

  • 语义化数据集版本确保可复现构建。
  • GitHub托管源管线,完整生成版本发布在Hugging Face,包含卡片、模式、出处元数据、引文与许可证。
  • 引用时需注明精确版本,参见 CITATION.cff 和README中的现成引用格式。

数据示例

json {"id":"computer-science:algorithms:algorithmic-complexity","concept":"Algorithmic complexity","prerequisites":[],"related_concepts":[{"target_id":"mathematics:proofs:mathematical-induction","relationship":"formalizes","rationale":"Induction is a standard method for proving recurrence-based bounds."}]}

搜集汇总
数据集介绍
atlas-of-knowledge 数据集图片
构建方式
Atlas of Knowledge数据集构建于严谨的学术规范之上,其构建流程融合了课程目录白名单筛选、来源身份与许可证兼容性验证、元数据评分以及自动批准高置信度条目等多重机制,并对存疑来源实施隔离处理。数据记录与来源出处分离存储,确保数据的可追溯性与完整性。该数据集以结构化概念为核心,覆盖17门课程、15个学科,共20,417条关联记录,每条记录包含ID、学科、课程、主题、定义、解释性字段、先修条件、类型化关系、应用、误解、假设、推理、问题、答案及可选领域属性,并通过十二种不同的学习单元对每个学习面进行验证,最终生成包含确定性训练/验证/测试划分及独立图结构的多个子集。
特点
该数据集的核心特征在于其结构化的知识图谱表示与多维度验证机制。数据通过模式、关系、重复性、许可、一致性及置信度检查,确保高质量标准,但仍需警惕自动化可能遗漏的细微事实错误或不准确之处。数据集涵盖丰富的教育元素,如诊断检查、案例分析、检索练习、形式一致性检验、设计任务及同行评审协议,为学习者提供全面的认知支持。此外,其语义版本控制确保了可复现性,而确定性划分则支持可靠的模型评估。
使用方法
使用Atlas of Knowledge时,研究者可直接加载`concepts`子集,利用其结构化字段进行知识图谱分析、检索实验或教育工具开发。对于模型训练,数据集提供了独立的训练、验证、测试划分,并配套发布了基于PEFT/LoRA的小型、中型、大型三个生成模型适配器,分别基于DistilGPT2、GPT-2 Medium和GPT-2 Large,需加载对应基础模型方可使用。此外,数据集还包含`courses`、`prerequisites`、`relationships`等子集及分类器模型,便于进行特定任务。使用时应引用精确的版本号,并遵循CC-BY-4.0许可协议。
背景与挑战
背景概述
Atlas of Knowledge数据集由theworker02于2023年创建,旨在为大学水平的概念提供结构化表示。该数据集整合了17门课程和15个学科,共20,417条记录,涵盖定义、先修条件、关系、应用、误解等多个维度。其核心研究问题在于如何利用知识图谱和生成式AI技术,构建一个可检索、可分析的教育资源,以支持检索增强生成、教育工具开发和知识图谱分析。该数据集通过发布PEFT/LoRA适配器,为模型训练提供了基准,对教育技术领域和知识表示研究具有潜在影响力,推动了结构化知识在教育AI中的应用。
当前挑战
领域挑战方面,现有教育数据集多缺乏结构化语义关联,难以支持复杂推理和跨学科学习,Atlas通过引入类型化关系、先修条件和跨域连接,试图解决知识碎片化问题。构建过程中的挑战包括确保数据来源合规性,采用allowlist机制和来源审核,避免任意抓取;同时需处理概念间的复杂关系,如先修条件和跨学科关联,通过十二种学习单元进行验证。此外,自动化验证难以捕捉细微事实错误、文化偏差和语义重复,导致数据质量仍需人工审查,且初始覆盖范围刻意稀疏,英语为中心,限制了其在广泛教育能力基准上的应用。
常用场景
经典使用场景
Atlas of Knowledge 数据集以其结构化的大学级概念图谱为核心,为知识检索、教育工具开发以及知识图谱分析提供了高质量的基准资源。该数据集覆盖17门课程和15个学科,包含20,417条相互关联的记录,每条记录都包含定义、解释、先修条件、类型化关系、应用场景及常见误解等丰富信息,特别适用于构建基于概念的检索增强生成(RAG)系统、智能辅导系统以及课程知识图谱的构建与研究。其精细的字段设计,如前提关系、跨域关联和推理链,为学者们提供了一个理想的研究平台,用以探索知识表示、语义关联和学习路径优化等前沿课题。
衍生相关工作
围绕 Atlas of Knowledge,研究者已衍生出一系列经典工作。最为突出的是其配套发布的三个 PEFT/LoRA 适配器(小、中、大),它们基于 DistilGPT2、GPT-2 Medium 和 GPT-2 Large 训练,验证了低秩适配在结构化知识生成任务上的有效性,为参数高效微调领域提供了新的基准。后续研究者可基于其确定的训练/验证/测试划分,探索概念生成、关系预测、错误概念检测等下游任务。数据集的独立图谱与跨域关系设计,也激发了关于多跳推理、知识补全和课程排序的算法研究。这些衍生工作共同丰富了教育人工智能的研究生态,推动了可复现、可对比的学术进步。
数据集最近研究
最新研究方向
在生成式人工智能与知识工程深度融合的浪潮中,Atlas of Knowledge数据集以前所未有的结构化粒度,将大学层级概念的语义网络、逻辑关联与教学法单元系统化编码,为构建可解释、可溯源的学科知识图谱提供了高质量基准。其前沿研究聚焦于利用该数据集驱动参数高效微调(PEFT/LoRA)的领域自适应语言模型,探索在有限计算资源下实现精准知识问答与推理的新范式,并通过严谨的确定性数据切分与验证协议,推动检索增强生成(RAG)在教育科技场景的可靠落地。这一工作不仅提升了结构化知识资源的复用价值,也为跨学科课程设计与个性化学习路径的智能生成奠定了基础,彰显了知识图谱与生成模型协同演进的学术潜力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务