遇见数据集

China Primary Mathematics Knowledge Graph (cn-primary-math-knowledge-graph)

收藏
github2026-07-30 更新2026-08-19 收录
官方服务:

资源简介:

面向中国义务教育小学数学的、可追溯且可验证的微知识点依赖数据集。

A traceable and verifiable micro-knowledge point dependency dataset for primary school mathematics in China's compulsory education system.

创建时间:
2026-07-21
原始信息汇总

数据集概述

一、基本信息

  • 数据集名称:中国小学数学知识图谱(cn-primary-math-knowledge-graph)
  • 数据集类型:面向中国义务教育小学数学的、可追溯且可验证的微知识点依赖数据集
  • 当前版本0.4.0-candidate.dependency-coverage(对应 Git 发布标签 candidate-0.4.0-dependency-coverage
  • 项目性质:基础设施数据,非教材、题库或教学应用
  • 在线浏览:https://wwlwgo.github.io/cn-primary-math-knowledge-graph/

二、数据规模

当前公开候选数据包含:

  • 95 个 reviewed 学习目标节点
  • 111 条 soft 依赖边
  • 19 个 课程标准能力锚点
  • 56 条 课程标准登记
  • 1 个 静态前端参考应用(知识图谱浏览器)

三、核心定位与解决的问题

该项目回答的核心问题是:学习一个知识点之前,哪些能力可能是重要前置? 主要面向学习分析系统、AI 助教和诊断工具等应用场景,提供稳定的“能力关系”数据。

具体可帮助解决:

  • 学生不会某个知识点时,可能缺失哪些前置能力
  • 学会一个知识点后,可解锁哪些后续学习目标
  • 课程标准要求下有哪些可诊断的学习目标
  • 不同教材材料中的相近内容如何映射到同一稳定能力锚点

四、数据设计原则

原则 说明
学习目标优先 节点表达可观察、可评估的学习目标,而非教材标题或单道题目
证据可追溯 每个节点和边均可追溯到课程标准、教材活动、教辅材料或审核结论,并声明证据层级
区分必需与有益 hard 表示学习必需前提,soft 表示显著有帮助但可替代的经验;当前候选版仅发布 soft
教材版本无关 教材是证据来源而非唯一真相,同一概念可映射到多个版本与学期
数据先行 核心数据为 JSON,验证工具仅使用 Python 标准库,无需运行服务
应用契约优先 应用只依赖稳定 ID、能力锚点和版本化关系,不依赖教材页码、单元或具体表述

五、数据内容结构

text data/ 已发布的数据集与版本清单 schemas/ 机器可读的数据契约(JSON Schema) scripts/ 数据集校验器与查询脚本 docs/ 路线图、数据标准、来源与治理规则 examples/ 应用层参考实现

六、数据使用方式

项目提供查询脚本,支持:

  • 验证数据集:python3 scripts/validate_dataset.py
  • 查询某知识点的前置能力:python3 scripts/query_dataset.py prerequisites <topic_id> --recursive
  • 查询某知识点可解锁的后续目标:python3 scripts/query_dataset.py unlocks <topic_id> --recursive
  • 按年级查询学习目标:python3 scripts/query_dataset.py grade G3

数据修改后需依次运行 update_manifest.pyvalidate_dataset.py

七、参考应用

项目附带一个参考应用“知识图谱浏览器”(位于 examples/graph-browser),为静态前端,演示如何消费公开 JSON 数据,支持:

  • 稳定 topicId 引用
  • capabilityAnchor 能力锚点
  • 课程标准映射
  • prerequisites / unlocks 关系展示
  • 关系覆盖审计
  • candidatesoft dependency 状态提示

八、数据来源与状态说明

  • 课程标准来源:教育部 教材〔2022〕2号(发布通知见 https://www.gov.cn/zhengce/zhengceku/2022-04/21/content_5686535.htm )
  • 当前状态:属于 candidate 候选层,非专家确认版
  • 所有依赖边目前均为 soft dependency hypotheses,表示“有显著帮助的前置经验”,不代表已由专家确认的认知必要关系
  • 项目不包含教材原件、扫描页、OCR 全文、题目、答案或私有输入文件
  • 不代表任何教材出版方的官方数据

九、许可与版权

  • 代码采用 MIT License
  • 公开数据采用数据库与自有文字分层许可
  • 第三方课程标准保留上游条款
  • 教材原文、扫描页、OCR 全文、题目、答案和受限输入不进入仓库
搜集汇总
数据集介绍
China Primary Mathematics Knowledge Graph (cn-primary-math-knowledge-graph) 数据集图片
构建方式
该数据集面向中国义务教育小学数学领域,以可追溯、可验证的微知识点依赖关系为核心,构建了一部机器可读的知识图谱。其构建遵循学习目标优先原则,每个节点代表可观察、可评估的学习目标,而非教材标题或单道题目。数据源涵盖教育部教材〔2022〕2号课程标准、多版本教材活动及教辅材料,并辅以严格的证据层级声明,确保每一条节点与边均可溯源至课标、教材或审核结论。当前候选版本(0.4.0-candidate)包含95个经审阅的学习目标节点、111条软依赖边、19个课程标准能力锚点及56条课程标准登记,所有依赖边均标记为“soft dependency hypotheses”,表征显著有帮助的前置经验,而非专家确认的认知必要条件。数据以JSON格式存储于data/目录,配以JSON Schema契约和Python标准库编写的校验器,保障了数据结构的规范性与可验证性。
使用方法
使用者可通过Python脚本与JSON数据文件便捷地探索该知识图谱。首先运行`python3 scripts/validate_dataset.py`以验证数据完整性,随后利用`query_dataset.py`进行多维度查询:如查询某知识点的递归前置能力(`prerequisites`)、后续解锁目标(`unlocks`)或按年级筛选学习目标(`grade`)。这些查询支持参数化输入,返回结构化结果,便于集成至诊断工具或学习路径规划器。对于应用层开发,可参考`examples/graph-browser`这一静态前端,通过npm安装依赖并启动本地服务,直观浏览图谱结构,其展示的契约消费模式(仅依赖稳定topicId、capabilityAnchor及课程标准映射)可作为最佳实践。数据修改需遵循规定流程:编辑`data/`下JSON文件后,先运行`update_manifest.py`更新清单,再执行验证,以确保发布数据的一致性与可追溯性。
背景与挑战
背景概述
中国小学数学知识图谱(cn-primary-math-knowledge-graph)由开源社区构建,旨在为义务教育阶段数学学习提供可追溯、可验证的微知识点依赖数据集。该项目诞生于教育信息化与人工智能辅助教学需求日益增长的背景下,核心研究问题在于如何将教材中隐性的知识逻辑显性化为机器可读的结构化数据,以支持学习诊断、路径规划及智能辅导。数据集遵循“学习目标优先”与“证据可追溯”原则,通过稳定ID与课程标准映射,实现教材版本无关的知识表示。其候选版本0.4.0包含95个学习目标节点与111条软依赖边,已初步展示出在教育技术领域的应用潜力,为后续专家确认与社区协作奠定了坚实基础。
当前挑战
该数据集面临多重挑战。在领域层面,小学数学知识点的认知依赖关系复杂且常具争议,区分“必需”与“有益”的前置经验需严谨实证,而当前仅发布soft依赖假设,缺乏专家确认的hard关系,限制了其在高 stakes 评估中的可信度。在构建过程中,证据的可追溯性要求高,需从教材、课标等多源信息中提取一致性数据,同时规避版权风险,确保不引入教材原文。此外,跨版本教材的映射与更新维护工作量巨大,需持续社区协作与审计;数据验证工具依赖Python标准库,虽提升了可访问性,但功能受限,难以满足大规模动态更新的需求。这些挑战要求项目在数据质量、治理机制与工具链上持续迭代优化。
常用场景
经典使用场景
该数据集的核心应用场景在于为智能学习系统提供精准的知识依赖关系图谱,支持学习路径规划、认知诊断与个性化推荐。研究者可基于其稳定知识点标识与能力锚点,构建知识追踪模型或自适应学习引擎,实现对学生前置能力缺失的自动识别与后续学习目标的动态解锁。其机器可读的JSON格式与配套Schema保证了跨平台的可移植性,使得各类教育应用能够无缝集成,从而在真实教学环境中实现数据驱动的精准干预。
解决学术问题
该数据集有效解决了小学数学教育中知识关系难以量化与标准化的问题,弥补了传统教材按册次、单元组织而缺乏可计算能力关系的不足。它提供了可追溯、可验证的微知识点依赖数据,使研究人员能够客观分析知识获取的先后逻辑,验证学习路径的认知合理性。通过区分必需与有益依赖,为认知科学中的学习迁移理论提供了实证数据基础,推动了教育数据挖掘与学习分析领域的理论发展。
实际应用
在实际应用中,该数据集可支撑教师备课系统、智能辅导工具及教育管理平台。教师可依据知识图谱快速定位学生薄弱环节的前置能力,设计补救教学方案;AI助教能实时推荐个性化学习资源,助力课堂差异化教学。此外,该数据集还适用于教育评估系统,将课程标准映射为可诊断的学习目标,使测评结果更具解释性和可操作性,提升教育决策的科学性。
数据集最近研究
最新研究方向
面向中国小学数学教育,构建可追溯、可验证的微知识点依赖图谱,旨在为学习分析、智能诊断与个性化路径规划提供基础设施数据。该数据集创新性地将课程标准、教材内容与能力锚点映射至稳定知识点ID,区分‘必需’与‘有益’的前置经验,并采用‘候选-审核’双层机制确保数据质量。当前聚焦于依赖边覆盖度审计(版本0.4.0候选),强调证据层级与跨教材一致性。前沿应用包括AI助教的知识点前置能力推理、学习路径动态生成及课堂诊断工具集成。其影响在于促进教育数据标准化,推动认知建模与精准教学,为智能教育系统提供开放、合规的数据根基。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务