Marble Skill Taxonomy
收藏资源简介:
一个开放、结构化的分类法,涵盖小学/初中阶段儿童学习的内容,分解为细粒度的微主题,连接成先决条件图,并与国家课程标准对齐。包含1,590个微主题、3,221个先决条件边、课程对齐和领域聚类,数据以JSON格式提供。
An open, structured taxonomy encompassing learning content for children at primary and lower secondary school stages. It is decomposed into fine-grained micro-topics, which are interconnected to form prerequisite graphs, and aligned with national curriculum standards. The dataset includes 1,590 micro-topics, 3,221 prerequisite edges, curriculum alignment records, and domain clusterings, and is provided in JSON format.
数据集概览
- 名称:Marble Skill Taxonomy(儿童技能分类体系)
- 版本:v1
- 发布者:Marble(https://withmarble.com)
- 核心内容:一个开放的结构化分类体系,分解了小学阶段儿童学习的内容,包含微观知识点、先决条件图谱,并与国家课程标准对齐。
数据规模
- 知识点数量:1,590 个微观知识点(micro-topics)
- 先决条件依赖关系:3,221 条有向边(prerequisite edges)
- 学科数量:8 个学科
- 领域聚类:183 个领域摘要
学科分布
| 学科 | 知识点数量 |
|---|---|
| 科学 (Science) | 547 |
| 数学 (Mathematics) | 503 |
| 英语 (English) | 286 |
| 历史 (History) | 90 |
| 个人与社会发展 (Personal & Social Development) | 88 |
| 生活技能 (Life Skills) | 37 |
| 计算机 (Computing) | 21 |
| 学会学习 (Learning to Learn) | 18 |
数据结构与文件
所有数据以 UTF-8 JSON 格式存储于 data/ 目录下,JSON Schema 位于 schema/,清单文件 manifest.json 包含计数和 SHA-256 校验和。
| 文件 | 内容 |
|---|---|
data/topics.json |
微观知识点(图的节点) |
data/dependencies.json |
先决条件依赖关系(边) |
data/curriculum-standards.json |
来源课程标准,按课程分组 |
data/clusters.json |
面向家长的领域摘要 |
data/manifest.json |
计数、分学科统计、文件校验和 |
知识点字段
id:稳定标识符(mt_…)type:类型(概念性、程序性、表征性、语言性、元认知)subject:学科domain:领域name:名称description:描述ageRangeStart/ageRangeEnd:适龄范围centrality:中心性evidence:掌握证据标准assessmentPrompt:自然语言评估提示standards:关联的课程标准代码
依赖关系字段
topicId:依赖知识点 IDprerequisiteId:先决知识点 IDstrength:强度(hard或soft)reason:依赖原因说明
数据使用
- 导入方式:直接加载 JSON 文件,无需运行时或额外依赖。
- 验证脚本:
node scripts/validate.mjs可验证结构完整性和引用完整性。
许可证
数据集采用多许可证策略:
- 数据库层(集合、结构、ID、知识点间及知识点与标准间的关系):ODbL 1.0(开放数据库许可,允许研究与商业使用,需署名,衍生数据库需以 ODbL 开放)
- Marble 创作的文本内容(知识点的描述、名称、证据、评估提示、依赖原因、摘要):CC BY-SA 4.0(署名-相同方式共享)
curriculum-standards.json:来源于第三方框架,遵循各上游许可(详见PROVENANCE.md)
商业友好说明:ODbL 区分“衍生数据库”(修改分类体系需保持开放)与“衍生作品”(使用数据构建产品、模型或应用时可保持闭源),允许基于此数据构建商业产品而无需开源产品本身,仅需回馈对分类体系的改进。
数据排他说明
本版本故意排除了语义嵌入(可重新计算)以及任何儿童或用户数据。




