Synthetic Education Data
收藏资源简介:
一个隐私保护的合成教育数据引擎,模拟高中数学部门,用于评估分析、仪表板开发和学习系统原型设计。该数据集包含学生、教师、课程、部分、注册、评估分数、出勤/非参与行为、Canvas风格课程工件和验证检查,生成一致的综合部门系统,并提供CSV和JSON导出格式。
A privacy-preserving synthetic educational data engine that simulates a high school mathematics department, targeted for analytical evaluation, dashboard development, and learning system prototyping. This dataset includes students, teachers, courses, sections, enrollments, assessment scores, attendance/non-participation behaviors, Canvas-style course artifacts, and validation checks, generates a consistent and comprehensive departmental system, and supports exports in both CSV and JSON formats.
数据集概述
项目名称:Synthetic Education Data(合成教育数据)
核心定位:一个保护隐私的合成教育数据引擎,用于模拟高中数学部门场景,支持评估分析、仪表板开发和学习系统原型设计。
设计目标:解决如何在不可用真实学生数据、LMS导出数据、成绩册、教师/班级/学校隐私信息的情况下,展示教育分析基础设施的实际问题。
数据集结构
-
数据规模:当前版本生成一个基准学年(2025-2026)的合成数学部门数据,包含:
- 287名合成学生
- 5名合成教师
- 9门数学课程
- 25个教学班(sections)
- 287条活跃选课记录(enrollments)
- 8个合成Canvas风格课程JSON档案
- 14个评估作业字段
-
数据层次:嵌套的教育数据结构,包括学生、教学班、课程、教师和选课记录。
数据生成机制
-
统计设计:将部门结构与评估测量过程分离。通过年级、课程、教学轨道、教师和教学班建立评估上下文,分别模拟出勤/未参与行为和潜在学业准备度及观察到的评估分数。
-
评估作业设计:
Assignment 01:学年开始评估。出勤学生的分数基于年级特定的公共安全校准锚点生成,未参与行为单独建模,观察到的零分代表未参与而非学业表现差。Assignment 02:首次应用可复用纵向分数引擎,根据先验证据更新学业准备度,加入学年增长、课程/轨道及教师/教学班效应、回归均值行为,并分离增长噪声与评估观察噪声。- 若学生错过评估窗口,观察分数为0且学业准备度不更新。
- 作业03-14当前留空,待后续纵向转换实现并验证后填充。
-
生成工作流:合成数学部门状态 → 合成ASMA成绩册 → 合成课程、教学班和选课导出 → 验证 → 下游评估分析。
标准数据文件
- 规范源文件:
data/synthetic/synthetic_school_state.json(规范状态对象) - CSV制品:
data/synthetic/synthetic_asma_gradebook.csv(全校数学评估成绩册)data/synthetic/synthetic_math_courses.csv(数学课程)data/synthetic/synthetic_math_sections.csv(数学教学班)data/synthetic/synthetic_math_enrollments.csv(数学选课记录)
- Canvas风格课程档案:
data/synthetic/canvas_course_profiles/(8个JSON配置文件)
验证功能
-
验证脚本:
scripts/validate_synthetic_math_department.py,负责检查:- 数据形状、模式、选课一致性
- 分数边界、作业分配策略
- Canvas风格档案结构
- 公共安全约束
-
诊断报告:
reports/grade-level-calibration/grade-level-calibration-report.md展示用于支持弱年级先验的聚合校准诊断。
公共安全与隐私
- 设计为从头开始即公共安全,仅包含合成数据和通用方法。
- 禁止提交真实学生信息、LMS导出、私有评估制品、教师姓名、内部教学班标签、学校私有路径或私有校准文件。
- 公共安全边界详见
docs/public-safety.md。
与下游项目关系
- 本仓库:负责数据生成与验证。
- 下游
assessment-intelligence项目:负责可视分析、仪表板、分布检查、增长诊断、决策支持报告和管理层解读。
适用场景
- 评估分析师、教育数据分析师、院校研究、学习分析与教育科技数据/产品岗位的求职作品集展示。
- 适合需要在不泄露真实数据前提下演示统计模拟、隐私感知数据设计、领域建模、验证工作流和分析基础设施的场景。





