遇见数据集

Synthetic Education Data

收藏
github2026-06-09 更新2026-06-24 收录
官方服务:

资源简介:

一个保护隐私的合成教育数据引擎,模拟高中数学部门,用于评估分析、仪表板开发和学习系统原型设计。它生成连贯的合成部门系统,包括学生、教师、课程、部分、注册、评估分数、出勤/非参与行为、Canvas风格课程工件和验证检查,旨在提供公开安全的数据工作流,而无需发布受保护的学生数据。

A privacy-preserving synthetic educational data engine that simulates high school mathematics departments, designed for evaluating analytics, dashboard development, and learning system prototyping. It generates coherent synthetic departmental systems encompassing students, teachers, courses, sections, enrollments, assessment scores, attendance/non-participation behaviors, Canvas-style course artifacts, and validation checks, aiming to provide open and secure data workflows without releasing protected student data.

创建时间:
2026-06-06
原始信息汇总

数据集概述:Synthetic Education Data

这是一个用于教育分析领域的合成数据集生成引擎,模拟了一个高中数学部门的完整数据生态系统,旨在支持评估分析、仪表盘开发和学习系统原型设计,同时避免使用真实的受保护学生数据。

核心目标与功能

  • 隐私保护:生成不含真实学生、教师、课程等私密信息的合成数据,支持公开安全的分析工作流。
  • 结构模拟:构建嵌套的教育数据结构,包括学生、教师、课程、班级、注册信息、评估分数、出勤/未参与行为以及Canvas风格的课程数据。
  • 统计设计:将部门结构(学生、教师等)与评估测量过程分离,为纵向分数生成提供可复用的贝叶斯就绪状态更新引擎。
  • 验证:提供对数据数量、模式、注册一致性、分数范围、作业分配政策等的自动化验证。

数据结构与文件

核心数据源(JSON格式)

  • data/synthetic/synthetic_school_state.json:整个合成学校状态的权威源文件。

生成的CSV文件

  • data/synthetic/synthetic_asma_gradebook.csv:全校数学评估成绩册。
  • data/synthetic/synthetic_assessment_scores_long.csv:长格式的评估分数导出。
  • data/synthetic/synthetic_math_courses.csv:数学课程列表。
  • data/synthetic/synthetic_math_sections.csv:数学班级列表。
  • data/synthetic/synthetic_math_enrollments.csv:学生注册信息。

生成的年度数据和Canvas配置

  • data/synthetic/assessment_shells/:年度ASMA成绩册。
  • data/synthetic/canvas_course_profiles/:Canvas风格的课程配置文件。

可选的DuckDB分析仓库输出(data/marts/

  • 遵循星型模式的事实表和维度表,包括:
    • dim_studentdim_coursedim_sectiondim_teacherdim_assignment
    • fact_assessment_scorefact_lms_enrollment

统计模型与行为

  • 评估分数模拟:区分出勤/未参与和学业表现。缺席学生的分数记为0,且其潜在就绪状态不更新,但隐藏的潜在轨迹继续变化。
  • 效应建模:包含课程/方向、教师/班级效应、测量误差、观察噪音以及均值回归。
  • 纵向设计:支持七个学年的数据生成(2025-2026至2031-2032),包含学生动态(毕业生和新生替换)。
  • 校准:提供年级水平校准诊断,用于支持弱年级先验。

工作流程

  • 生成与验证
    • 使用 make all 执行完整流程,或分开执行 make generatemake validate
    • 仅依赖Python标准库。
  • DuckDB分析仓库
    • 通过 make analytics-installmake warehouse 构建本地数据库,执行SQL模型,导出公开安全的mart CSV。
    • 将合成的Canvas课程配置文件标准化为SQL原始表,并与规范的合成注册信息进行核对。
  • 可选的Supabase/Postgres部署
    • 通过 make postgres-installmake postgres-load-dry-runmake postgres-load 将验证后的星型模式mart部署到托管数据库。

当前状态与规模

  • 数据类型:合成数据,公开安全。
  • 时间跨度:七个学年(2025-2026至2031-2032)。
  • 数据规模(当前版本):
    • 696 名所有时期的学生。
    • 每学年 287 名活跃学生。
    • 每学年 5 名合成教师。
    • 9 个数学课程类别。
    • 174 个合成班级。
    • 2,009 个活跃的学生-学年注册记录。
    • 62 个合成Canvas课程JSON配置文件。
    • 14 个评估作业字段。
    • 4,018 行长格式评估分数导出。
    • 完整的DuckDB mart导出。

关键文档与入口

  • docs/methodology.md:详细的数据生成过程、评分引擎、Canvas工件和验证逻辑。
  • docs/star-schema-erd.md:DuckDB星型模式的关系图。
  • docs/data-lineage.md:数据从生成到最终报告的完整流向。
  • docs/supabase-postgres-deployment.md:Supabase/Postgres部署指南。
  • sql/examples/:包含注册、成长、缺失值、就绪状态等可读的SQL示例。
  • scripts/generate_synthetic_math_department.py:模拟逻辑的Python脚本。
  • scripts/validate_synthetic_math_department.py:验证数据形状、一致性和公共安全边界的脚本。
  • reports/grade-level-calibration/grade-level-calibration-report.md:支持弱年级先验的聚合校准诊断报告。

与下游项目的关系

此仓库是合成数据的基础层。下游的assessment-intelligence项目负责可视分析和报告层,包括仪表盘、分布检查、成长诊断和面向领导的解释报告。

搜集汇总
数据集介绍
Synthetic Education Data 数据集图片
构建方式
在保护学生隐私的前提下,该数据集构建了一个模拟高中数学部门的合成教育数据生态系统。其核心生成逻辑始于一个规范化的部门状态对象,该对象囊括了学生、教师、课程、班级及注册信息等实体及其嵌套关系。基于此状态,引擎通过一个可复用的纵向得分引擎,在每个评估窗口驱动学生的潜在学术准备状态,并独立于出勤行为模拟观察得分。缺失参与者得分为零,而潜在状态依然演化。整个过程由Python标准库实现,可导出可复现的CSV与JSON工件。
特点
该数据集最突出的特征在于其统计设计的精妙分层。它巧妙地将学业能力的隐藏潜在准备状态与观察到的后验准备状态相分离,并独立建模出勤与非参与行为,使得零分直观地反映缺勤而非学业证据。此外,系统还纳入了课程轨道的固定效应、教师班级的随机效应、测量噪声、增长噪声以及均值回归现象,生成了一个横跨七个学年的纵向数据流,涵盖696名模拟学生和超过4000条评估记录,极具真实性与复杂性。
使用方法
使用者可通过简洁的`make all`命令一键完成数据生成与验证,或使用`make generate`与`make validate`分步执行。生成的核心工件存放于`data/synthetic/`目录,包括主成绩册、长格式评估得分表及实体关系表。进阶用户可利用可选集成的DuckDB分析仓库运行星型模式下的SQL查询,直接导出名为`dim_student`、`fact_assessment_score`等多维分析数据集市,或将其部署至Supabase/Postgres以实现API式托管访问。
背景与挑战
背景概述
在教育数据分析领域,真实学生数据的隐私保护与模型开发之间的张力始终是核心矛盾。Synthetic Education Data项目于2025年由一支专注于教育技术基础设施的研究团队创建,旨在通过生成合成教育数据,模拟一所高中数学部门的完整生态系统,从而在不暴露任何受保护学生信息的前提下,支撑评估分析、仪表盘开发以及学习系统原型设计。该数据集的核心研究问题是如何构建一个兼具统计合理性与隐私安全性的合成数据引擎,使其能够再现学生、教师、课程、选课、评估成绩、出勤行为以及Canvas风格课程工件之间的复杂嵌套关系。通过分离隐式学业准备状态与观测成绩、独立模拟出勤与非参与行为,该项目为教育数据科学领域提供了可复现的公开基准,显著推动了隐私保护下的教育分析基础设施发展。
当前挑战
该数据集面临的核心挑战首先源自教育领域问题的复杂性:真实评估数据中,学生缺席导致的零分往往被误读为学业表现,而该项目需通过独立的非参与行为建模来区分学业证据与缺失数据,这对统计生成过程的精细度提出了极高要求。其次,构建过程中的挑战在于如何在合成数据中同时纳入课程轨迹、教师效应、测量误差、回归均值、学期增长与暑期衰减等多重因素,并确保七学年纵向设计的连贯性——包括学生流失与新生补充的动态平衡、696名模拟学生的可重复状态生成,以及174个教学段与62个Canvas课程配置文件的逻辑一致性。此外,数据验证环节需严格检查计数、模式、选课一致性、分数边界与公共安全约束,任何一处统计假设的偏差都可能导致下游分析结论的失真,使得整个生成引擎的鲁棒性成为关键难题。
常用场景
经典使用场景
Synthetic Education Data 数据集的核心经典使用场景在于模拟真实高中教务部门的运作体系,为教育测评分析、仪表板开发以及学习系统原型设计提供安全、公开的合成数据支撑。该项目通过生成包含学生、教师、课程、班级、选课记录、测评成绩及出勤行为等多层级嵌套结构的数据,再现了Canvas风格课程档案与ASMA全年级成绩册。数据生成过程将缺考行为与学术表现分离建模,使得观测到的零分代表缺考而非学习失败,从而为教育数据科学中的缺失值机制研究、成绩分布诊断以及纵向成长建模提供了可复用的基准数据基础设施。
实际应用
在实际应用层面,该数据集典型地服务于教育科技机构与学校教务系统的开发与测试流程。数据团队可以将其用于搭建教育分析仪表板,测试学生成绩分布可视化、成长轨迹追踪以及缺考率统计等核心功能,而无需接触真实学生隐私数据。教育软件创业公司可利用合成数据进行Canvas学习管理系统到SQL数据仓库的对接演练,验证选课数据与测评事实表的星型模式设计是否合理。此外,这一数据集为学术评估工具的原型验证提供了安全的后端沙箱环境,使得研究人员能够在合规前提下快速迭代教育数据产品的算法逻辑与前端交互体验。
衍生相关工作
基于Synthetic Education Data的生成框架与数据规范,已衍生出一系列富有影响力的相关工作。下游的 assessment-intelligence 项目直接接续了本数据集的输出,专门负责视觉分析、仪表板渲染、成长诊断与领导层决策支持报告,构成了从数据生成到分析阐释的完整链条。数据集所定义的星型模式(dim_student, fact_assessment_score 等)已成为可复现教育数据基建的参考范例,推动了DuckDB与Supabase/Postgres双轨数据仓库方案在合成教育数据分析中的应用实践。此外,该项目开源的纵向贝叶斯能力估计引擎与缺考分离建模策略,为后续教育测评研究中关于缺失数据处理、成长噪声分解以及年级水平校准诊断的方法论文献提供了可验证的技术路线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务