遇见数据集

Synthetic Education Data

收藏
github2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

一个隐私保护的合成教育数据引擎,模拟高中数学部门,用于评估分析、仪表板开发和学习系统原型设计。该数据集包含学生、教师、课程、部分、注册、评估分数、出勤/非参与行为、Canvas风格课程工件和验证检查,生成一致的综合部门系统,并提供CSV和JSON导出格式。

A privacy-preserving synthetic educational data engine that simulates a high school mathematics department, targeted for analytical evaluation, dashboard development, and learning system prototyping. This dataset includes students, teachers, courses, sections, enrollments, assessment scores, attendance/non-participation behaviors, Canvas-style course artifacts, and validation checks, generates a consistent and comprehensive departmental system, and supports exports in both CSV and JSON formats.

创建时间:
2026-06-06
原始信息汇总

数据集概述

项目名称:Synthetic Education Data(合成教育数据)

核心定位:一个保护隐私的合成教育数据引擎,用于模拟高中数学部门场景,支持评估分析、仪表板开发和学习系统原型设计。

设计目标:解决如何在不可用真实学生数据、LMS导出数据、成绩册、教师/班级/学校隐私信息的情况下,展示教育分析基础设施的实际问题。


数据集结构

  • 数据规模:当前版本生成一个基准学年(2025-2026)的合成数学部门数据,包含:

    • 287名合成学生
    • 5名合成教师
    • 9门数学课程
    • 25个教学班(sections)
    • 287条活跃选课记录(enrollments)
    • 8个合成Canvas风格课程JSON档案
    • 14个评估作业字段
  • 数据层次:嵌套的教育数据结构,包括学生、教学班、课程、教师和选课记录。


数据生成机制

  • 统计设计:将部门结构与评估测量过程分离。通过年级、课程、教学轨道、教师和教学班建立评估上下文,分别模拟出勤/未参与行为和潜在学业准备度及观察到的评估分数。

  • 评估作业设计

    • Assignment 01:学年开始评估。出勤学生的分数基于年级特定的公共安全校准锚点生成,未参与行为单独建模,观察到的零分代表未参与而非学业表现差。
    • Assignment 02:首次应用可复用纵向分数引擎,根据先验证据更新学业准备度,加入学年增长、课程/轨道及教师/教学班效应、回归均值行为,并分离增长噪声与评估观察噪声。
    • 若学生错过评估窗口,观察分数为0且学业准备度不更新。
    • 作业03-14当前留空,待后续纵向转换实现并验证后填充。
  • 生成工作流:合成数学部门状态 → 合成ASMA成绩册 → 合成课程、教学班和选课导出 → 验证 → 下游评估分析。


标准数据文件

  • 规范源文件data/synthetic/synthetic_school_state.json(规范状态对象)
  • CSV制品
    • data/synthetic/synthetic_asma_gradebook.csv(全校数学评估成绩册)
    • data/synthetic/synthetic_math_courses.csv(数学课程)
    • data/synthetic/synthetic_math_sections.csv(数学教学班)
    • data/synthetic/synthetic_math_enrollments.csv(数学选课记录)
  • Canvas风格课程档案data/synthetic/canvas_course_profiles/(8个JSON配置文件)

验证功能

  • 验证脚本scripts/validate_synthetic_math_department.py,负责检查:

    • 数据形状、模式、选课一致性
    • 分数边界、作业分配策略
    • Canvas风格档案结构
    • 公共安全约束
  • 诊断报告reports/grade-level-calibration/grade-level-calibration-report.md 展示用于支持弱年级先验的聚合校准诊断。


公共安全与隐私

  • 设计为从头开始即公共安全,仅包含合成数据和通用方法。
  • 禁止提交真实学生信息、LMS导出、私有评估制品、教师姓名、内部教学班标签、学校私有路径或私有校准文件。
  • 公共安全边界详见 docs/public-safety.md

与下游项目关系

  • 本仓库:负责数据生成与验证。
  • 下游 assessment-intelligence 项目:负责可视分析、仪表板、分布检查、增长诊断、决策支持报告和管理层解读。

适用场景

  • 评估分析师、教育数据分析师、院校研究、学习分析与教育科技数据/产品岗位的求职作品集展示。
  • 适合需要在不泄露真实数据前提下演示统计模拟、隐私感知数据设计、领域建模、验证工作流和分析基础设施的场景。
搜集汇总
数据集介绍
Synthetic Education Data 数据集图片
构建方式
该数据集通过模拟一个高中数学部门的完整教育生态系统构建而成,其核心思想是将教学组织结构与评估测量过程相分离。首先,生成虚拟的学生、教师、课程、班级及选课记录,构建出连贯的教学部门状态。在此基础上,进一步引入不同学期评估任务,如期初的Assignment 01和基于可复用纵向分数引擎的Assignment 02。在分数模拟过程中,独立建模出勤与非参与行为,并将其与学术表现区分开来,同时纳入课程轨迹、教师效应、班级差异、成长因子、测量误差和回归均值等复杂统计因素。最终,所有数据汇聚到一个规范的JSON状态对象中,并据此生成可供下游分析使用的CSV和JSON制品。
特点
该数据集的最大特色在于其高度仿真性与隐私安全性并重。它不仅模拟了课程、班级、选课等基本教学结构,还细致刻画了Canvas风格课程档案、缺勤导致的零分记录(不代表学业证据)以及多维度的统计效应。生成器采用了贝叶斯式的准备度更新机制,使纵向分数具备跨学期复用性。此外,数据集内置了严格的验证流程,用于检查记录数量、模式一致性、分数边界及公共安全约束,确保合成数据既符合教育数据建模的学术严谨性,又完全规避真实学生信息的泄露风险,可直接用于公开演示与分析。
使用方法
用户可通过简单的命令行操作快速生成整套合成数据。运行`make all`命令即可一次性完成数据生成与验证,或分别使用`make generate`和`make validate`执行单步流程。核心输出包括规范的学校状态JSON文件`synthetic_school_state.json`,以及全校数学评估成绩册、课程、班级和选课记录的CSV文件。同时,还生成Canvas课程档案。项目仅依赖Python标准库,无需额外安装。用户也可通过指定私有成绩册路径运行`make calibrate-grade-level`生成年级校准诊断,该操作仅输出聚合性公共安全诊断结果,不暴露任何原始数据。建议优先查阅`docs/methodology.md`理解数据生成逻辑,并检查`synthetic_school_state.json`以掌握完整状态对象。
背景与挑战
背景概述
在教育数据挖掘与学习分析领域,如何在不暴露受保护的学生隐私数据的前提下,构建可复用的评估分析基础设施,始终是一项核心挑战。Synthetic Education Data 项目由一位专注于教育数据分析的研究者于近期创建,旨在通过模拟一个完整的高中数学系生态——涵盖学生、教师、课程、班级、选课、评估成绩及出勤行为——为仪表盘开发、学习系统原型设计及评估分析提供公开安全的合成数据基础。该项目核心解决的研究问题是如何在严格保护隐私边界的同时,生成具有统计真实性的多层嵌套教育数据结构,并支持纵向评分引擎的贝叶斯式就绪度更新。其影响力在于为无法获取真实LMS导出数据的教育技术从业者、评估分析师及学术研究人员,提供了可复现、可验证的合成数据生成与验证框架,填补了教育数据公开演示与隐私保护之间的空白。
当前挑战
当前数据集面临的核心挑战涵盖两个维度。在领域问题层面,其旨在解决的挑战是如何在合成教育数据中精细分离学业表现与出勤行为对观测分数的贡献,避免将‘零分’简单等同于学术证据,同时需模拟课程轨道、教师效应、班级异质性、增长噪声及回归均值等复杂统计现象,以逼近真实学校评估系统的动态特征。在构建过程中,主要挑战包括:设计一套可复用的纵向评分引擎,在保留学生就绪度更新的同时确保每次评估的观测误差与增长噪声可被独立建模;实现跨年级校准诊断以支撑弱先验假设,且校准过程中仅输出聚合统计量,杜绝任何私有标识符或行级别数据的泄露;以及确保生成的287名合成学生、25个班级、14个作业字段的数据结构在模式一致性、选课逻辑及隐私安全约束下通过严格验证,为下游分析提供无偏的公开工件。
常用场景
经典使用场景
在计算社会科学与学习分析学交叉领域,该合成教育数据集为隐私保护下的教育数据基建提供了典范性解决方案。其核心应用场景涵盖高中数学部门的评估分析、仪表盘开发以及学习系统原型构建。通过模拟包含学生、教师、课程、班级、选课及成绩等多层级教育生态的连贯数据体系,研究者得以在不触及真实受保护学生数据的前提下,复现Canvas风格的全校数学评估成绩册,从而为教育数据科学模型的验证与演示开辟了安全合规的试验场。
实际应用
在实际教育管理与技术应用中,该数据集扮演着安全沙箱的角色。数据产品团队可基于此模拟的数学部门状态,安全地开发并测试学业进展仪表盘、分布诊断报告及领导层决策支持工具。分析师能够在不触及原始LMS导出文件或真实成绩簿的情境下,演练选课一致性检查、分数边界验证以及Canvas风格档案的生成流程。这种可复用的公共安全数据基建,尤其服务于评估分析师、教育数据分析师及教育科技产品角色的作品集展示与技能演示。
衍生相关工作
该数据集孵化了一套衔接紧密的衍生工作生态。其下游配对的assessment-intelligence项目专门负责可视化分析、增长诊断与决策支持报告层的呈现,形成从数据生成到洞察解释的完整链路。围绕本数据集,衍生出包含生成逻辑文档、年级校准诊断报告、Canvas风格课程档案、以及验证检查脚本在内的一系列方法论制品。这些构成了教育数据科学领域内一个高度自洽的范例,推动了隐私优先设计原则在教育计算研究中的制度化实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务