遇见数据集

GaokaoCompass

收藏
github2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

GaokaoCompass 是一个结构化的中国全国高考录取记录数据集,覆盖2017年至2025年所有31个省份,包括招生计划、大学录取分数线、专业级录取分数和分数排名表,旨在帮助学生、家长和研究人员基于透明、可查询的录取数据做出明智决策。

GaokaoCompass is a structured dataset of national college admission records in China, covering all 31 provincial-level administrative regions from 2017 to 2025. It includes enrollment plans, university admission cutoff scores, major-specific admission scores, and score ranking tables, aiming to assist students, parents, and researchers in making well-informed decisions based on transparent and queryable admission data.

创建时间:
2026-06-26
原始信息汇总

数据集名称

GaokaoCompass(高考录取数据平台)

数据集概览

  • 覆盖范围:中国31个省份,2017年至2025年。
  • 数据量:总计861个CSV文件,包含11,327,563行数据。
  • 覆盖完整性:2022年至2025年期间,31个省份的四类数据表均完整覆盖。

数据文件与统计

数据表 文件数 数据行数 说明
enrollment-plan 227 5,862,063 各省高校招生计划
major-admission 218 4,497,048 各高校专业录取分数
school-admission 227 763,558 各高校院校投档线
score-range 189 204,894 一分一段表(考生排名)

数据结构

数据集按照年份和省份分层组织,目录结构如下:

data/ ├── 2017/ │ ├── anhui/ │ │ ├── enrollment-plan.csv │ │ ├── school-admission.csv │ │ ├── major-admission.csv │ │ ├── score-range.csv │ │ └── meta.json │ ├── beijing/ │ └── ...(31省) ├── 2018/ └── 2025/

数据表说明

1. score-range.csv · 一分一段表

反映每个分数段的考生人数分布。

  • 字段:province(省份)、year(年份)、category(科类)、batch(批次)、control_score(批次控制线)、score(分数)、score_range(分数区间)、segment_count(本段人数)、cumulative_count(累计人数/排名)、rank_range(排名区间)。

2. enrollment-plan.csv · 招生计划

各高校在各省的招生专业和计划人数。

  • 字段:province、year、batch(批次)、category(科类)、university_code(院校代码)、university_name(院校名称)、major_group(专业组)、major_code(专业代码)、major_name(专业名称)、major_note(专业备注)、subject_req(选科要求)、plan_count(计划人数)、duration(学制)、tuition(学费,元/年)。

3. school-admission.csv · 院校投档线

各高校在各省的最低录取分数和位次。

  • 字段:province、year、category、batch、university_code、university_name、major_group、subject_req、min_score(最低分)、min_rank(最低位次)、control_score(省控线)、score_diff(批次线差)、admit_count(录取人数)、school_province(学校所在省份)、school_nature(办学性质)、is_985(是否985)、is_211(是否211)。

4. major-admission.csv · 专业录取分数

各高校各专业在各省的录取分数详情。

  • 字段:province、year、category、batch、university_code、university_name、major_group、major_code、major_name、major_note、subject_req、min_score、min_rank、max_score(最高分)、avg_score(平均分)、admit_count、school_province、school_nature、is_985、is_211。

meta.json · 统计摘要

每个省份/年份目录下包含一个 meta.json 文件,提供6类卡片的统计信息,适合直接用于前端可视化展示:

  • exam_overview:总考生人数、科类、批次控制线。
  • university_stats:院校总数、985/211/公办/民办院校数量。
  • enrollment_stats:总招生计划、院校数量、热门院校。
  • top_majors:热门专业名称、计划人数、开设院校数量。
  • score_distribution:分数分布采样(分数、本段人数、累计人数)。
  • admission_bands:各批次录取分数段(最低分、最高分、中位数)。

2025年数据覆盖

  • 28个省份:四类数据表(enrollment-plan、school-admission、major-admission、score-range)均完整。
  • 青海:仅覆盖 enrollment-plan。
  • 山西:覆盖 enrollment-plan、school-admission、score-range,缺少 major-admission。
  • 西藏:覆盖 enrollment-plan、school-admission、major-admission,缺少 score-range。

数据来源与处理

  • 来源:各省教育考试院、阳光高考平台等公开渠道。
  • 处理流程:文件发现与分类、列名标准化(30+种列名映射为统一英文)、数据清洗(科类标准化、数值安全转换、代码去小数点)、去重(MD5文件去重+专业条目级去重)、年份提取、质量验证(空值检查、错误汇总、完整性报告)。

应用场景

  • 考生志愿填报:根据分数和排名查询可报考的院校和专业。
  • 录取趋势分析:历年分数线、招生人数变化趋势可视化。
  • 院校对比:985/211/公办/民办院校在各省的录取难度对比。
  • 专业热度分析:各专业招生计划人数和开设院校数量统计。
  • 教育研究:高考数据的学术研究和政策分析。

使用方式

  • 从Hugging Face加载:使用 datasets 库,通过 load_dataset("choucsan/Gaokao-Compass-11M") 直接加载。
  • 直接读取CSV:使用 pandas 库读取本地CSV文件,例如 pd.read_csv("data/2024/zhejiang/enrollment-plan.csv")
  • 使用meta.json:以JSON格式读取,获取预计算的统计信息。

许可证

MIT License。

搜集汇总
数据集介绍
GaokaoCompass 数据集图片
构建方式
高考录取数据平台GaokaoCompass的构建过程始于从各省教育考试院及阳光高考平台等公开渠道采集原始数据。随后,项目采用一套完整的ETL流水线进行精细化处理:首先通过文件发现算法自动扫描并分类各省的Excel文件,识别出招生计划、院校投档线、专业录取分数和一分一段表四种类型;接着执行列名标准化,将30余种原始中文列名统一映射为规范的英文字段;再依次进行科类归一化、数值类型安全转换及代码字段的小数点去除等清洗操作;最后借助MD5文件去重与基于关键字段的行级去重策略,辅以空值率与数据完整性校验,完成数据质量的严格把控,最终形成覆盖31省份、跨度九年的结构化数据集。
特点
该数据集最显著的特征在于其全面性与精细化程度。它囊括了长达九年的时间跨度与全国所有省份的录取信息,数据规模高达1100余万行,且2022年至2025年实现了四个核心数据表的全覆盖。每一份数据均被组织为结构清晰的CSV文件,并辅以丰富的元信息字段,例如院校的985/211标签、办学性质、学制与学费等,为多维度分析提供了坚实基础。此外,每个省份与年份目录下均包含预计算了六类统计摘要的meta.json文件,可直接服务于前端可视化展示,极大提升了数据的可用性。
使用方法
使用者可通过多种路径灵活调用该数据集。推荐通过Hugging Face平台加载整个数据集,仅需一行Python代码即可自动获取全部数据。对于有特定分析需求的场景,也可直接读取本地CSV文件,借助Pandas等工具进行高效查询,例如按分数查询排名、根据专业名称筛选招生计划,或利用院校名称检索录取分数线。数据集中预置的meta.json文件则支持快速提取宏观统计信息,便于构建数据看板或进行趋势概览。这种多层次的使用方式兼顾了批量处理与灵活探索的不同需求。
背景与挑战
背景概述
高考作为中国高等教育人才选拔的核心机制,其录取数据的系统化整合对于教育公平性研究与志愿填报决策具有深远意义。GaokaoCompass数据集由研究团队于近年创建,覆盖2017至2025年间全国31个省份的招生计划、院校投档线、专业录取分数及一分一段表,累计包含超过1130万条记录,总数据文件达861个。该数据集直面高考录取信息碎片化、格式不统一的核心研究问题,通过标准化处理将分散于各省教育考试院与阳光高考平台的异构原始数据转化为结构化资源,为考生、家长及教育研究者提供了透明、可查询的录取信息参考。其影响力体现在为志愿填报、录取趋势分析、院校对比及教育政策研究等多元场景奠定了数据基础,成为理解中国高考录取生态的重要枢纽。
当前挑战
该数据集所解决的领域挑战在于高考录取数据长期存在的壁垒:各省数据格式与发布标准差异显著,原始Excel中列名变体超30种,科类划分与批次定义不统一,信息碎片化导致跨省份、跨年度的纵向与横向分析寸步难行。构建过程中则面临多重技术阻碍:首先,需从海量异构原始文件中自动发现并精准分类四大类表格;其次,须将纷繁的列名映射为统一英文字段,同时完成科类标准化、数值安全转换及代码字段小数点剥离等清洗任务;此外,还需基于MD5与专业内容双重策略进行去重,并应对部分省份某些年份数据缺失(如青海2025年缺失院校投档线与专业录取表)的完整性问题,最终通过空值率检查与错误汇总保障数据质量,其工程复杂度可见一斑。
常用场景
经典使用场景
GaokaoCompass数据集最经典的使用场景在于为高考志愿填报提供数据驱动的智能决策支持。它整合了全国31个省份2017至2025年间的高校招生计划、院校投档线、专业录取分数及一分一段表,考生可依据自身分数与全省排名,精准检索具备录取可能性的院校与专业,从而摆脱仅凭经验或零散信息判断的局限。这一场景深度依赖数据集的跨年度、跨省份结构化特性,能够动态呈现录取分数线与位次的波动规律,辅助用户做出理性选择。
衍生相关工作
围绕GaokaoCompass衍生出一系列经典工作,涵盖数据可视化仪表盘、录取预测模型与教育政策分析报告。例如,研究者基于该数据集构建了历年录取分数线动态可视化工具,揭示不同省份间985高校的录取难度差异;机器学习团队利用专业录取分数与位次字段,训练了基于回归与排序算法的志愿录取概率预测模型。此外,部分工作聚焦于区域教育公平性量化,通过比对沿海与内陆省份的招生计划分配比例,评估优质高等教育资源的空间分布格局。这些衍生研究充分挖掘了数据集的学术潜力,推动了数据驱动教育决策的落地。
数据集最近研究
最新研究方向
在教育大数据与人工智能深度融合的浪潮下,GaokaoCompass数据集以其覆盖31个省份、横跨2017至2025年的高考录取全貌,成为支撑教育公平与精准决策的关键基石。当前研究前沿聚焦于利用其结构化分表数据(招生计划、院校投档线、专业录取分、一分一段表)构建智能志愿推荐系统,通过历史位次与分数分布的挖掘,为考生提供动态匹配方案。同时,该数据集为录取趋势的纵向分析提供了无与伦比的粒度,尤其在“双一流”政策与新高考改革背景下,其包含的985/211标识、办学性质等元数据,使得针对高校选拔机制变迁与区域教育资源配置差异的量化研究成为热点,深刻影响着教育政策评估与学术评价体系的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务