遇见数据集

中国高考录取数据

收藏
github2026-08-28 更新2026-09-07 收录
官方服务:

资源简介:

中国高考录取数据,包括院校录取、专业录取、招生计划、一分一段、批次线及院校专业信息,覆盖30个省份,提供结构化的Excel数据。

This dataset contains China's College Entrance Examination (Gaokao) admission-related data, including college admission records, major admission records, enrollment plans, one-point score ranking data, admission batch cutoff scores, and institutional and major information. It covers 30 provinces across China and provides structured Excel-format datasets.

创建时间:
2026-08-16
原始信息汇总

数据集概述

这是一个中国高考录取相关数据的展示仓库,提供真实结构化Excel样例文件,面向志愿填报、教育研究与数据分析场景。数据由“洛沃数据”整理与维护,以公开样例为主,完整数据及持续更新由洛沃数据商城交付。

数据规模与范围

  • 覆盖地区:30个省级地区(含“全国”基础库)
  • 文件数量:612份Excel文件
  • 数据类型:8类
  • 年份跨度:2011–2026年(覆盖因地区、考试模式及官方发布进度而异)
  • 正式数据源规模:8,225,146行记录
  • 单表字段数:6至46列

数据类型目录

数据类型 文件数 主要内容
院校录取分数 290 批次、专业组、选科要求、最低分与位次、计划及录取人数
专业录取分数 140 院校与专业、专业代码、最低/平均/最高分及位次
招生计划 90 院校专业代码、选科要求、计划人数、学制、学费
历年一分一段 30 分数、本分人数、累计人数
历年高考批次线 30 科类、批次、分数线、对应位次
报考师专家版联表 30 招生计划、专业录取、院校录取和基础信息联表
全国院校基本信息 1 层次、性质、标签、硕博点、升学就业、联系方式
全国专业基本信息 1 学历层次、学科门类、专业类及专业代码

字段结构示例

  • 院校录取分数:典型17列,含省份、年份、科类、录取批次、院校名称、专业组代码、选科要求、最低分/位次、平均分/位次、最高分/位次、计划人数、录取人数等
  • 专业录取分数:典型20列,在院校录取基础上增加专业招生代码、专业名称、专业备注等
  • 招生计划:典型15列,含计划人数、学制、学费等
  • 全国院校基本信息:典型25列,含院校代码、办学层次、院校标签、硕博点数量、升学率、保研率、就业率、学科评估、官方网站等

覆盖地区

  • 华东:上海、江苏、浙江、安徽、福建、江西、山东
  • 华北:北京、天津、河北、山西、内蒙古
  • 华中:河南、湖北、湖南
  • 华南:广东、广西、海南
  • 西南:重庆、四川、贵州、云南
  • 西北:陕西、甘肃、青海、宁夏、新疆
  • 东北:辽宁、吉林、黑龙江
  • 基础库:全国院校与专业信息

数据组织与检索

  • 文件按省份归档,每个省级目录包含该地区各类型的Excel样例
  • 提供samples-manifest.json机器可读清单,记录每个文件的路径、数据类型、地区、年份、行列数、文件大小及SHA-256校验值
  • 附带Python检索示例,可用于程序化获取特定地区与类型的数据文件

适用场景

  • 志愿填报产品原型开发(院校录取、专业录取、招生计划、院校库、专业库)
  • 冲稳保与录取概率研究(历年最低分位次、一分一段、计划与录取人数)
  • 同位次与趋势分析(一分一段、院校/专业录取、批次线)
  • 教育咨询工作台(专家版联表、院校信息、专业信息)
  • 数据课程教学与可视化分析

数据质量特点

  • 使用明确中文表头,便于筛选与二次处理
  • 文件命名按“数据类型_地区_年份”统一规范
  • 文件来源可追踪,官方清单记录文件维度信息
  • 所有公开文件提供SHA-256哈希值用于完整性校验
  • 字段结构与洛沃数据商城正式产品保持一致

使用限制说明

仓库内容用于数据结构评估、学习研究与购买决策,未经书面授权不得批量转载、转售或用于构建同类商业数据产品。数据可能因主管部门后续发布或勘误调整,涉及志愿填报实际决策时应同时核验省级考试院、院校招生网等官方最新信息。

搜集汇总
数据集介绍
中国高考录取数据 数据集图片
构建方式
该数据集由洛沃数据整理,覆盖全国30个省级行政单位,时间跨度从2011年至2026年,整合了院校录取、专业录取、招生计划、一分一段、批次线等八类核心数据,共612份Excel文件,正式记录逾817万行。数据严格按省份、年份和业务类型归档,每份文件均包含真实可解析的字段,如院校代码、专业组、选科要求、最低分与位次等。文件命名遵循统一规范,并提供包含路径、行列数、SHA-256的机器可读清单,确保数据的结构性和可追溯性。
特点
数据集的特点在于其多维整合与细致分层。不仅涵盖传统的院校录取分数,还纳入专业录取、招生计划及历年一分一段等微观数据,单表字段数可达6至46列,保留了各省考试模式特有的批次、专业组等信息。同时,该数据具备时间序列功能,支持跨年度趋势追踪与同位次换算,并区分了公开样例与正式数据源,方便用户进行质量评估。此外,附有全国院校与专业基础信息,为深度教育研究提供了宽泛而扎实的数据底座。
使用方法
用户可直接使用Excel、WPS、Python、R及Power BI等工具打开或分析公开的样例文件,快速验证字段结构是否匹配需求。仓库提供的samples-manifest.json清单支持程序化检索,例如在Python中通过json模块读取文件,即可按数据类型、省份筛选需要的文件。完整数据及最新年份服务可在洛沃数据商城按需选购。对于志愿填报等实际应用场景,建议结合官方发布的最新信息进行核验,以提升决策的科学性与准确性。
背景与挑战
背景概述
中国高考作为全国范围内规模最大、影响最深远的选拔性考试,其录取数据蕴含着丰富的教育、经济与社会信息。洛沃数据(上海既白网络科技有限公司)自2011年起系统性地构建了覆盖30个省级行政区的中国高考录取数据库,时间跨度延伸至2026年,囊括院校录取、专业录取、招生计划、一分一段、批次线等八类核心数据,正式数据源记录超过822万行。该数据集的核心研究问题在于揭示高考录取的宏观规律、专业冷热变迁及区域教育资源的分布差异,为教育政策制定、院校招生策略优化以及考生志愿填报提供数据驱动的决策支撑。其结构化的Excel格式与标准化的字段设计,极大降低了教育研究者与数据分析师的数据获取门槛,已然成为高考研究领域不可或缺的基础性资源,推动了教育数据科学的实证研究进程。
当前挑战
面对中国高考复杂的制度环境,数据集的构建与应用面临多重挑战。首先,各省份在考试模式、批次设置、选科规则上存在显著差异,且相关政策调整频繁,如何在不失统一性的前提下精准刻画各省特有的录取规则,成为数据标准化的一大难题。其次,官方发布的原始数据格式多样、颗粒度不一,数据清洗与整合工程浩大,需耗费大量人力确保字段对齐与逻辑一致。此外,作为面向公众的参考数据,其质量校验机制尤为关键,如何克服信息滞后与潜在偏差,确保院校更名、专业调整等动态信息的时效性与准确性,是持续挑战。在应用层面,数据集虽能支持横向对比与纵向趋势分析,但教育决策的复杂性要求数据必须与其他社会经济指标相关联,这对数据的维度扩展与深度挖掘提出了更高要求。
常用场景
经典使用场景
中国高考录取数据集的经典应用场景聚焦于志愿填报支持与升学决策分析。研究者和产品开发者凭借其中包含的院校录取分数、专业录取详情、招生计划及一分一段等结构化信息,可构建冲稳保梯度推荐模型,对历年录取位次与计划人数进行纵向对比,辅助考生科学定位目标院校。该数据集亦可支撑跨省份、跨年份的录取趋势挖掘,为教育咨询机构提供数据基石,从而将庞杂的高考信息转化为直观、可操作的策略指引。
解决学术问题
此数据集有效回应了高等教育入学研究中长期存在的数据碎片化与获取成本高昂等难题。通过整合三十个省份从2011年至2026年的录取数据、批次线与院校专业基础信息,其字段设计严谨且覆盖广泛,为学术探究提供了统一的量化基础。学者得以便利地分析专业冷热变迁、地域间教育资源分配及新高考选科模式对录取格局的影响,从而深化对于教育公平、人才流动及政策效应的实证理解。
衍生相关工作
围绕该数据集,已衍生出一系列富有影响力的研究工作与工具。在学术层面,催生了关于录取分数线空间分布规律、院校专业组设置与考生选择行为关联性的计量分析。在应用层面,激发了基于机器学习的录取概率预测算法,以及可视化的同位次换算与趋势分析平台。此外,清单文件与Python检索接口的提供,推动了可复现的数据分析流程建立,为后续开展大规模比较教育研究树立了范式,并持续输出方法学洞见。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务